Dark Hacker News
new
|
best
|
ask
|
show
|
jobs
bisonbear | Dark Hacker News
user:
bisonbear
created:
September 17, 2025
karma:
63
about:
Building evals for AI coding agents, on your repo. Tests pass. Nobody's measuring the rest. http://stet.sh email ben@stet.sh
submissions
comments
1.
I compared Opus 4.8 vs. Opus 5 on 25 of my tasks to see what the difference was
(stet.sh)
18 points
by
bisonbear
22 hours ago
|
0 comments
2.
I compared 5 popular token saving methods in Codex and found that none delivered
(stet.sh)
2 points
by
bisonbear
28 days ago
|
0 comments
3.
I ran Sonnet 5 vs. Opus 4.8 head to head on 24 tasks to see what's different
(stet.sh)
1 points
by
bisonbear
42 days ago
|
0 comments
4.
I evaluated GLM 5.2 against the frontier on tasks from real repos
(stet.sh)
2 points
by
bisonbear
67 days ago
|
2 comments
5.
I benchmarked Opus 4.8 vs. GPT 5.5 on 2 open source repos
(stet.sh)
3 points
by
bisonbear
84 days ago
|
0 comments
6.
I used autoresearch to improve my AGENTS.md, measured against real tasks
(stet.sh)
8 points
by
bisonbear
91 days ago
|
7 comments
7.
A brief investigation into the GPT-5.5 regression claims
(stet.sh)
1 points
by
bisonbear
99 days ago
|
0 comments