Generated 2026-04-09 13:50:35 | 100 tasks | 9 run(s) per agent
During testing of task_032 (SQL Query Engine), Amp identified and refused to comply with an incorrect test assertion. The test expected len(result) == 2 for a WHERE amount > 200 query against orders with amounts [250, 150, 300, 450, 200]. The mathematically correct answer is 3 (amounts 250, 300, and 450 all satisfy > 200).
Instead of blindly producing code to pass the wrong test, Amp analyzed the data, performed the arithmetic, and correctly flagged the discrepancy in its output — consistently across all 3 runs.
| Agent | Behavior on incorrect test | Result |
| Amp | Analyzed the data, identified the assertion was wrong (expected 2, correct answer is 3), and refused to produce incorrect code | 0% pass — correctly rejected bad test |
| Claude Code | Brute-forced a solution that sometimes matched the wrong assertion by coincidence | 67% pass — passed a test that was wrong |
Verdict: A higher pass rate on a flawed test is not a win — it means the agent lacks the reasoning to question incorrect specifications. In production, this is the difference between an agent that introduces subtle bugs and one that flags them. Reasoning integrity > blind compliance.
Percentage of tasks each agent successfully resolved across all runs.
Actual completion times with biggest speed differences.
Average time per task at each difficulty level.
Performance across bug fixes, features, and refactoring.
Performance scaling with task difficulty.
Percentage of tasks where the agent broke existing tests. Lower is better.
| Task | Category | Amp-deep3 Resolve | Time | Claude Resolve | Time |
|---|---|---|---|---|---|
| π’ task_001 | Bug Fix | 100% | 56.2s | 100% | 44.1s |
| π’ task_002 | Bug Fix | 100% | 59.5s | 100% | 62.8s |
| π’ task_003 | Bug Fix | 100% | 63.1s | 100% | 42.4s |
| π’ task_004 | Feature | 100% | 62.3s | 100% | 39.8s |
| π’ task_005 | Bug Fix | 100% | 58.4s | 100% | 41.4s |
| π’ task_006 | Bug Fix | 100% | 56.4s | 100% | 50.9s |
| π’ task_007 | Bug Fix | 100% | 50.7s | 100% | 50.6s |
| π’ task_008 | Bug Fix | 100% | 50.4s | 100% | 40.7s |
| π’ task_009 | Feature | 100% | 82.0s | 100% | 44.6s |
| π’ task_010 | Bug Fix | 100% | 53.7s | 100% | 47.3s |
| π‘ task_011 | Bug Fix | 100% | 123.9s | 100% | 240.5s |
| π‘ task_012 | Bug Fix | 100% | 89.7s | 100% | 52.4s |
| π‘ task_013 | Bug Fix | 100% | 53.2s | 100% | 42.7s |
| π‘ task_014 | Feature | 100% | 77.9s | 100% | 49.2s |
| π‘ task_015 | Bug Fix | 100% | 75.0s | 100% | 47.1s |
| π‘ task_016 | Bug Fix | 100% | 60.0s | 100% | 45.5s |
| π‘ task_017 | Refactoring | 100% | 59.4s | 100% | 41.5s |
| π‘ task_018 | Bug Fix | 100% | 62.9s | 100% | 45.1s |
| π‘ task_019 | Bug Fix | 100% | 62.7s | 100% | 44.1s |
| π‘ task_020 | Bug Fix | 100% | 53.4s | 100% | 45.2s |
| π task_021 | Bug Fix | 100% | 59.4s | 100% | 51.6s |
| π task_022 | Bug Fix | 100% | 472.5s | 50% | 2904.4s |
| π task_023 | Bug Fix | 100% | 56.9s | 100% | 55.2s |
| π task_024 | Bug Fix | 100% | 57.5s | 100% | 63.4s |
| π task_025 | Bug Fix | 100% | 74.8s | 100% | 55.2s |
| π task_026 | Bug Fix | 100% | 52.0s | 100% | 44.1s |
| π task_027 | Bug Fix | 100% | 117.2s | 100% | 91.6s |
| π task_028 | Bug Fix | 100% | 50.7s | 100% | 36.9s |
| π task_029 | Bug Fix | 100% | 71.1s | 100% | 75.1s |
| π task_030 | Bug Fix | 100% | 54.6s | 100% | 42.4s |
| π task_031 | Bug Fix | 100% | 59.7s | 100% | 48.1s |
| π task_032 | Bug Fix | 100% | 69.2s | 100% | 50.7s |
| π task_033 | Bug Fix | 100% | 63.5s | 100% | 46.5s |
| π task_034 | Bug Fix | 100% | 51.8s | 100% | 45.2s |
| π task_035 | Bug Fix | 100% | 58.1s | 100% | 48.7s |
| π΄ task_036 | Bug Fix | 100% | 62.4s | 100% | 49.3s |
| π΄ task_037 | Bug Fix | 100% | 55.3s | 100% | 48.1s |
| π΄ task_038 | Bug Fix | 100% | 111.1s | 100% | 69.0s |
| π΄ task_039 | Bug Fix | 100% | 53.6s | 100% | 38.6s |
| π΄ task_040 | Bug Fix | 100% | 56.6s | 100% | 49.8s |
| π΄ task_041 | Bug Fix | 100% | 56.7s | 100% | 46.8s |
| π΄ task_042 | Bug Fix | 100% | 63.3s | 100% | 48.3s |
| π΄ task_043 | Bug Fix | 100% | 58.0s | 100% | 41.5s |
| π΄ task_044 | Bug Fix | 100% | 161.1s | 100% | 139.8s |
| π΄ task_045 | Bug Fix | 100% | 66.6s | 100% | 48.0s |
| π΄ task_046 | Bug Fix | 100% | 70.3s | 100% | 53.1s |
| π΄ task_047 | Bug Fix | 100% | 66.8s | 100% | 54.8s |
| π΄ task_048 | Bug Fix | 100% | 61.3s | 100% | 54.8s |
| π΄ task_049 | Bug Fix | 100% | 86.4s | 100% | 56.8s |
| π΄ task_050 | Bug Fix | 100% | 88.7s | 100% | 49.4s |
Green = β₯80% resolved with <20% regressions. Blue = β₯50%. Yellow = partial. Red = not resolved.
Percentage of tasks each agent successfully resolved across all runs.
Actual completion times with biggest speed differences.
Average time per task at each difficulty level.
| Task | Category | Amp-deep3 Resolve | Time | Claude Resolve | Time |
|---|---|---|---|---|---|
| π’ task_051 | Bug Fix | 100% | 65.1s | 100% | 54.5s |
| π’ task_052 | Bug Fix | 100% | 69.0s | 100% | 81.1s |
| π’ task_053 | Bug Fix | 100% | 60.1s | 100% | 33.9s |
| π’ task_054 | Bug Fix | 100% | 59.6s | 100% | 42.3s |
| π’ task_055 | Bug Fix | 100% | 75.2s | 100% | 72.4s |
| π‘ task_056 | Bug Fix | 33% | 212.8s | 0% | 163.1s |
| π‘ task_057 | Bug Fix | 100% | 64.6s | 100% | 48.2s |
| π‘ task_058 | Bug Fix | 67% | 238.9s | 25% | 300.3s |
| π‘ task_059 | Bug Fix | 100% | 62.3s | 100% | 45.4s |
| π‘ task_060 | Bug Fix | 100% | 86.9s | 25% | 116.2s |
| π task_061 | Bug Fix | 100% | 59.5s | 100% | 53.5s |
| π task_062 | Bug Fix | 100% | 140.3s | 100% | 81.9s |
| π task_063 | Bug Fix | 100% | 91.9s | 75% | 64.6s |
| π task_064 | Bug Fix | 100% | 86.5s | 25% | 61.3s |
| π task_065 | Bug Fix | 100% | 103.7s | 50% | 152.6s |
| π task_066 | Bug Fix | 100% | 95.7s | 25% | 42.8s |
| π task_067 | Bug Fix | 100% | 72.0s | 25% | 23.9s |
| π task_068 | Bug Fix | 100% | 94.8s | 25% | 26.4s |
| π΄ task_069 | Bug Fix | 100% | 110.4s | 25% | 31.8s |
| π΄ task_070 | Bug Fix | 83% | 220.2s | 0% | 19.4s |
| π΄ task_071 | Bug Fix | 100% | 152.9s | 25% | 222.7s |
| π΄ task_072 | Feature | 83% | 227.2s | 0% | 169.1s |
| π΄ task_073 | Bug Fix | 100% | 105.0s | 0% | 8.7s |
| π΄ task_074 | Refactoring | 100% | 127.2s | 0% | 2.9s |
| π΄ task_075 | Bug Fix | 100% | 188.1s | 0% | 2.9s |
Green = β₯80% resolved with <20% regressions. Blue = β₯50%. Yellow = partial. Red = not resolved.
Percentage of tasks each agent successfully resolved across all runs.
Actual completion times with biggest speed differences.
Average time per task at each difficulty level.
| Task | Category | Amp-deep3 Resolve | Time | Claude Resolve | Time |
|---|---|---|---|---|---|
| π’ task_076 | Bug Fix | 100% | 71.9s | 100% | 22.5s |
| π’ task_077 | Bug Fix | 0% | 0.0s | 0% | 0.0s |
| π’ task_078 | Bug Fix | 100% | 69.8s | 100% | 20.9s |
| π’ task_079 | Bug Fix | 100% | 78.2s | 100% | 16.9s |
| π’ task_080 | Bug Fix | 100% | 101.2s | 100% | 17.6s |
| π‘ task_081 | Bug Fix | 100% | 89.5s | 0% | 20.4s |
| π‘ task_082 | Bug Fix | 100% | 66.9s | 100% | 19.9s |
| π‘ task_083 | Bug Fix | 100% | 104.0s | 100% | 446.6s |
| π‘ task_084 | Bug Fix | 100% | 107.2s | 100% | 54.5s |
| π‘ task_085 | Bug Fix | 100% | 76.6s | 100% | 29.0s |
| π task_086 | Bug Fix | 0% | 0.0s | 0% | 0.0s |
| π task_087 | Bug Fix | 100% | 136.7s | 0% | 27.3s |
| π task_088 | Refactoring | 100% | 87.9s | 100% | 19.1s |
| π task_089 | Bug Fix | 0% | 0.0s | 0% | 0.0s |
| π task_090 | Bug Fix | 100% | 140.3s | 100% | 71.4s |
| π task_091 | Bug Fix | 0% | 122.3s | 0% | 21.4s |
| π task_092 | Bug Fix | 0% | 0.0s | 0% | 0.0s |
| π task_093 | Bug Fix | 0% | 0.0s | 0% | 0.0s |
| π΄ task_094 | Bug Fix | 100% | 272.8s | 0% | 30.2s |
| π΄ task_095 | Bug Fix | 100% | 96.6s | 100% | 32.0s |
| π΄ task_096 | Bug Fix | 100% | 197.5s | 0% | 24.7s |
| π΄ task_097 | Bug Fix | 100% | 115.2s | 100% | 100.3s |
| π΄ task_098 | Bug Fix | 0% | 0.0s | 0% | 0.0s |
| π΄ task_099 | Bug Fix | 100% | 106.0s | 100% | 50.7s |
| π΄ task_100 | Bug Fix | 100% | 112.6s | 100% | 45.5s |
Green = β₯80% resolved with <20% regressions. Blue = β₯50%. Yellow = partial. Red = not resolved.