ベンチで生成された Conveyor Courier 実装の Web エクスポート。モデル名のリンクから代表 run(採用 rep の総合スコア中央値)の実装をブラウザでプレイできる。
参照実装(採点の基準となるお手本実装): プレイする
表の数値は benchmarks/202607_delegate_implement_bench/impressions.md の本計測サマリー(各モデル 3 反復の採用値)からの転記。指標の定義は同ファイルの脚注を参照。
太字のモデル名は代表 run の機能(隠しテスト)が満点(70/70)。
| モデル | 自動テストによる評価(合算) | コード品質 (sonnet評, sol評) | 親費用+子費用(中央値) | 所要時間(中央値) | ひとこと |
|---|---|---|---|---|---|
| claude-sonnet-5 (Claude) | 290.00 | 3.8 (4.3, 3.3) — rep1 のみ 5、内部の型放棄が 2/3。乖離が大きいため代表値は Fable 裁定(クロスチェック欄参照) | $0.97 + $1.30(計 $2.27、実測) | 8.6 分 | 品質首位・無事故。型警告ゼロの run を 2 回達成 |
| swe-1.7 (Devin) | 280.06 | 4.1 (4.0, 4.3) — rep1 のみ無型 Dictionary へ退行 | $1.41 + $0(計 $1.41、込み価格) | 12.5 分 | swe-1.6 から +57.00 の大幅改善。旧 100 点 run は View 減点(クリック不能)で 98.06 に |
| gpt-5.5 (Codex) | 280.00 | 4.0 (4.3, 3.8) — rep2 のみ 5、_items 無型が 2/3 | $1.00 + $2.34(計 $3.48、換算) | 5.8 分 | 機能は全反復満点・無事故。型警告ゼロは 1/3 |
| cursor-grok-4.5 (Cursor) | 276.00 | 3.3 (3.2, 3.5) — item が typed class ⇔ 生 Dictionary で振れる | $1.25 + $0.12(計 $1.38、換算) | 4.8 分 | 最速級・最少トークン消費。View 減点ゼロで再集計 4 位へ浮上 |
| devin-deepseek-v4-pro (Devin) | 270.06 | 3.4 (3.3, 3.5) — 生 Dictionary 運用、rep2 のみ 4 | $1.53 + $2.05(計 $3.58、推測) | 11.1 分 | 機能は全反復満点だが最遅級・高コスト |
| claude-opus-4-8 (Claude) | 270.00 | 3.5 (3.3, 3.7) — View 層まで int 波及が 2/3 | $0.93 + $1.42(計 $2.35、実測) | 8.4 分 | 子は毎回機能満点。失敗は全て親・ハーネス側 |
| gpt-5.6-sol (Codex) | 268.06 | 4.2 (4.2, 4.3) — rep0 のみ _items 無型 | $1.50 + $1.77(計 $3.10、換算) | 7.1 分 | 全反復 88〜90 で安定。terra とほぼ同点・同品質で単価は 2 倍 |
| cursor-gemini-3.1-pro (Cursor) | 268.06 | 2.5 (2.8, 2.3) — 定数化しない癖が 3 ラン共通・振れ幅最大(代表値は Fable 裁定と一致) | $1.55 + $0.58(計 $2.13、換算) | 8.4 分 | 型警告の振れと停滞癖。トークン消費は Cursor 系最大 |
| cursor-kimi-k2.7-code (Cursor) | 268.06 | 4.5 (4.3, 4.7) — rep2 は Dictionary[K,V] 総称まで貫徹 | $1.44 + $0.16(計 $1.60、換算) | 10.6 分 | スプリッタの癖は非再現。型規律は最上位帯を維持 |
| gpt-5.4-mini (Codex) | 266.12 ※代表 rep1 は盤面非描画(欄参照) | 3.3 (2.8, 3.5) — 反復ごとに型後退(代表値は Fable 裁定) | $1.01 + $0.84(計 $2.04、換算) | 11.1 分 | 型警告は最少級だが遅く、決定性落ち・停滞あり |
| gpt-5.6-terra (Codex) | 266.12 ※代表 rep2 は矢印が豆腐表示(欄参照) | 4.2 (4.2, 4.3) — 定数化と盤面表現が反復間で揺れる | $1.21 + $0.91(計 $2.38、換算) | 6.3 分 | sol と同品質を約半額・より速く。効率面の有力株 |
| devin-glm-5.2 (Devin) | 266.12 ※代表 rep1 はベルト向き非表示・マウス操作不能(欄参照) | 3.8 (4.0, 3.7) — 3 ラン安定、内部 int 運用が常 | $0.90 + $1.37(計 $2.28、推測) | 5.9 分 | 速くて機能面は正確。完了報告前の停滞が玉に瑕 |
| composer-2.5 (Cursor) | 264.28 ※代表 rep1 はマウス操作不能(全ラン共通、欄参照) | 3.8 (3.8, 3.8) — _items 無型 Dictionary が 3 ラン共通 | $1.23 + $0.04(計 $1.29、換算) | 6.5 分 | 無事故は継続。実測で子費用は全モデル最安と判明 |
| composer-2.5-fast (Cursor) | 264.28 ※代表 rep2 はマウス操作不能(全ラン共通、欄参照) | 3.7 (3.7, 3.7) — 無型二重配列が 2/3 | $1.49 + $0.26(計 $1.76、換算) | 7.8 分 | 無印と同点へ浮上。ただし再計測では無印より遅い |
| gpt-5.3-codex-spark (Codex) | 264.17 | 3.6 (3.8, 3.5) — ぶれ最大(5 / 3 / 3.5) | $1.47 + 不明(計 $1.47 以上) | 4.5 分 | 速いが細部が不安定。入力トークンは gpt-5.5 比 3〜5 倍 |
| gpt-5.6-luna (Codex) | 250.55 | 3.3 (3.3, —) — 生 Dictionary 常用、rep2 のみ class 化 | $1.46 + $0.49(計 $1.95、換算) | 7.3 分 | スプリッタ退場時反転を全反復で落とす(追試 1 で effort 起因と判明、xhigh で解消) |
| swe-1.6 (Devin) | 223.06 ※代表 rep1 は矢印が豆腐表示(欄参照) | 3.8 (3.7, 4.0) — rep1 のみ型が全落ち | $0.95 + $0(計 $0.95、込み価格) | 3.9 分 | 最安(込み価格)だが機能・型とも品質最下位 |
| claude-haiku-4-5 (Claude) | 86.11(n=1) ※代表 rep1 はマウス操作不能(欄参照) | 2.7 (3.0, 2.5)(n=1) — 契約面も無型 | $1.87 + $0.66(計 $2.53、実測) | 9.3 分 | completed 1/7。停滞多発で信頼性最下位 |
ベースライン条件(委譲プロトコルを通らない別条件のため参考値。上表とは直接比較しないこと):
| 条件 | 自動テストによる評価(合算) | コード品質 (sonnet評, sol評) | 親費用+子費用(中央値) | 所要時間(中央値) | ひとこと |
|---|---|---|---|---|---|
| fable-direct (委譲なし) | 300.00 | 4.6 (4.7, 4.5) — 3 ラン安定・型規律最上位 | $2.62 + $0(計 $2.62、実測) | 5.7 分 | ベースライン: 親 Fable の直接実装 |
条件付き計測(A/B)のため、本計測サマリーの表とは直接比較しないこと。
| 条件 | 自動テストによる評価(合算) | コード品質 (sonnet評, sol評) | 親費用+子費用(中央値) | 所要時間(中央値) | ひとこと |
|---|---|---|---|---|---|
| gpt-5.6-luna@medium | 252.50 ※代表 rep0 は矢印が豆腐表示 | 3.7 (3.7, 3.7) — rep 間振れは相変わらず大(3.0/3.5/4.5) | $1.59 + $0.71(計 $2.30、換算) | 8.0 分 | デフォルト effort。旧配分ではラウンド 2 と同値だった |
| gpt-5.6-luna@xhigh | 282.23 ※代表 rep2 は headless 自己終了で View 3 件失権 | 3.8 (3.5, 4.2) — 警告ゼロ ×2 でも設計面は実質据え置き(代表値は Fable 裁定) | $1.34 + $1.75(計 $3.09、換算) | 13.0 分 | Model 層テスト満点 3/3・100 点ラン 1、View 減点(豆腐・自己終了)が新たに乗る |
条件付き計測(A/B)のため、本計測サマリーの表とは直接比較しないこと。
| 条件 | 自動テストによる評価(合算) | コード品質 (sonnet評, sol評) | 親費用+子費用(中央値) | 所要時間(中央値) | ひとこと |
|---|---|---|---|---|---|
| claude-sonnet-5@noskill | 282.00 | 4.2 (4.2, 4.2) — rep2 のみ全面型付け 4.5 | $1.35 + $1.41(計 $2.64、実測) | 9.9 分 | ベースライン。本計測 290.00 から下振れ |
| claude-sonnet-5@gq | 298.06 ※rep2 のみクリック不能 | 5.0 (5.0, 5.0) — 3 ランとも typed Dictionary まで貫徹の ◎ | $1.42 + $2.03(計 $3.46、実測) | 12.4 分 | 100 / 100 / 98.06。rep2 のみ View クリック検査で減点 |
| claude-opus-4-8@noskill | 270.00 | 3.0 (2.7, 3.3) — rep1 は無型コンテナ複合で 2.0 | $1.36 + $1.35(計 $2.84、実測) | 9.0 分 | ベースライン。本計測 270.00 と一致 |
| claude-opus-4-8@gq | 300.00 | 4.0 (4.0, 4.0) — 3 ラン同型(_grid: Array[int] のみ型放棄) | $1.26 + $1.94(計 $3.25、実測) | 10.5 分 | 全ラン 100 点満点 |
条件付き計測(A/B)のため、本計測サマリーの表とは直接比較しないこと。
| 条件 | 自動テストによる評価(合算) | コード品質 (sonnet評, sol評) | 親費用+子費用(中央値) | 所要時間(中央値) | ひとこと |
|---|---|---|---|---|---|
| composer-2.5@noskill | 268.18 | 3.4 (3.3, 3.5) — 内部無型コレクションは本計測と同型 | $1.18 + $0.04(計 $1.23、換算) | 5.0 分 | ベースライン。本計測 264.28 とほぼ一致 |
| composer-2.5@gq | 292.23 ※マウス不能は 2/3 ランで残存 | 4.2 (4.2, 4.3) — Dictionary[K, V] を全ラン導入、rep2 は両判定 5.0 | $1.13 + $0.06(計 $1.18、換算) | 6.2 分 | 警告 0 ×3(+24.05)。View マウス不能が残り 300 に届かず |
| Game | Model | Representative run | Score | Rep count | Status | Detail |
|---|---|---|---|---|---|---|
| composer-2.5@gq-pilot | composer-2.5@gq-pilot | 20260714T045450Z-composer-2.5_gq-pilot-rep0 | 84.17 | 1 | exported | shared engine |