GitHub リポジトリ | English

Conveyor Courier ギャラリー — 202607_delegate_implement_bench

ベンチで生成された Conveyor Courier 実装の Web エクスポート。モデル名のリンクから代表 run(採用 rep の総合スコア中央値)の実装をブラウザでプレイできる。

参照実装(採点の基準となるお手本実装): プレイする

本計測サマリー

表の数値は benchmarks/202607_delegate_implement_bench/impressions.md の本計測サマリー(各モデル 3 反復の採用値)からの転記。指標の定義は同ファイルの脚注を参照。

太字のモデル名は代表 run の機能(隠しテスト)が満点(70/70)。

モデル自動テストによる評価(合算)コード品質 (sonnet評, sol評)親費用+子費用(中央値)所要時間(中央値)ひとこと
claude-sonnet-5 (Claude)290.003.8 (4.3, 3.3) — rep1 のみ 5、内部の型放棄が 2/3。乖離が大きいため代表値は Fable 裁定(クロスチェック欄参照)$0.97 + $1.30(計 $2.27、実測)8.6 分品質首位・無事故。型警告ゼロの run を 2 回達成
swe-1.7 (Devin)280.064.1 (4.0, 4.3) — rep1 のみ無型 Dictionary へ退行$1.41 + $0(計 $1.41、込み価格)12.5 分swe-1.6 から +57.00 の大幅改善。旧 100 点 run は View 減点(クリック不能)で 98.06 に
gpt-5.5 (Codex)280.004.0 (4.3, 3.8) — rep2 のみ 5、_items 無型が 2/3$1.00 + $2.34(計 $3.48、換算)5.8 分機能は全反復満点・無事故。型警告ゼロは 1/3
cursor-grok-4.5 (Cursor)276.003.3 (3.2, 3.5) — item が typed class ⇔ 生 Dictionary で振れる$1.25 + $0.12(計 $1.38、換算)4.8 分最速級・最少トークン消費。View 減点ゼロで再集計 4 位へ浮上
devin-deepseek-v4-pro (Devin)270.063.4 (3.3, 3.5) — 生 Dictionary 運用、rep2 のみ 4$1.53 + $2.05(計 $3.58、推測)11.1 分機能は全反復満点だが最遅級・高コスト
claude-opus-4-8 (Claude)270.003.5 (3.3, 3.7) — View 層まで int 波及が 2/3$0.93 + $1.42(計 $2.35、実測)8.4 分子は毎回機能満点。失敗は全て親・ハーネス側
gpt-5.6-sol (Codex)268.064.2 (4.2, 4.3) — rep0 のみ _items 無型$1.50 + $1.77(計 $3.10、換算)7.1 分全反復 88〜90 で安定。terra とほぼ同点・同品質で単価は 2 倍
cursor-gemini-3.1-pro (Cursor)268.062.5 (2.8, 2.3) — 定数化しない癖が 3 ラン共通・振れ幅最大(代表値は Fable 裁定と一致)$1.55 + $0.58(計 $2.13、換算)8.4 分型警告の振れと停滞癖。トークン消費は Cursor 系最大
cursor-kimi-k2.7-code (Cursor)268.064.5 (4.3, 4.7) — rep2 は Dictionary[K,V] 総称まで貫徹$1.44 + $0.16(計 $1.60、換算)10.6 分スプリッタの癖は非再現。型規律は最上位帯を維持
gpt-5.4-mini (Codex)266.12
※代表 rep1 は盤面非描画(欄参照)
3.3 (2.8, 3.5) — 反復ごとに型後退(代表値は Fable 裁定)$1.01 + $0.84(計 $2.04、換算)11.1 分型警告は最少級だが遅く、決定性落ち・停滞あり
gpt-5.6-terra (Codex)266.12
※代表 rep2 は矢印が豆腐表示(欄参照)
4.2 (4.2, 4.3) — 定数化と盤面表現が反復間で揺れる$1.21 + $0.91(計 $2.38、換算)6.3 分sol と同品質を約半額・より速く。効率面の有力株
devin-glm-5.2 (Devin)266.12
※代表 rep1 はベルト向き非表示・マウス操作不能(欄参照)
3.8 (4.0, 3.7) — 3 ラン安定、内部 int 運用が常$0.90 + $1.37(計 $2.28、推測)5.9 分速くて機能面は正確。完了報告前の停滞が玉に瑕
composer-2.5 (Cursor)264.28
※代表 rep1 はマウス操作不能(全ラン共通、欄参照)
3.8 (3.8, 3.8) — _items 無型 Dictionary が 3 ラン共通$1.23 + $0.04(計 $1.29、換算)6.5 分無事故は継続。実測で子費用は全モデル最安と判明
composer-2.5-fast (Cursor)264.28
※代表 rep2 はマウス操作不能(全ラン共通、欄参照)
3.7 (3.7, 3.7) — 無型二重配列が 2/3$1.49 + $0.26(計 $1.76、換算)7.8 分無印と同点へ浮上。ただし再計測では無印より遅い
gpt-5.3-codex-spark (Codex)264.173.6 (3.8, 3.5) — ぶれ最大(5 / 3 / 3.5)$1.47 + 不明(計 $1.47 以上)4.5 分速いが細部が不安定。入力トークンは gpt-5.5 比 3〜5 倍
gpt-5.6-luna (Codex)250.553.3 (3.3, —) — 生 Dictionary 常用、rep2 のみ class 化$1.46 + $0.49(計 $1.95、換算)7.3 分スプリッタ退場時反転を全反復で落とす(追試 1 で effort 起因と判明、xhigh で解消)
swe-1.6 (Devin)223.06
※代表 rep1 は矢印が豆腐表示(欄参照)
3.8 (3.7, 4.0) — rep1 のみ型が全落ち$0.95 + $0(計 $0.95、込み価格)3.9 分最安(込み価格)だが機能・型とも品質最下位
claude-haiku-4-5 (Claude)86.11(n=1)
※代表 rep1 はマウス操作不能(欄参照)
2.7 (3.0, 2.5)(n=1) — 契約面も無型$1.87 + $0.66(計 $2.53、実測)9.3 分completed 1/7。停滞多発で信頼性最下位

ベースライン条件(委譲プロトコルを通らない別条件のため参考値。上表とは直接比較しないこと):

条件自動テストによる評価(合算)コード品質 (sonnet評, sol評)親費用+子費用(中央値)所要時間(中央値)ひとこと
fable-direct (委譲なし)300.004.6 (4.7, 4.5) — 3 ラン安定・型規律最上位$2.62 + $0(計 $2.62、実測)5.7 分ベースライン: 親 Fable の直接実装

追試(2026-07-11、gpt-5.6-luna の reasoning effort A/B: medium vs xhigh)

条件付き計測(A/B)のため、本計測サマリーの表とは直接比較しないこと。

条件自動テストによる評価(合算)コード品質 (sonnet評, sol評)親費用+子費用(中央値)所要時間(中央値)ひとこと
gpt-5.6-luna@medium252.50
※代表 rep0 は矢印が豆腐表示
3.7 (3.7, 3.7) — rep 間振れは相変わらず大(3.0/3.5/4.5)$1.59 + $0.71(計 $2.30、換算)8.0 分デフォルト effort。旧配分ではラウンド 2 と同値だった
gpt-5.6-luna@xhigh282.23
※代表 rep2 は headless 自己終了で View 3 件失権
3.8 (3.5, 4.2) — 警告ゼロ ×2 でも設計面は実質据え置き(代表値は Fable 裁定)$1.34 + $1.75(計 $3.09、換算)13.0 分Model 層テスト満点 3/3・100 点ラン 1、View 減点(豆腐・自己終了)が新たに乗る

追試 2(2026-07-11、gdscript-quality skill × 本ベンチ: claude-sonnet-5 / claude-opus-4-8 の skill あり/なし A/B)

条件付き計測(A/B)のため、本計測サマリーの表とは直接比較しないこと。

条件自動テストによる評価(合算)コード品質 (sonnet評, sol評)親費用+子費用(中央値)所要時間(中央値)ひとこと
claude-sonnet-5@noskill282.004.2 (4.2, 4.2) — rep2 のみ全面型付け 4.5$1.35 + $1.41(計 $2.64、実測)9.9 分ベースライン。本計測 290.00 から下振れ
claude-sonnet-5@gq298.06
※rep2 のみクリック不能
5.0 (5.0, 5.0) — 3 ランとも typed Dictionary まで貫徹の ◎$1.42 + $2.03(計 $3.46、実測)12.4 分100 / 100 / 98.06。rep2 のみ View クリック検査で減点
claude-opus-4-8@noskill270.003.0 (2.7, 3.3) — rep1 は無型コンテナ複合で 2.0$1.36 + $1.35(計 $2.84、実測)9.0 分ベースライン。本計測 270.00 と一致
claude-opus-4-8@gq300.004.0 (4.0, 4.0) — 3 ラン同型(_grid: Array[int] のみ型放棄)$1.26 + $1.94(計 $3.25、実測)10.5 分全ラン 100 点満点

追試 3(2026-07-14、gdscript-quality skill × Cursor 実行系: composer-2.5 の skill あり/なし A/B)

条件付き計測(A/B)のため、本計測サマリーの表とは直接比較しないこと。

条件自動テストによる評価(合算)コード品質 (sonnet評, sol評)親費用+子費用(中央値)所要時間(中央値)ひとこと
composer-2.5@noskill268.183.4 (3.3, 3.5) — 内部無型コレクションは本計測と同型$1.18 + $0.04(計 $1.23、換算)5.0 分ベースライン。本計測 264.28 とほぼ一致
composer-2.5@gq292.23
※マウス不能は 2/3 ランで残存
4.2 (4.2, 4.3) — Dictionary[K, V] を全ラン導入、rep2 は両判定 5.0$1.13 + $0.06(計 $1.18、換算)6.2 分警告 0 ×3(+24.05)。View マウス不能が残り 300 に届かず

その他のエントリ

GameModelRepresentative runScoreRep countStatusDetail
composer-2.5@gq-pilotcomposer-2.5@gq-pilot20260714T045450Z-composer-2.5_gq-pilot-rep084.171exportedshared engine