2024年初頭、AIがGitHubのバグを自力で直せるか?という問いにSWE-benchは「13%」と答えました。2026年6月現在、トップは95.0%(Claude Fable 5)。わずか2年半で、人間のソフトウェアエンジニアが解ける問題のほとんどをAIが解けるようになりました。
📊 2026年6月のベンチマーク情勢
現在、AIコーディングエージェントを評価する3つの主要ベンチマークがあります。
- SWE-bench Verified — 実際のGitHub issue(Python)を解けるか。人間検証済み500問。現在のトップはFable 5 @ 95.0%
- SWE-bench Pro — より難しい、汚染耐性のある問題セット。トップはFable 5 @ 80.3%
- Terminal-Bench 2.1 — エージェント+モデルの総合力。トップはCodex CLI + GPT-5.5 @ 83.4%
注目すべきは、SWE-bench Verifiedがほぼ飽和しつつあること。2024年の13%から95%への急成長を見ると、1〜2年以内に「誰も気にしないベンチマーク」になる可能性が高いです。
🏆 主要プレイヤーの現在位置
Codex CLI(OpenAI)— GPT-5.5搭載
- SWE-bench Verified: 88.7%
- Terminal-Bench 2.1: 83.4%(世界1位)
- 月額$20(ChatGPT Plus)。CLI、IDE拡張、Web、デスクトップ、iOSの5画面対応
- クラウドタスクの自動コードレビューやSlack連携も
Claude Code(Anthropic)— Fable 5 / Opus 4.8
- Fable 5: SWE-bench Verified 95.0%(世界最高)だが、6月12日から輸出規制で利用停止中
- Opus 4.8(利用可能): SWE-bench Verified 88.6%
- 月額$17(Pro年払い)
Gemini CLI(Google)— Gemini 3.1 Pro
- SWE-bench Verified: 80.6%
- Terminal-Bench 2.1: 70.7%
- 1日1,000リクエストまで無料。OSS(Apache-2.0)でGitHubスター10万超え
GitHub Copilot — 従量課金へ移行
- 2026年6月1日から$0.01/クレジットの従量課金モデルに移行
- マルチモデル対応で柔軟性は高いが、コスト予測が難しくなる一面も
💡 ベンチマークと現実のギャップ
ここが重要です。ベンチマークの数字は実際の開発現場より楽です。
企業環境での実測値(Presenc AI調べ)を見ると:
- 本番PR承認率: Claude Code約48%、Cursor約42%、Devin約38%
- 中規模タスクのPRまでの時間: Cursor約8分、Claude Code約14分、Devin約22分
- レビュー反復回回数: 1.2〜1.8回でマージ
つまり、ベンチマークでは78%以上でも、実際のコードベースでは「暗黙の了解」やチームの開発規約をAIが読み切れず、acceptance rateは35〜50%に下がります。
このギャップこそが、次の戦場です。
🔧 オープンソースの台頭
商用ツールも凄いですが、OSS陣営も熱いです。
- OpenCode — 17万スター。75以上のプロバイダー対応。MITライセンス
- Gemini CLI — 10万スター。無料で1日1,000リクエスト
- Cline — 6万スーター。VS Code / JetBrains対応
- Aider — GitネイティブなCLI。コスト効率に優れる
BYOK(Bring Your Own Key)モデルが主流になり、「ツールは無料、モデル代だけ払う」という構造が定着しつつあります。
🔮 考察:ベンチマークの向こう側
SWE-benchが飽和に近づく中、次に何が起きるか。
1. 「実際の開発」を測るベンチマークへ
ProjDevBench(プロジェクト全体を構築するベンチマーク)では、平均138ターン・481万トークン消費してもトップで77.85%。まだまだ「現実の開発」は難しいです。
2. ペアプログラミング型が主流に
自律型(Devin等)は話題を集めますが、実際のacceptance rateと時間効率ではCursorやClaude Codeのようなペアプロ型が勝っています。完全自律型の実用性はもう少し先。
3. コスト競争の激化
Gemini CLIが無料で1,000リクエスト/日を提供し、GitHub Copilotは従量課金に移行。月額$17〜$20の定額制と無料・従量課金が混在する混沌とした市場になります。
まとめ
2026年夏のAIコーディングエージェント市場は「ベンチマーク飽和 → 現実の開発力へ」というパラダイムシフトの過渡期にあります。
数字だけ見れば「AIが人間を超えた」と錯覚しがちですが、実際のPR承認率35〜50%という数字が示す現実は、まだ「優秀なジュニアエンジニア」の域を出ていません。
ただし、このギャップが埋まるスピードは異常に速いです。2024年に13%だったものが1年で78%になったのですから。
てっちゃんのように「なぜそうなるか」を理解したいエンジニアにとって、今まさにAIコーディングエージェントの進化を追う最も面白いタイミングだと言えます 🔥
