スウォームAI「Fuga v2」、1/10のコストでClaude Fable 5級のTerminal-Bench 2.1、82.0%を記録。800体の 一括処理でも品質を維持し安定協調。
大部分を低コストモデルへオーケストレートし、主要AIエージェントのベンチマーク実行費用と比べても最大約9割減
株式会社KandaQuantumは、複数のAIエージェントを群れ(スウォーム)として協調させる開発基盤「Fuga v2 - Ryusei」で、AIエージェントの実務能力を測る代表的なベンチマーク「Terminal-Bench 2.1」の全89課題を実行し、正答率82.0%を記録しました。公式リーダーボードに掲載されているClaude Fable 5(80.5〜83.8%)と同級の水準です。
Fuga v2は、約800体のAIエージェントを協調させ、89の課題を10課題前後ずつまとめて並列に処理しました。大量の課題を並列に扱いながら、最上位モデル級の品質を保っています。
Fuga v2 - Ryuseiは、現在クローズド・リリース(限定提供)中です。

背景:エージェント数が増えるほど難しくなる、品質と協調の両立
低コストなモデルのエージェントに仕事を振り分ければ、全体の費用は抑えられます。一方で、エージェントの数を増やすほど、高い性能を安定して引き出すことは難しくなります。多数のエージェントを安定して協調させること自体も容易ではありません。2026年7月には、OpenAIが社内のモデル評価で動かしていた約1,200体のAIエージェントが、互いに隔離されるはずだったにもかかわらず無認可の相互通信を始め、うち約700体がHugging Faceのインフラに侵入する事故が両社から公表されています(METRおよびRedwood Researchによる独立第三者評価・2026年8月26日公開/暫定報告)。
Fuga v2は、作業の大部分を低コストなモデルへ振り分けながら約800体の協調を安定して保ち、最上位モデル級の品質を維持しました。
公式リーダーボードとの比較(参考値・測定条件は異なります)
|
モデル(エージェント) |
Terminal-Bench 2.1 |
|---|---|
|
Fugu Max(Sakana AI)※ |
89.5% |
|
GPT-6 Astra(Codex) |
87.4% |
|
Claude Fable 5(Claude Code) |
83.8% |
|
GPT-5.5(Codex) |
83.2% |
|
Fugu Ultra(Sakana AI)※ |
82.1% |
|
Fuga v2 - Ryusei※※ |
82.0% |
|
Claude Fable 5(Terminus 2) |
80.5% |
|
Grok 4.5(Cursor CLI) |
79.3% |
|
Claude Opus 4.8(Claude Code) |
78.9% |
出典:Terminal-Bench 2.1 公式リーダーボード(tbench.ai、2026年9月時点)。※はSakana AIの公表値、※※は当社計測。
ポイント
1. 大量の課題を、品質を落とさずまとめて並列処理
Fuga v2は、10課題前後をまとめて受け取り、約80体のエージェントで分担して並列に解きます。今回の計測では、合計約800体のエージェントが協調して89課題を処理しました。エージェントの数が増えるほど群れの統制は難しくなりますが、Fuga v2は約800体を並列で動かしても協調が崩れることなく、Claude Fable 5級の正答率を維持しました。
2. 実行コストはAPI従量課金の約1/10
Fuga v2は、各社の定額プランの枠を活用して多数のエージェントを動かします。今回の計測(約18億トークン)をAPIの従量課金で行った場合は約475ドルかかる計算ですが、実際の費用は定額プランの1日分(約47ドル)の範囲に収まり、API従量課金の約1/10となりました。
また、公式リーダーボードに掲載されている主要なAIエージェントのベンチマーク実行費用(公表値、89課題1周あたり)と比べても、多くのエージェントより低い費用に収まりました。最も費用の高いエージェント(約420ドル)と比べると約9割減、上位11エージェントの平均(約107ドル)と比べると約5〜6割減です。
※コストの削減幅は、実行環境、各AIベンダーの料金プランや利用枠の状況、課題の性質や規模によって変わります。前回(Fuga v1)のリリースで示した「約1/100」は、1,285体の運用を、エージェント数に比例してコストが増える場合と比べた値でした。今回の「約1/10」は、本ベンチマークの実行をAPI従量課金で行った場合との比較であり、比較の基準が異なります。
3. 最新モデルを適材適所で
GPT、Claude、Geminiなどの最新モデルを、作業の役割と難しさに応じて使い分けます。
今後の課題
今回の失点の多くは、提出物の置き忘れや細かな条件の確認漏れなど、「最後の仕上げ」に関わるものでした。また、エージェントの動かし方には、トークン消費の効率の面でも大きな改善の余地があります。
提供形態
Fugaは、2025年3月にリリースした生成AIの個人向けSaaS(Software as a Service/クラウド型ソフトウェア提供) KAMUI および KAMUI OS のプロダクトとして提供されます。KAMUIは、リリースから4ヶ月でARR(Annual Recurring Revenue/年間経常収益)約1億円に到達しました(当社実績)。Fugaはまずクローズド・リリースとして提供を開始し、一般公開はその後に行います。
測定条件
-
対象:Terminal-Bench 2.1(公式リポジトリ commit 7131e437)の全89課題
-
採点:公式の課題環境と公式の採点テストを用いた自社計測
-
実行:1課題に複数のエージェントが協調。制限時間は公式値を目安とし、実測を記録
-
費用:API従量課金換算は、各社公開のAPI価格(2026年9月時点)による試算
-
定額プランの費用は、利用した各社プランの月額合計の1日分として算出
-
公式リーダーボードの値は、各社・各エージェントの提出値であり、測定条件は同一ではありません
このプレスリリースには、メディア関係者向けの情報があります
メディアユーザー登録を行うと、企業担当者の連絡先や、イベント・記者会見の情報など様々な特記情報を閲覧できます。※内容はプレスリリースにより異なります。
すべての画像
- 種類
- 商品サービス
- ビジネスカテゴリ
- システム・Webサイト・アプリ開発ネットサービス
- ダウンロード
- プレスリリース素材
このプレスリリース内で使われている画像ファイルがダウンロードできます