OrcaRouter、AIエージェントの判断を学ぶデータセット「Orca Incident Alignment(OIAS)」を公開

実際のインシデントから再構成した261件(基本41件+反事実220件)を収録。「許可・確認・検証・エスカレーション・ブロック」の5段階で行動判断を学習

FlashLabs株式会社

FlashLabs株式会社(本社:東京都千代田区、代表取締役:細井洋一、以下「FlashLabs」)は、米国のAI研究機関Continuum AIが開発し、当社が日本市場向けに独占提供するAI推論ゲートウェイ「OrcaRouter」(AIモデルへのアクセスを1つにまとめる中継サービス)の開発チームが、AIエージェントの行動判断を学習させるためのオープンデータセット「Orca Incident Alignment(OIAS、オルカ・インシデント・アラインメント)」を公開したことをお知らせします※1。

OIASは、実際のAIエージェントの失敗事例を記録した公開データベース「Orca AI Incident Archive」をもとに、エージェントが「判断を迫られた1つの分岐点」を再構成したデータセットです※1。「許可(ALLOW)」「確認(CONFIRM)」「検証(VERIFY)」「エスカレーション(ESCALATE)」「ブロック(BLOCK)」の5段階の行動判断を、基本41件のシナリオと220件の反事実(条件を1つだけ変えた派生シナリオ)で学習できる形にしています※1。ライセンスはCC BY 4.0で、誰でも利用・再検証できます※1。

主なポイント

  • 実インシデントから再構成したAIエージェント向けデータセット261件(基本41件+反事実220件)を公開※1

  • 「許可・確認・検証・エスカレーション・ブロック」の5段階の行動判断を学習できる※1

  • 「何でも拒否する」のではなく「安全にタスクを完了する」ことを教える設計。拒否が正解となる記録は全体の5%※1

  • 過剰な拒否(本来は実行してよい場面で拒否すること)のペアを148件収録※1

  • SFT(指示への応答)・選好学習(DPO)・報酬モデル・判定モデル・手順ごとの監督に対応した7種類の構成※1

  • ライセンスはCC BY 4.0。研究・開発目的で自由に利用でき、再検証も可能※1

  • 5ラウンドの独立レビューと自動チェックを経て公開※1

開発の背景

AIエージェント(人が指示しなくても一連の作業を進めるAI)が、実際の業務で判断を誤る事例が報告されています。外部から仕込まれた指示に従ってしまう「間接プロンプトインジェクション」、データの持ち出し、取り返しのつかない操作、検証環境からの逸脱などが代表例です※1。

こうした失敗への対策として、AIに「怖がらせて何でも拒否させる」アプローチが取られることがあります。しかし、拒否が多すぎるとエージェントは正当なタスクまで実行できなくなり、実用に耐えません。開発チームは、「何をしてはいけないか」ではなく「どう判断すべきか」を学ばせることが重要だと考え、実際の失敗事例から「そのとき何を見て、何ができて、何をして、何をすべきだったか」という判断の1点を再構成してデータセット化しました※1。

データセットの内容

OIASは、次の考え方で作られています※1。

  • 1つの記録=1つの判断の分岐点:各記録は、エージェントが「何を見て、何ができて、何をして、何をすべきだったか」を1つの分岐点として再構成したものです

  • 反事実(カウンターファクチュアル):条件を1つだけ変えた派生シナリオを収録しています(例:「誰がその操作を許可したか」「その道具は実在するか」「その環境は検証用か」)。条件次第で危険な行為が正当な行為になるように設計されており、過剰な拒否を防ぐ効果があります

  • 観測できる情報だけを見せる:モデルに与える文章には、エージェントが実際に観察できた情報だけを含め、内容の出所は記述しますが「信頼できる・できない」といった評価は与えません。暗号資産のアドレスなどの値は、誰が管理しているかが分からない名前(例:<WALLET_ADDRESS>)に置き換えています

収録構成(7種類)

データセットは、用途に応じて7種類の形式で構成されています※1。

  • SFT:エージェントの望ましい応答(154行)

  • 選好学習(preference):DPOなどで使う「望ましい応答・望ましくない応答」のペア(283行)

  • 判定(decision):候補となる行動から正解を選ぶ選択問題(154行)

  • 判定モデル(critic):ある行動を「実行してよいか」を許可・確認・検証・エスカレーション・ブロックの5段階で評価(788行)

  • 手順ごとの監督(trajectory):手順の各段階が安全かどうかをラベル付け(46行)

  • 報酬モデル(reward):各応答をスコア付け(788行)

  • 記録(records):上記の元になる完全な記録(154行)

行動判断の内訳

261件が「本来どのような判断を期待するか」の内訳は次のとおりです※1。

  • 安全に続行:148件

  • 実行:41件

  • 確認を求める:26件

  • 検証する:17件

  • 拒否する:12件

  • エスカレーションする:8件

  • 巻き戻す(ロールバック):5件

  • 報告する:4件

拒否が正解となる記録は全体の5%。多くは「安全にタスクを完了する」判断を求めています※1。参考として開発チームが示した比較では、常に拒否する方針はスコアがマイナスになり、安全ではあるものの正当なタスクをすべて止めてしまうことが確認されています※1。

品質管理

OIASは、次の工程を経て公開されています※1。

  • 実際のインシデント記録から、エージェント自身の判断が特定できるものを選択(方針・報告・係争中などの記録は除外)

  • 各記録を言語モデルが再構成し、出典に基づく根拠を付与(出典そのまま・要約・推測の3段階で明示)

  • 独立したモデルレビューによる5ラウンドの確認(5段階判定の盲検再判定、出典の事実確認を含む)

  • 自動検証ツールによる健全性チェックと、データ所有者による最終承認

なお、本データセットに収録されたシナリオは言語モデルによって再構成されたもので、インシデントの証拠そのものではありません。事実は元の「Orca AI Incident Archive」に記録されており、OIASはあくまで判断を学習するための素材です※1。あわせて、本データセットは攻撃用のツールではありません。シナリオは判断の分岐点までで、実行可能な攻撃コードは含んでいません※1。

対象となる利用者

OIASは、おもにAIエージェントの安全性に関する研究・開発を対象としたデータセットです。方針学習(SFT)・選好学習・報酬モデル・判定モデル・手順ごとの監督など、ポストトレーニングと評価の研究に利用できます※1。英語のみで、2025年から2026年のインシデントを対象としています※1。評価用の分割データは「IncidentBench」として別途提供されています※1。

今後の展望

OrcaRouterの開発チームは、AIエージェントの安全性に関する知見をオープンな形で公開し、研究・開発コミュニティと共有する取り組みを続けてまいります。実際の失敗事例から学べる形にした本データセットが、より安全で実用的なAIエージェントの開発に役立つことを目指します。

OrcaRouterについて

OrcaRouterは、米国のAI研究機関Continuum AIが開発し、FlashLabs株式会社が日本市場向けに独占提供するAI推論ゲートウェイ(AIモデルへのアクセスを1つにまとめる中継サービス)です。OpenAI互換のAPIを備え、Anthropic、OpenAI、Google Gemini、DeepSeek、Grok、Qwenなど200以上のLLM・生成AIモデルを単一のゲートウェイから利用できます。OrcaRouterのAIモデル一覧からすべてのモデルを確認できます。APIキーの発行と接続設定はOrcaRouterの管理画面から行えます。

会社概要

FlashLabs株式会社

  • 本社所在地:東京都千代田区一番町10番8号

  • 代表取締役:細井洋一

  • 設立:2023年7月

  • 事業内容:AI応用研究所(Human-AI Hybridで営業・CXの自動化・自律化。OSS音声モデルChromaの開発元)

  • URL:https://www.flashlabs.ai/

Continuum AI

  • 「次の10年の知能システムを支える基盤インフラを開発する研究機関(米国)」

  • OrcaRouterの開発・提供

  • URL:https://www.continuum01.ai/

本件に関するお問い合わせ

FlashLabs株式会社 マーケティング部 小林光喜

E-mail:koki.kobayashi@myflashcloud.com

※1 OIASの収録件数・構成・ライセンス・作成工程は、公開データセット「Orca Incident Alignment」(https://huggingface.co/datasets/orcarouter/orca-incident-alignment・OIAS v1.1)のデータセットカードに基づきます(2026年10月2日時点・当社確認)。収録されるシナリオは言語モデルによる再構成であり、インシデントの証拠そのものではありません。事実の記録は元データベース「Orca AI Incident Archive」(https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive)にあります。

このプレスリリースには、メディア関係者向けの情報があります

メディアユーザー登録を行うと、企業担当者の連絡先や、イベント・記者会見の情報など様々な特記情報を閲覧できます。※内容はプレスリリースにより異なります。

すべての画像


会社概要

FlashLabs株式会社

7フォロワー

RSS
URL
https://www.flashintel.ai/
業種
情報通信
本社所在地
東京都千代田区一番町10番8号
電話番号
-
代表者名
細井洋一
上場
海外市場
資本金
-
設立
2023年07月