OpenAIは、モデルの保護対象推論を別のモデルの学習などに利用する「敵対的蒸留」を狙った組織的な活動を阻止したと発表した。活動の中核を担った一群について、Kimiを開発するMoonshot AIの関係者によるものと評価している。
OpenAI、推論抽出を狙う大規模活動を阻止
OpenAIが2026年9月30日に発表した内容によると、今回の調査対象となった敵対的な蒸留活動は2026年7月1日に始まり、7月24日と25日に急増したという。
この期間に4,000人超のユーザーから、関連する抽出パターンを用いた1万6,000件のリクエストが送信された。さらに15,000人超のユーザー群で関連プロンプトを使った活動が確認されたため、同社は7月28日までにそのすべて阻止した。
実行者らは暗号を破ったり、データベースへ侵入したりしたわけではないという。
会話を操作し、通常は外部に見せない保護対象の推論を、リクエスト送信者に見える形で再現させていた。
手法の一例では、ある会話から暗号化された推論をコピーし、別の会話で復号と書き起こしをモデルに求めていた。対象期間の活動がすべて単一主体によるものかは不明だが、その中核をなす一群についてはMoonshot AI関係者によるものとOpenAIは評価している。
OpenAIはさらに、不正アカウントの停止・制限、新規登録やインフラの制御、関連ネットワークの監視拡充も実施した。
また、取得済みの暗号化推論を再送信して復元する経路を閉鎖し、推論を露出させる可能性のあるストリーミング出力を検知するチェック機能も追加した。
独立したセキュリティ研究者からは、関連脆弱性の報告も受けたという。
敵対的蒸留がAI競争にもたらす影響
今回の事案は、AIの競争力がモデル性能だけでなく、推論やツール出力を守る防御能力にも左右されることを示したと言える。高度な能力を低コストで模倣できれば、先行企業の研究開発投資が競争上の優位につながりにくくなる可能性がある。
一方、攻撃手法を共有して防御を強化することは、AI業界全体のセキュリティ水準を高める機会にもなるだろう。複数の開発者やサービス提供者が脅威情報を共有すれば、類似攻撃への対応を早められるかもしれない。
ただし、防御を強化するほど、正当な利用者の利便性や運用コストとの両立が課題になり得る。出力検査や監視を広げれば、誤検知への対応負担も増える可能性があるため、パートナー環境まで保護を広げることも容易ではないはずだ。
今後は、アカウント管理、検知機能、モデルの拒否動作、ツール出力の検査を組み合わせた多層防御が重要になると考えられる。
フロンティアモデルの性能向上が続くほど、能力の移転を防ぐ技術と組織的活動を早期に見つける運用の双方が、競争力を左右する要素になりそうだ。
関連記事:
Anthropicが悪用報告 中国7組織がClaudeを無断蒸留

米政府、DeepSeekなど中国AI 6社の大規模な知識蒸留を指摘 数十億トークン取得と主張

OpenAIがDeepSeekのAI学習に米モデル蒸留疑い指摘 米中AI競争の新局面
