AI業界において、テキストや静止画、一般的なWeb動画データに依拠した汎用モデル(LLM/VLM)のスケーリング限界が議論される中、General Intuition が大きな注目を集めています。同社は2026年9月15日に2億2000万ドルの大型資金調達を実施したことを発表し、評価額は62億ドル、累計調達額は約6.7億ドルに達しました。
彼らが掲げる技術的中核は、「ゲームプレイ動画(操作入力ラベル付きビジュアルデータ)を用いた次世代ワールドモデル(世界モデル)および空間時系列AIエージェントの構築」 です。
本記事では、技術的背景、アーキテクチャ競合比較、および導入実績(ロードマップ)についてエンジニア向けに深く解説します。
1. 会社概要
| 項目 | 詳細内容 |
| 会社名 | General Intuition, Inc. |
| 設立年 | 2025年(ゲームクリップ共有プラットフォーム「Medal」よりスピンアウト) |
| 創業者 / CEO | Pim de Witte(Medal 共同創業者兼CEO) |
| 拠点 | 米国 ニューヨーク / サンフランシスコ |
| 主要投資家 | Khosla Ventures, General Catalyst, Valor Equity Partners, Atreides Management, Raine Group |
| 累計調達額 / 評価額 | 約6億7,400万ドル / 62億ドル |
| 事業概要 | ゲーム動画(操作入力データ同期型)を活用した自律型エージェントおよび物理世界向け基幹ワールドモデル(World Model)の研究開発 |
2. なぜゲーム動画なのか?開発の技術的背景と課題意識
自律型AIや人型ロボット(Embodied AI)の開発において、従来の機械学習パイプラインは巨大な「データ収集の壁」に直面しています。
- Web動画データ(YouTube等)の限界: 撮影映像は単なる「観測結果(Vision)」に過ぎず、撮影者や被写体が「どのような操作入力(Action)を行ったか」という高精度な行動ラベルが欠落しています。
- 物理世界(実機センサ)データの限界: 実車や実機ロボットによるデータ収集は高コストかつ低速であり、特に事故や物理演算の破綻といった「危険なコーナーケース(異常系)」のデータ収集が極めて制限されます。
General Intuitionは、年間数十億本規模のゲーム動画クリップが集まる「Medal」のインフラを活用することで、この課題を打破しました。「1/60秒単位で同期されたフレーム映像」×「コントローラー/キーボードの全入力ログ」という高次元マルチモーダルデータセット(Action-Labeled Dataset)を無制限に生成・学習に投入できるパイプラインを構築しています。
3. コア技術とアーキテクチャの解説
① ポストアライメント時代の「Action-Labeled Data Moat」
Webスクレイピングで得られる通常の動画(YouTube等)は、単なる「観測(Observation)」であり、操作入力(Action)が紐づいていません。一方、General Intuitionは「どのキーを押したか」「マウスやスティックをどのベクトルに動かしたか」が1/60秒単位で同期したマルチモーダル時系列データを大量保持しています。
② コーナーケース(異常系)の圧倒的密度
CEOのPim de Witte氏が述べる通り、物理世界での事故データ収集はコストと安全面から困難を極めます。しかしゲーム空間(GTAV、Cyberpunk、Flight Simulator等)では、衝突・落車・物理バグといったエッジケースが日常的に大量発生するため、リスクなく堅牢な「物理モデルの例外学習」が可能です。
4. 競合・アプローチ比較
物理世界の理解と自律動作を目指す主要なアプローチとの比較は以下の通りです。
| 比較項目 | General Intuition | OpenAI / Wayve (VLA/VLM型) | Waymo / Tesla (実車センサ型) | World Labs (Fei-Fei Li氏ら) |
| 主な学習データ | ゲーム動画 + 操作入力 | テキスト + Web動画 | 車載カメラ + LiDAR (実データ) | 3D空間メッシュ + 静止画 / 映像 |
| Actionラベル | 完全同期(高精度) | 不足(推定が必要) | 完全同期(ただし運転領域に限定) | なし(主に視覚生成に特化) |
| データ収集コスト | 極めて低コスト(既存ユーザー投稿) | 低コスト(Web収集) | 非常に高コスト(実機運用) | 中〜高コスト |
| コーナーケース | 極めて豊富(ゲーム内の破壊・事故) | Web上の動画依存 | 滅多に発生しない(安全重視) | 合成データ依存 |
| ターゲット領域 | ロボティクス / ドローン / ゲームAI | 汎用AI / テキスト・画像エージェント | 自動運転(特定ドメイン) | 3D空間生成 / 空間コンピューティング |
5. 導入実績・応用ユースケース
現在、General Intuitionはモデルのα/Waitlist段階ですが、以下の分野での導入実証および提携を進めています。
- 実世界物理ハードウェア(Robotics & Drones)
- GPS非依存ドローンナビゲーション: 視覚情報と慣性動作予測のみで、GPSが遮断された屋内や地下構造物を自律飛行する制御エージェント。
- 人型ロボット(Humanoid)の汎用マニュピレーション: 物理エンジン経由で学習した物体の把持・押圧などの力学的相互作用を実機へ転移。
- 高度自律型ソフトウェアエージェント(Game Testing & AI-NPC)
- ゲームQA自動化: 人間と同様に画面を操作し、マップ外脱出バグや物理演算破壊を自律発見するQAエージェント。
- 次世代AI-NPC: スクリプト制御ではなく、周囲の視覚環境変化に対応してリアルタイムにプレイ操作を組み替えるエージェント。
6. まとめ
General Intuitionが評価額62億ドルという巨額の資金調達を達成した背景には、「ポストアライメント時代におけるデータ枯渇問題」に対する画期的な解答を提示した点にあります。
テキストや画像を中心とした従来モデルでは困難であった「物理世界での因果理解や制御(Spatial/Temporal Reasoning)」に対し、同社はゲームプレイ動画×操作入力ラベルという膨大かつ高精度な学習パイプライン(Data Moat)を確立しました。
今後は、ゲーム空間上で獲得した「物理的直感(Intuition)」を、Sim-to-Real転移によってロボティクスや自律型ドローンなどの実世界アクチュエータ制御へどこまで高い精度で適用できるかが焦点となります。AIエンジニアやアーキテクトにとって、VLM/LLMの枠を超えた「Vision-Language-Action(VLA)基盤」のゲームチェンジャーとして、同社のモデル公開や技術展開から今後も目が離せません。