2026年8月5日、Peiyan Li氏らの研究チームは、わずか9.2%のパラメータ追加で5つのベンチマークにおける最先端性能を達成した3D視覚・言語・行動フレームワーク「BridgeVLA++」に関する論文を発表した。
記憶拡張と高い汎用性を実現 3Dロボット操作の新基準確立
研究チームが発表した「BridgeVLA++」は、事前学習済み視覚言語モデル(VLM)を活用した従来のBridgeVLAを大きく発展させた統合システムである。従来の3Dモデルが抱えていた大量データの必要性や未知の環境への適応力不足、さらに過去の観測を明示的に記憶できないという課題の解消に成功した。
本フレームワークの核となるのは、永続的な空間コンテキストと時間的な相互作用履歴を同時にモデル化する「統一時空間メモリ(※)」の導入だ。これにより、過去の観測結果に基づいた高度な推論と正確な動作制御が可能になる。
シミュレーション実験では、両手操作の記憶課題である「RMBench」において96.0%という極めて高い成功率を記録した。メモリ機能を持たないベースモデルが18.9%にとどまったことと比較すると、その差は歴然と言える。さらに、片腕記憶の「MemoryBench」で99.7%、18タスクの「RLBench」で93.7%を達成し、圧倒的な優位性を示している。
実機ロボットを用いた実験でも優れた成果が確認された。7自由度のFranka Research 3や6自由度のDobot CR5Aを使った評価において、物体を遮蔽するタスクや妨害要素が存在する環境下でも極めて安定した動作を維持した。わずか10回のデモンストレーション学習で高い精度を発揮する点も、実用面における大きな強みとなる。
※時空間メモリ:ロボットが過去に観察した位置や形状などの「空間情報」と、作業の行動履歴という「時間情報」を同時に保持・参照し、複雑な判断を行うための記憶メカニズム。
ロボティクスの現場投入を加速 高効率化がもたらす未来と課題
BridgeVLA++の登場は、産業用ロボットやサービスロボットの社会実装を劇的に加速させる可能性を秘めている。特に注目すべきは、29.2億パラメータのモデルに対して約2.7億(+9.2%)という僅かなパラメータの追加で大幅な性能向上を実現した点にある。推論遅延の増加も1ステップあたり0.22秒程度に抑えられており、実用的なリアルタイム性を確保していると言える。
データ効率の高さも大きなメリットをもたらす。従来のような膨大な学習用データを必要とせず、少ないデモ数で新たな環境や未経験のタスクに適応できるため、導入コストの大幅な削減が期待される。工場や物流倉庫など、多品種少量生産や現場のレイアウト変更が頻繁に起こる環境において強力なソリューションとなる。
一方で、時空間メモリの管理や履歴データの蓄積に伴う計算資源の最適化は、長期的な運用における課題として残る可能性がある。また、非常に動的で不確実性の高い人間との共存環境下で同様の精度を維持できるかについては、今後のさらなる検証が必要だ。
広範な環境や複雑な両手操作タスクへ対応できる汎用フレームワークの出現は、次世代ロボティクス開発の標準を塗り替える一歩になると捉えられる。今後の実運用に向けた展開に期待が高まる。