要約
Runwayが発表したSolarisは、従来の「デザイン ➔ コード ➔ レンダリング」というプロセスを排除し、ユーザー操作に応じてUI画面全体をリアルタイムに直接ストリーミング生成する「Interface World Models(インターフェース世界モデル)」です。コード(中間表現)の翻訳損失を防ぎ、事前にプログラムされていない挙動やUI操作に対応できます。
1. 定義と概要:SolarisおよびInterface World Modelsとは?
- 名称: Solaris(ソラリス)
- 開発元: Runway
- 発表日: 2026年8月31日
- 分類: Interface World Models(インターフェース世界モデル)
- 基盤モデル: Gen-4.5 / GWM-1(動画生成・世界モデル技術)
- 核心的概念: UIを決定論的なコード(HTML/CSS/JS等)ではなく、AIが1フレームずつリアルタイムに生成するインタラクティブ画像・映像として配信するアーキテクチャ。
公式発表の検証データ(UI再構築精度・視覚的一貫性評価)が示す通り、既存の大規模視覚言語モデル(VLM)を用いて、スクリーンショットからコードに変換してUIを再現する」アプローチでは、UIの視覚的複雑さが増すにつれて情報損失(情報劣化)が急激に拡大します。Solarisはこのコードへの翻訳ステップそのものをスキップします。
2. 従来型UIとSolarisの比較(アーキテクチャ比較)
| 項目 | 従来型UI開発 (Web / App) | コード生成AI (v0, Bolt等) | Runway Solaris |
| 中間表現 | HTML / CSS / JS / DOM | React / Vue等の生成コード | なし(中間コードを排除) |
| 生成タイミング | 事前ビルド(決定論的) | コード生成時のみ | ユーザー操作時に毎フレーム即時生成 |
| 画面描写 | ブラウザエンジンのレンダリング | ブラウザエンジンのレンダリング | 世界モデルによるダイレクト画像生成 |
| 未知の操作 | 不可(実装済みの挙動のみ) | 不可(生成されたコードに従う) | 可能(プロンプトと物理法則に従い動的適応) |
| 遅延/性能 | 0.01〜0.1秒(ローカル描画) | 0.01〜0.1秒(コード描画) | 1秒未満(ストリーミング推論) |
| 主な用途 | 一般的なWeb/Appサービス | 迅速なプロトタイピング | 高度なインタラクティブUI・AI訓練 |
3. 競合技術・別アプローチとの違い
- vs. v0 / Bolt.new / Claude Artifacts(コード生成系ツール)
- 相違点: コード生成ツールは「Web標準コード(React/HTML)を出力してブラウザで描画する」ため、決定論的でデバッグしやすいメリットがあります。一方Solarisは「コード化できない複雑な物理表現や未知のレイアウト」を1枚の画像アセットから直接生成できる点で異なります
- vs. Unity / Unreal Engine(リアルタイムゲームエンジン)
- 相違点: ゲームエンジンはインタラクティブな描画が得意ですが、C#やC++によるスクリプト記述、3Dモデルやシェーダーの構築があらかじめ必須です。Solarisは自然言語の指示と2Dアセットのみで動的なインタラクション空間を構築できます。
- vs. OpenAI Sora / Runway Gen-3(従来の動画生成AI)
- 相違点: 一般的な動画AIは一方向の映像出力(バッチ処理)ですが、Solarisはマウスクリックやドラッグなどの入力を毎フレームの生成プロセスに即座にフィードバックするインタラクティブなストリーミングエンジンです。
4. 解決した3つの主要な技術的課題
- リアルタイム推論(1秒未満のレイテンシ)
- 課題: 通常の動画拡散モデル(Diffusion Model)は描画に数秒〜数分を要する。
- 解決策: 複数ステップのデノイズ処理を数ステップに蒸留(Distillation)し、過去フレームのみから次フレームを生成する自己回帰型(Autoregressive)パイプラインを構築。
- 長時間のセッション一貫性(Coherence over Time)
- 課題: 生成モデル特有の「文字の潰れ」や「レイアウト崩れ」の累積。
- 解決策: 高速化したモデル自身の出力データを用いて追加学習(Self-Training)を施し、UIの文字やレイアウト形状を長時間安定化。
- 演算コストの低減(Cost Optimization)
- 課題: 全フレームを動画AIで出力するため、サーバーインフラコストが膨大。
- 解決策: 推論効率の最適化により、通常の動画生成AIと比較して数桁(orders of magnitude)レベルのコストカットを実現。
5. Solarisの内部動作メカニズム(処理プロセス)
Solarisの内部動作は、単一の処理ではなく「ユーザー操作のシグナル化」「LLMによる意思決定」「Solarisによるリアルタイム生成」という一連のプロセスが連続して連動することで機能します。
まず、ユーザーが行ったクリック、ドラッグ、マウスポインタの移動といった操作イベントは、コードとして処理されるのではなく、テキストや画像プロンプトと同等の「コンディショニング(条件付け信号)」として変換されます。モデルは直前のフレーム群とこの操作シグナルを組み合わせ、「操作の後にどのような視覚変化が起こるべきか」を直接受け取ります。
次に、ユーザーの操作意図や文脈の解釈は、バックエンドで機能するLLM(言語モデル)が担当します。LLMは操作シグナルを受けて「現在のシーン内での物理変化にとどめるべきか、全く新しい画面へ遷移すべきか」といったハイレベルな論理判断を行い、次のフレームを描画するためのプロンプト(レンダリング指示)を生成します。
最後に、LLMからの描画指示と直近の操作シグナルを受け取ったSolaris(世界モデル)が、インタラクティブなフレーム生成の映像を1フレームずつリアルタイムに生成します。蒸留された高速推論パイプラインにより、1秒未満の低遅延で次の画面を出力し、結果としてユーザーには「操作に対して画面が即座に反応して生きているように動く」シームレスなインタラクションが提供されます。
6. Solarisの料金体系・利用コスト
公式研究発表時点におけるSolarisの価格構造およびコスト面の仕様は以下の通りです。
- 研究プレビュー段階の提供形態: Solarisは研究発表段階のモデルであり、単体の従量課金API(1分あたりの単価設定など)としての一般価格は未公開です。既存のRunwayプラットフォーム(Standard/Pro/Unlimited等の月額プラン、クレジット制)のエコシステムや企業向けカスタム提供枠に順次統合・展開される見込みです。
- モデル推論コストの圧倒的削減: 従来のバッチ型動画生成AI(Gen-3等)をUIとして常時ストリーミング配信する場合、莫大なサーバーコストが発生する点が課題でした。Solarisはパイプラインの蒸留と自己回帰型モデルの最適化により、従来の動画拡散モデルと比較して「数桁(orders of magnitude)安い運用コスト」を達成しています。
- API利用時の想定課金モデル: 将来的に外部提供される場合、従来の生成AI APIで一般的な「生成トークン数」や「秒数課金」ではなく、UIインタラクションのセッション時間やストリーミングフレーム数に応じた従量課金体系(またはAPIリクエストベース)が適用される見通しです。
7. Solaris導入・活用に関するFAQ
Q1. Solarisは既存のHTML/CSS/JavaScriptを置き換えるものですか?
A. すべてのWebサイトを置き換えるものではありません。既存の決定論的なテキスト中心のフォームやDB検索等には従来のWebコードが最適です。Solarisは「事前にコード化することが困難な複雑なインタラクション(3D操作、動的シミュレーション、リアルタイム試着等)」や「AIエージェントの訓練環境」において活用されます。
Q2. AIエージェント開発にどのような影響を与えますか?
A. 従来のAIエージェント(コンピュータユース機能など)は、特定のDOM構造やUI配置が変わると操作に失敗しやすい課題がありました。Solarisを用いることで「レイアウトが常に動的に変化する環境」を作り出せるため、未知の画面にも対応できる柔軟なAIエージェントの強化学習(RL)環境として機能します。
Q3. コードが存在しない場合、開発者はどのように挙動を定義しますか?
A. プログラミング言語でイベントハンドラーを記述する代わりに、初期画像(アセット)と自然言語の指示(プロンプト)を用いて「特定のオブジェクトをクリックしたときにどう反応するか」のルールを世界モデルに与えます。
8. まとめ
Runwayの「Solaris」(2026年8月31日発表)は、単なる映像生成技術の延長ではなく、ソフトウェアとユーザーの接点(UI/UX)の構築概念そのものを再定義するプロダクトです。
- 中間表現(コード)の撤廃: デザインと動作の翻訳損失がなくなり、自由度の高いUIを実現。
- リアルタイム世界モデル:1秒未満の低遅延推論とセッション一貫性の維持により、実用レベルのストリーミングUIを実現。
- 新たな学習環境: 変動し続ける画面構造を生成することで、堅牢なAIエージェントのトレーニング基盤として機能。
決定論的なコードベースUIと生成型世界モデルが役割分担を進める中で、フロントエンド開発やAIエージェント研究における重要なブレイクスルーとして今後の動向が注目されます。