自動車およびロボットにおけるVLA大規模モデルのアプリケーション調査レポート、2026年
Research Report on Application of VLA Large Model in Automobiles and Robots, 2026
- 発行日
- ページ情報
- 英文 370 Pages
- 納期
- 即日から翌営業日
- 商品コード
- 2129080
- 翻訳ツール提供対象 PDF対応AI翻訳ツールの無料貸し出しサービスのご利用が可能です
- 自動車関連専門 自動車関連専門を専門とする市場調査会社です。
概要
自動車およびロボット分野におけるVLAの調査:ハイブリッドアーキテクチャが主流となり、VLAは一般的な世界モデルと統合され、強化学習が中核エンジンとして機能しています
VLAモデルとは、視覚、言語、アクションの各モダリティを統合したモデルです。統一されたマルチモーダル学習フレームワークを採用し、知覚、推論、制御を統合することで、視覚入力(画像・動画)や言語による指示から、実行可能な物理世界でのアクション(例:ロボットの関節運動、車両のステアリング・加速・制動制御など)を直接生成します。
VLAは、VLM(理解と記述)+E2E(エンドツーエンドの意思決定と制御)+CoT(人間のような推論の連鎖)に相当します。機能比較の観点から、VLAは精密な3D知覚、常識的な理解、論理的思考、および解釈可能性を同時に実現します。
1. VLAの現状と主な課題
自動運転におけるVLAの進化は、4つの段階に分けられます。
言語をインタープリターとして活用する段階(Pre-VLA):言語モデルは制御には関与せず、シーンの記述を生成するのみです。
モジュール型VLA:言語は意思決定のための計画コンポーネントとして機能しますが、多段階のワークフローにより遅延が生じます。
統合型エンドツーエンドVLA:センサー入力が単一の前方伝播を介してアクションに直接マッピングされます。
推論機能強化型VLA:LLMが制御の閉ループに入り、長期的な推論、記憶、および対話機能を実現します。Li AutoのMindVLAがその代表例です。
実装のタイムライン:
セグメント化されたエンドツーエンド方式は、2024年から2025年にかけて量産化されました。
単一モデルによるエンドツーエンドおよびVLAは、2025年から2026年にかけて広く導入されました。
2026年は、自動運転向け大規模モデルにとって、「多角的な競合の激化とパラダイム統合の加速」という重要な転換期となります。
技術的状況と主要指標。
幅広いモデルパラメータ:NVIDIA Alpamayo 1.5には0.5B/10Bのパラメータが含まれています;DeepRoute.aiは40Bパラメータの基盤モデルを使用しています;Afari TechnologyのStepVL基盤モデルは32Bのパラメータを特徴としています(7Bおよび3.6Bに蒸留);Li AutoのMindVLA 32Bパラメータ基盤モデルは、3.6BパラメータのMoEバリアントに蒸留されており、車両モデルには4Bが割り当てられています。
車載リアルタイム性能:Li Autoはスパースアテンション+MoEを活用し、Orin X上で10Hzおよび100msのレイテンシを実現しています。Xpengの第2世代VLAは、80ms未満のレイテンシを実現しています。DeepRoute.aiの40Bパラメータモデルは、KVキャッシュ、マルチトークン予測(MTP)、量子化、およびカスタマイズされたエンジンを活用し、シングルステップのレイテンシを60~85ms、閉ループを10~15Hzに抑えています。
演算能力の適応:DeepRoute.aiは、100TOPSプラットフォームに純粋な運転用VAモデルを、500TOPSプラットフォームに推論可能なVLAモデルを展開できます。Qualcomm 8797チップを2基搭載したLeapmotor D19(1280TOPS)は、エンドサイドでのVLA支援運転を実現しています。Geely H9は、NVIDIA Thorチップを2基採用しています(2000TOPS)。
オープンループ性能:nuScenesデータセットに基づく評価では、VLAはワールドモデルに比べて軌跡誤差が著しく小さいことが示されました。例えば、70億パラメータを持つAutoDrive-R2はL2距離0.19m、SENNAは0.22mを達成していますが、最高性能のワールドモデルであるDrive-OccWorldでも0.32mにとどまっています。こうした結果は、VLAが人間の実際の走行軌跡を再現できる能力を有していることを示しています。
主な課題
リアルタイム性能と計算能力のボトルネック:従来の自己回帰型VLA生成は3~6Hzにしか達せず、単一推論のレイテンシは一般的に200msを超え、車両の計算能力とストレージ帯域幅を大量に消費します。
データ監督の不足:VLAは高次元の視覚入力を受け取る一方で、低次元の疎なアクションによって監督されるため、モデルの潜在能力が制限されています。高密度な監督を行うためには、将来の画像を予測するワールドモデルが必要となるか、あるいは動画予測の事前学習を採用する必要があります。
安全性の冗長性の欠如:エンドツーエンドの単一モデルによるVLAは耐障害性が低く、従来のアルゴリズムによるフォールバックが必要です。例えば、広く採用されているファスト・スローのデュアルシステム、Horizon RoboticsのLite Safety Checker、およびBoschのセーフティゲーティング報酬メカニズムなどが挙げられます。
幻覚やロングテールシナリオ:複雑または未見のシナリオでは成功率が低下します。改善には、ワールドモデルと強化学習による探索が必要であり、例として、BoschのExploreVLA、HuaweiのWEWA、MomentaのR7などが挙げられます。
2. OEM各社の代表的なVLAソリューション
OEM各社の中では、Xpengの第2世代VLAとLi AutoのMindVLAが代表的な事例として挙げられ、これらはそれぞれ「ネイティブマルチモーダル実世界基盤モデル」と「空間・言語・行動の統合+暗黙的世界モデル」という2つの技術的アプローチに対応しています。
Xpengの第2世代VLA
Xpengは、自動運転は本質的に物理的なAI問題であるという見解を掲げています。同社の第2世代VLAは、ネイティブマルチモーダル物理世界基盤モデルとして構築されています。ネイティブマルチモーダルトークナイザーにより、単一モーダリティのバイアスを回避するための高効率な初期段階の融合を実現しています。視覚推論の「思考連鎖(CoT)」により、推論効率が32倍向上します。車間追従のシナリオでは、モデルが車線変更や車間追従といった操作案を自動的に生成し、評価のための抽象的な鳥瞰図を作成します。ネイティブなコックピット・運転連携により、モデルはアクションだけでなく動画や音声も生成することができ、VLAの基盤として、また世界モデル、シミュレーション、強化学習のための基盤フレームワークとして機能します。2段階モデルを参考にし、1段階の基盤モデルを再学習させ、言語変換のリンクを排除することで、レイテンシを80ms未満に抑えています。
Li Auto MindVLA
そのアーキテクチャは3つのコンポーネントで構成されています。
V(空間知能):BEVおよびOCCに基づき、中間表現として3Dガウス分布を採用し、LiDAR点群を3D幾何学的プロンプトとして活用し、3D ViTエンコーダとフィードフォワード3DGSを介して3Dシーン再構成を行います。静的な環境と動的なオブジェクトは別々にモデル化されます。
L(言語知能):LLM基盤モデルを再学習します(MoEおよびスパースアテンションメカニズムを活用)。高速思考の並列デコードではアクショントークンを直接出力し、低速思考ではCoTとアクショントークンを同時に出力します。
A(アクション戦略):アクションエキスパートを組み込んだVLA-MoEアーキテクチャを採用しています。離散拡散と並列デコーディングの反復最適化を用いて、高精度な走行軌道を出力します。
4段階のエンジニアリング:
VL基盤モデルの事前学習(32B、Orin-X/Thor-Uのデュアル環境に適応させるため、3.6BのMoEへポストディスティル)
模倣学習によるポストトレーニング(4B)
強化学習(RLHF+純粋なRL、閉ループ型ワールドシミュレータの構築)
ドライバーエージェントHMI
その後、MindVLA-U1により、言語と連続動作の統合ストリーミングおよび共同モデリングが可能となり、Intent-CFGが導入されました。
その他のOEM:
Xiaomi XLAコグニティブ・ラージ・モデル(VLM+エッジ・クラウド統合、VLAの導入を予定);
Leapmotor LEAP 4.0 VLA(エッジ側でのフルモダリティ、「理解・計画・プレビュー・判断・修正」の閉ループ);
Great Wall CP Master Dual VLA(左脳:運転エージェント、右脳:コックピットエージェント);
Chery Falcon 900(VLA+ワールドモデル、L3対応)。
3.サプライヤーの代表的なVLAソリューション
サプライヤーの最も代表的なソリューションは、NVIDIAのAlpamayoとDeepRoute.aiの40B VLAであり、それぞれ「推論ベースのデュアルLLM VLA+ワールドモデル」および「40B統合ベースの3段階VLA」ソリューションを体現しています。
NVIDIA Alpamayo
NVIDIA Alpamayoは、物理AIデータセット、VLA大規模モデル、およびAlpaSimシミュレーションフレームワークを網羅するシステムレベルのVLAソリューションです。OEM各社に対し、車両への導入に向けた3世代の軌跡生成オプションを提供しています。具体的には、回帰予測(TensorRT、例:SparseDrive)、拡散生成(TensorRT、例:DiffusionDrive)、およびフローマッチング(TensorRT-Edge-LLM、例:Qwen3 VLに基づくAlpamayo)です。
Alpamayo-R1-10Bを例に挙げましょう。入力には、過去の画像、ユーザーの指示、過去の軌跡、およびノイズを含むアクションが含まれます。入力データは、VLMフローマッチング・トークナイザーを介して、テキスト、画像、および軌跡トークンに変換されます。80億パラメータのQwen3 VL-LLMがシーンの理解と暗黙的なCoT推論を行い、推論テキストを出力するとともに、KVキャッシュを生成します。2BパラメータのQwen3 VL-LLMは、ノイズの混入した軌跡とKVキャッシュを受け取り、フローマッチングによる段階的なノイズ除去と補正を行い、最終的に将来の軌跡を出力します。Cloud Cosmosワールドモデルは、ロングテールシナリオ向けのトレーニングデータを生成します。車両への導入においては、安全上のフォールバックとして従来のアルゴリズムを採用し、エンドツーエンドのVLAを主要システムとして、L2~L4をサポートします。将来、潜在空間推論の処理速度は2~4倍に向上することが期待されています。
DeepRoute.ai 40B VLA
DeepRoute.aiは、自動運転の意思決定を3つのフェーズに分解しています。
観察フェーズ—マルチカメラの動画が、約1,000個の視覚トークンにエンコードされます。
推論フェーズ—モデルはシナリオの詳細な意味解析を行い、主要なイベントや意思決定ロジックの記述を生成します。推論トークンの数は10~50に厳密に制御されます。
実行フェーズ- 運転制御コマンドを出力するのに必要なトークンは、わずか10個程度です。
本システムは、統一された40Bパラメータの基盤モデルを通じて、「ドライバー(センサー入力に基づいて行動する)」、「アナリスト(因果関係を分析する)」、「コメンテーター(判断し、意思決定を行う)」という3つの機能を統合しています。「運転前の思考」を実現するため、V+A、V+A→L、V→L+Aという3つのタスクカテゴリにわたる共同学習が実施されています。事前学習では、軌道に基づく監督学習から動画予測へと切り替えます。膨大な量の動画を活用してピクセル単位で物理法則を学習することで、データ利用率を0.001%から100%へと向上させます。デプロイ時には、KVキャッシュ、MTP、量子化、およびカスタマイズされた推論エンジンにより、1ステップあたりのレイテンシを60~85msに低減し、10~15Hzの車両リアルタイム閉ループを実現しています。モデル蒸留は演算能力に応じて行われ、純粋な運転用VAモデルは100TOPSプラットフォーム上で、完全なVLAモデルは500TOPSプラットフォーム上で動作します。
その他のサプライヤー:
Afari Technologyは、「VLA+E2E」協調型閉ループを採用しています。VLAの低速システムはCoTテキストを出力し、E2Eの高速システムはターゲット検出/車線検出結果を出力して、これらを融合させ、計画および制御に活用します。StepVL 4.0は、32Bの事前学習済みモデルから7Bへと蒸留されています。
QCraftは2026年に「VLA+ワールドモデル+強化学習」という統合アーキテクチャへアップグレードし、単一のJourney 6Mチップ上で都市部におけるNOAを実現します。
Zhuoyuは、VLAワールドモデル(ネイティブマルチモーダル基盤モデル、Chain of World、および構造・運動が分離された潜在運動表現)をリリースしました。
4. VLAの開発動向
動向1:ハイブリッドアーキテクチャが主流に
ディフュージョン、トランスフォーマー、LLM/VLMの深い統合が主流となります。ディフュージョンは、高品質な連続的な動作や軌跡の生成に優れています。トランスフォーマーは、長いシーケンスのモデリングに長けています。LLM/VLMは、意味論的およびマルチモーダルな理解に優れています。代表的な例としては、Li AutoのMindVLA(3Dガウス分布+MoE LLM+ディフュージョン・アクション・エキスパート)、NVIDIAのGR00T-N1(ファスト・スロー・デュアルシステム:ファスト200Hzディフュージョン・アクション、スロー10Hz VLM)、HybridVLA(自己回帰+協調型ディフュージョン)などが挙げられます。業界では、以下の3つの統合モデルが形成されています:1.単一モデルのエンドツーエンド(E2E)+ワールドモデル+強化学習(RL)(Momenta、Horizon Robotics);2. VLA+ワールドモデル(XPengなど);3. E2E+VLM/VLA基盤モデル(Afari TechnologyのVLAスローシステム+E2Eファストシステム)。
動向2:VLAと汎用ワールドモデルの統合による「ワールドVLA/VLAワールドモデル」の誕生
VLAは認知と行動を担い、ワールドモデルは将来の予測を担います。これらを統合することで、自動車は単なる移動手段から移動ロボットへと変貌を遂げ、ルール駆動型から認知駆動型へと移行し、自律的な知覚、推論・意思決定、そして精密な実行能力を備えるようになります。ZhuoyuのVLAワールドモデルは、第3世代のネイティブマルチモーダル基盤モデルへと進化しました。「Chain of World」により、潜在空間において多段階の世界状態予測を行い、「行動の前に思考する」ことを実現しています。構造と運動の分離、および潜在的な運動表現により、再構築コストを低減しています。Geely G-ASDはVLAと世界モデルを統合し、車両が自動的にタスクを実行できるようにしています。WorldVLAは、生成のために動作と画像を共同で理解し、世界モデルと動作モデルが互いに補完し合っています。
動向3:VLA+ワールドモデル+強化学習(RL)の三位一体の統合、RLを中核エンジンとして
業界では、「事前学習→シミュレーション→強化学習」という3層アーキテクチャが形成されています。ワールドモデルがロングテールシナリオを生成し、VLAがインループ推論を行い、強化学習が推論空間において最適な戦略を反復的に導き出します。代表的な例としては、HuaweiのWEWA 2.0(マルチエージェントゲーム+クラウドオンラインRL、学習強度が10倍に増加)、MomentaのR7(3段階プロセス:事前学習→シミュレーション→RL、AIを「模倣者」から「意思決定者」へと変革)、Pony.aiのPonyWorld 2.0(自己診断+ターゲットを絞った進化+精密フライホイール)などが挙げられます。
一方、ワールドモデルは、ピクセルレベルの予測から潜在空間および因果推論へと進化しています。NVIDIAのAlpamayoは、潜在空間における暗黙的推論を通じて2~4倍の高速化を実現し、Chain of Causality(CoC)を通じて完全な推論チェーンを生成します。Li Autoは、予測的な暗黙的ワールドモデルをVLAに組み込んでいます。Xpengは、言語変換のリンクを排除し、情報損失を軽減するためにアーキテクチャをV-L-AからV/L-Aへと改訂しました。HuaweiのDriveVLA-W0は、ワールドモデルの統合により、データ量が70万フレームから7,000万フレームへと拡大するにつれて衝突率が低下し続け、こうした利点が増幅され、データスケーリングの法則が強化されることを実証しています。
動向4:技術実装と安全性の確保が加速
2025年から2026年にかけて、ワンモデル・エンドツーエンドおよびVLAソリューションが広く導入されます。L3/L4の進化に伴い、安全性の冗長性が不可欠となっています(従来のアルゴリズムによるフォールバック+エンドツーエンドのメインシステム。例:NVIDIAのファスト・スロー・デュアルシステム、Horizon RoboticsのLite Safety Checker、Boschの安全ゲーティングPDMS報酬)。演算能力の階層的ディスティレーションが量産化の鍵となっています:100~500 TOPSでのVA/VLA(DeepRoute.ai)の柔軟な展開、およびL3をサポートするデュアルThor/デュアル8797などの高性能コンピューティングプラットフォームです。
VLAは、自動運転が「エンドツーエンドの知覚・制御」から「理解・推論・制御」へと進化するための中核的な道筋となります。2026年には、OEM(XPeng、Li Autoなど)とサプライヤー(NVIDIA、DeepRoute.ai、Afari Technology、QCraftなど)の両方の推進により、VLAはワールドモデルや強化学習と深く統合され、ハイブリッドアーキテクチャを形成し、「World VLA」のプロトタイプが具体化します。レイテンシ、演算能力、データの監督、およびセキュリティの冗長性といった課題が徐々に解決されるにつれ、VLAはレベル3以上の自動運転の大規模な展開を支え、車両が物理世界における汎用エージェントへと進化することを可能にするでしょう。
目次
定義
第1章 VLA大規模モデルの概要
- VLAモデルの基本的な定義
- VLAモデルの基本概念
- VLAモデルの基本原理
- VLAモデルの基本的な特性
- VLAモデルの起源と変遷(1)(2)
- VLAモデルの利点(1)~(3)
- VLAモデルとワールドモデルの比較(1)~(3)
- VLAモデルの分類と進化
- VLA大規模モデルの分類
- VLA大規模モデルの変遷(1)~(3)
- VLAモデルの課題(1)~(5)
- VLAモデルの主要な特徴とアーキテクチャ
- VLAモデルの主な特徴
- VLAモデルの代表的なアーキテクチャ(1)~(5)
第2章 インテリジェントビークルのVLAモデルの進展
- インテリジェントビークルのVLAモデルのサマリー
- OEM各社のインテリジェント運転モデルのサマリー(1)~(3)
- サプライヤーのインテリジェント運転モデルのサマリー(1)~(3)
- 3タイプのインテリジェントドライビングモデルの比較(1)~(3)
- インテリジェントビークルVLAモデルの代表的なソリューション(1)~(9)
- インテリジェントビークルVLAモデルの事例(1)~(9)
- インテリジェントビークルVLAモデルの開発動向(1)~(5)
- 最新のインテリジェントビークルVLAモデル(1):Li Auto MindVLA-U1
- 最新のインテリジェントビークルVLAモデル(2):Xpeng Evo Drive VLA
- 最新のインテリジェントビークルVLAモデル(3):Xiaomi Auto Drive World-VLA
- 最新のインテリジェントビークルVLAモデル(4):Xiaomi Auto LaST-VLA
- 最新のインテリジェントビークルVLAモデル(5):BYD HyWorld VLA
- 最新のインテリジェントビークルVLAモデル(6):NVIDIA Alpamayo-R1
- 最新のインテリジェントビークルVLAモデル(7):Shanghai Jiao Tong University X Huawei VLA-World
- 最新のインテリジェントビークルVLAモデル(8):Beihang University X Tsinghua University Curious VLA
第3章 OEMおよびサプライヤーによるVLAモデルのアプリケーションソリューション
- Li Auto
- インテリジェントドライビング大規模モデルの進化(1)(2)
- New-generation VLAモデル MindVLA-o1(1)~(6)
- Xpeng
- インテリジェントドライビング大規模モデルの進化(1)(2)
- 2nd-generation VLA(1)~(5)
- VLAモデル Application:Xpeng G7 Ultra
- Chery
- インテリジェントドライビング大規模モデルの進化(1)(2)
- VLAモデル(1)~(4)
- Geely
- インテリジェントドライビング大規模モデルの進化(1)(2)
- VLAモデル(1)~(4)
- Xiaomi Auto
- インテリジェントドライビング大規模モデルの進化(1)(2)
- VLAモデル(1)~(4)
- Leapmotor
- インテリジェントドライビング大規模モデルの進化(1)(2)
- VLAモデル Application:Leapmotor D19
- Great Wall Motor
- インテリジェントドライビング大規模モデルの進化:機能とアプリケーション
- VLAモデル(1)(2)
- Changan Automobile
- インテリジェントドライビング大規模モデルの進化(1)(2)
- VLAモデル(1)(2)
- DeepRoute.ai
- VLAモデル(1)~(4)
- Horizon Robotics
- VLAモデル(1)(2)
- QCraft
- VLAモデル(1)~(4)
- Zhuoyu Technology
- VLAモデル(1)~(4)
- エコシステムパートナー
- 提供車両モデル
- NVIDIA
- VLAモデル(1)~(3)
第4章 ロボット用VLAモデルの進展
- ロボットVLAモデルのサマリー
- ロボット大規模モデルの分類(1)(2)
- ロボットVLAモデルとVLNモデルの比較
- ロボットVLAモデルの課題
- ロボットメーカーの大規模モデルのサマリー(1)~(7)
- ロボットサプライチェーン企業の大規模モデルサマリー(1)~(3)
- ロボットVLAモデルの代表的なソリューション(1)~(4)
- ロボットVLAモデルの代表的な事例(1)~(8)
- ロボットVLAモデルの開発動向(1)~(4)
- 最新のロボットVLAモデル(1):ModelBest MiniCPM-Robotモデル
- 最新のロボットVLAモデル(2):Tencent Hy-Embodied-RxBrain-1.0
- 最新のロボットVLAモデル(3):Xiaomi-Robotics-1
- 最新のロボットVLAモデル(4):Robbyant LingBot-VLA 2.0
- 最新のロボットVLAモデル(5):Alibaba Tongyi Qwen-VLA
- 最新のロボットVLAモデル(6):New ZR-0 2.6Bパラメータモデル
- 最新のロボットVLAモデル(7):Physical Intelligenceπ0.7
- 最新のロボットVLAモデル(8):AgiBot Genie Operator-2
- 最新のロボットVLAモデル(9):Tsinghua University Harness VLA
第5章 ロボット企業およびサプライヤーによるVLAモデルの応用ソリューション
- AgiBot
- 5つの自己開発モデルのサマリー
- VLAモデル(1)~(6)
- Galbot
- 自己開発大規模モデルのサマリー
- VLAモデル(1)~(6)
- ROBOTERA
- VLAモデル(1)~(4)
- Unitree Robotics
- VLAモデル(1)~(4)
- Figure AI
- Robot VLAモデル(1)~(5)
- 1X Technologies
- Robot VLAモデル(1)~(5)
- Xpeng IRON
- ロボットモデル展開のサマリー
- ロボットモデルの進化
- Robot VLAモデル(1)~(4)
- Xiaomi Cyberone
- ロボットモデルの展開
- ロボットモデルの概要
- Robot VLAモデル(1)~(3)
- NVIDIA
- Robot VLAモデル(1)~(7)
- SenseTime
- 大規模モデルのサマリー
- Robot VLAモデル(1)~(3)
- Alibaba
- ロボットモデルのサマリー
- Robot VLAモデル(1)~(4)
- ByteDance
- 大規模モデルのサマリー
- ロボットVLAモデルのサマリー
- Robot VLAモデル(1)~(4)
- 発行日
- 発行
- ResearchInChina
- ページ情報
- 英文 370 Pages
- 納期
- 即日から翌営業日