>100 Views
July 30, 26
スライド概要
DL輪読会資料
“Native Video-Action Pretraining for Generalizable Robot Control” Hiroaki Honda, Matsuo-Iwasawa Lab M1 1
書誌情報 ■ タイトル:Native Video-Action Pretraining for Generalizable Robot Control ■ 著者: Qihang Zhang ⋅ Lin Li ⋅ Luyao Zhang ⋅ Shuai Yang ⋅ Yiming Luo ⋅ … ⋅ Nan Xue ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Yinghao Xu(全29名、Robbyant) ■ 出典:arXiv:2607.08639v2 [cs.RO](2026年7月9日投稿・7月16日改訂) https://arxiv.org/abs/2607.08639 ■ プロジェクトページ:technology.robbyant.com/lingbot-va-v2 ■ 選書理由 • Autoregressive な World-Action Model に興味があったため 特に記載がない限り、本資料の図表は上記論文からの引用です 2
前提:動画行動モデルと LingBot-VA 観測から行動を直接出すのではなく、次に世界がどう変わるかを予測しながら行動を 決める 従来の VLA 観測 + 言語指示 World Action Model 観測 + 言語指示 行動 次の観測の予測 行動 • シーンの変化と行動を同時に予測することで、制御を物理的な動力学に接地させ、サンプル効率と汎化を高める狙 い • LingBot-VA(1.0) や DreamZero がこの系統の代表。ただしその能力の多くは、動画で事前学習されたバックボー ンから受け継いだもの – 出発点は「再構成用の VAE + Bidirectional Attention の動画拡散モデル」 – ロボットデータで継続学習することで Attention を Causal Attention に置き換え、行動モジュールを後から取り付ける 3
背景:既存の WAM の3つの限界 汎用の動画生成向けの backbone を流用している限り、 表現・速度・事前学習信号の3点で足りない ① 表現が pixel-reconstruction に最 適化されている ② 推論が閉ループ制御に対して遅い ③ 事前学習の信号が制御に向かって スケールしない Pixel-reconstruction で学んだ潜在表現は 視覚的な細部を保てるが、意味的・物理的 な構造を持たない 高次元の動画トークンと、反復的なノイズ 除去 Web 上の動画は大量にあるが、汎用的な 動画生成の目的関数は「行動が世界をどう 変えるか」を教えない 行動モジュールを後付けするため、 世界 の状態と行動が別々の空間に置かれたまま になる 世代の WAMs (←Bidirectional WAMs を指し 実機が必要とする制御周波数で回すには、 第一 ているのか?) は計算が重すぎる 行動の教師信号が高価なロボットデータか らしか得られない • さらに構造的な不一致として、バックボーンは Bidirectional Attention で事前学習されるのに、closed-loop 制御は 前向きにしか進まない (LingBot-VA の時からの問題意識) – LingBot-VA はロボットデータで後から Causal Model に作り替えるが、その学習は少ないロボットデータに依存するため、Web 規模で得た広い事前分布を弱めてしまう恐れがある 5
本論文の立場と貢献 流用してから後で直すのではなく、 ロボット制御のために最初から Causal に事前学習する • Semantic Visual-Action Tokenizer から Causal DiT まで、モデル全体を Web-scale な画像・動画で事前学習する • 世界の状態と行動をひとつの Semantic な潜在空間に置き、視覚・言語・行動の対応づけを学習する • Downstream tasks に10〜15 件のデモで適応し、また cross-embodiment transfer し、設定によっては Zero-shot で タスクを実行 • 実機では 非同期実行で最大 225 Hz 6
全体像 Planner → Tokenizer → MoE Video Model + Action Model → 非同期実行 • Planner: VLM で長期の目標を、構造化され た Subtask context に分解する • Tokenizer: 画像の観測と人間のデモ動画を、 視覚の潜在表現に符号化する • MoE Video Model と Action Model: 将来の 視覚潜在とロボットの行動を、Autoregressive に予測する • 複数チャンク予測 (MCP): 先の複数チャンク にも教師信号を与える • 非同期実行: 自己回帰のロールアウトを、実 機のリアルタイム制御につなぐ • 学習は2段階。 第1段でトークナイザ、第2段でその潜在空間 の上で Causal WAM を学習 7
定式化 1回の潜在遷移を動画生成と逆動力学に分け、これらを MoT の2つの Model に対応づける • 動画トークナイザは時間方向に ft 倍圧縮する一方、行動は元の制御周波数で記録される • したがって1回の潜在遷移が ft 個の低レベル指令のまとまり(チャンク)に対応する 動画生成と逆動力学への分解 (DreamZero とほぼ同じ) 学習目的 動画と行動、それぞれの Flow-Matching Loss の和 MoT(Mixture-of-Transformers) 2つのモダリティを別々の専門家に割り当て、Causal Attention だけを共有する 8
設計①-a:意味を揃える視覚トークナイザ 再構成に加えて、frozen な Perception Encoder の特徴に潜在表現を引き寄せる • ViT のオートエンコーダ。先頭フレームは 16×16 の空間パッチ、以降は 4×16×16 で spatial tubelet として符号化 • エンコーダはフレーム内は full attention、フレーム間は causal attention 。デコーダは対称 • 教師 G は凍結した Perception Encoder ()。学習可能な射影 Walign を挟み 、時間方向の表現(平均プーリング (avg) した表現)どうしを合わせる • クリップ全体の意味を合わせつつ、フレームごとの情報は再構成のために 残す(RepWAM の設計を踏襲) 9
設計①-b:潜在行動トークナイザ 行動ラベルを使わずに、連続する2つの潜在表現の差分を小さな「潜在行動」に押し込む zt 逆動力学 qφ 潜在行動 ℓt 順動力学 fψ ẑt+1 • 視覚トークナイザを凍結し、逆動力学 qφ と順動力学 fψ を一緒に学 習する • fψ は ℓt から輸送行列 Kt と残差 δt を予測。Kt が空間的な潜在トーク ン間で情報を動かし、δ t が輸送では説明できない変化を引き受け る • 逆向きの輸送で1つ前の潜在も復元し、 前向きの予測と後ろ向きの 整合 の両方で学習する • ℓt の次元のボトルネックが視覚状態のコピーを防ぎ、 制御に関係 する変化だけ を残させる • → ラベルのない Web 動画も行動の教師信号になる 。これからは a t ≡ ℓt として扱う 10
設計②:Causal Pretraining Bidirectional で学んでから Causal に作り替えるのではなく、最初から Causal のまま学ぶ 従来 (LingBot-VA など) 本手法 (native な 経路) Web 規模の動画で Bidirectional に事前学習 少ないロボットデータで Causal model に作り替え Web 規模で得た事前分布が弱ま る恐れ Web 規模の動画を最初から Causal のまま学習 作り替えの工程がそもそも存在 しない 広い事前分布を Causal の形のま ま獲得 • Causal な「次の潜在の予測」は自己教師ありなので、Web 動画にそのままスケールする • その時間構造が閉ループ制御と一致しているため、Bidirectional から Causal への作り替えに伴う忘却を回避できる 11
設計③:疎な MoE と複数チャンク予測 容量は増やしつつ1ステップの計算は増やさない。さらに複数チャンク先まで教師信号を与 える 疎な Mixture-of-Experts 複数チャンク予測(MCP) • Video DiT の全結合層を疎な MoE (inspired by DeepSeekMoE and DeepSeep-V3) にする→モデルサイズ増やしつつ1ステップ あたりの計算量を増やさない # experts: 128 Top-k: 8 Shared: 1 • 隣り合うチャンクは見た目が似ているため、 次チャンクだけを 教師にすると見た目のコピーで損失が下がってしまう • 複数の将来チャンクを同時に教師にし、軌道レベルの動力学 を 潜在表現に持たせる 12
設計④:階層プランナ 上位の VLM プランナが下位方策を条件づけ VLM Planner がタスクの目標と直近の疎な観測を受け取り、 構造化された Subtask Context (done, instruction, generation_instruction, local_scene_description) を出力 13
設計⑤:In Context Learning (ICL) 人間のデモ動画を視覚的なタスク指示として入力できるように学習 [60] LingBot-VA Team, RobbyAnt. Zero-wam: In-context world modeling for zero-shot task generalization. https://github.com/jiaming-zhou/Zero-WAM, 2026. 13
設計⑥:Human-Robot Data Co-training Egocentric human manipulation video とロボットデータを混ぜて co-training • 人間動画を混ぜて学習するときの 2 つの問題: 1. an action-space mismatch between human hands and robot grippers → 統一 action 空間への retarget(写像 Φ) • 手を「仮想的な平行グリッパ」とみなす(親指 = 片方の顎、残り4指 = もう片方) • 6-DoF 手首姿勢はそのまま、指の構成 𝑞→ スカラー開度 𝜙(𝑞)に集約 2. a motion gap between natural human motion and robot kinematics → embodiment 別の action head で吸収(共有モデル + 薄いアダプタ) • • 共有:video expert・action expert・causal attention 分離:action encoder 𝐸_𝑑と decoder 𝑃_𝑑 のみ 13
設計⑦:Training Recipe ステージ化されたカリキュラム学習ではなく Multi-task co-training を採用 • T2I → T2V → TI2VA, ICL, HCT の順にデータ比率を変えていく 13
設計⑧:Foresight Reasoning(非同期推論) 予測と実行を並列に走らせ、そのつど最新の実観測で先読み o_{t+1}を推測する • 素朴な非同期化の落とし穴:古い「想像した潜在」に条件づけし続けると、予測が実世界からずれていく • 本手法:方策自身の学習済み順動力学 (VM(FDM))を1ステップ挟み、毎回最新の実観測に予測を接地し直す 14
事後学習と推論の高速化 少ステップ化と実装の最適化を積み上げ、実機で非同期実行の最大 225 Hz に到達させる A. 拡散蒸留 動画と行動、両方の専門家を 2-steps のサンプラ (Consistency Model)に蒸留する B. モデルレベルの高速化:低精度・コンパイル実行 量子化 (中間層をFP8へ) とコンパイル済みの実行経路で、forwarding を軽くする C. 系列レベル:長期系列の注意の最適化 自己回帰で系列が伸びても、Attention 計算が支配的にならないようにする Sliding Window + FlashInfer D. システムレベル:実行時オーバーヘッド削減 推論そのもの以外の待ち時間を削る、リファクタリング 15
データ構成 Web 規模の一般動画を土台に、ロボット・一人称人間・文脈内学習用のデータを重ねる 一般の画像・動画データ: T2I, T2V LingBot-Video 学習のために集めたデータを再利用。Web 規模。T2I, T2V データとして使う。 ロボットデータ: TI2VA 数千時間の internal robot demos + AgiBot World + RoboMind + InternData-A1 + OXE + DROID + UMI-style datasets + Robocoin。Qwen3.5-397B で segment 化 や task instruction で relabeling 一人称視点の人間データ: HCT 数千時間の Internal data, 65.4k episodes, more than 600 operators, over 3.0k scene-task combinations In-context learning 用データ: ICL 5000 tasks, over 50,000 samples, data from over 10 robot video pre-training datasets (e.g., AgiBot World, OXE) 16
モデル・学習構成 モデルサイズ:Video backbone ≈13.0B total / ≈1.9B active; action expert ≈0.6B; MCP heads ≈1.7B; total ≈15.3B trained parameters (of which ≈2.5B are active per token at inference) 学習:Flow-matching objective Optimizer:Muon (2D weights, e.g. attention projections, dense action-FFN projections, and routed MoE expert projection) + AdamW (embedders, normalization/AdaLN parameters, biases, and output head) 16
実験①:実機での評価 少量デモでの適応、身体をまたいだ転移、設定によってはゼロショットでの実行 • 実機評価では、20 件×タスク数のデモで fine-tuning し評価 シミュレーション評価では、 2500 (clean) + 25000 (randomized) のデータで fine-tuning し評価 • シミュレーション (右表 RoboTwin 2.0) と実機 (上図) の両方で、π0.5 と LingBot-VA(1.0)を大きく上回ると報告 • ICL では、15 (episodes/task) *4 (tasks) のデモで fine-tuning した後に unseen tasks で評価し うまく動いたとされている 17
実験②:Ablation Semantic Tokenizer・MCP について、それぞれの寄与を確認 • 意味的な視覚・行動トークナイザ:1.3B video-action model で WAN 2.2 VAE と比較、long-horizon task でより性能向上 • 複数チャンク予測:MCP での正則化がある方がより収束が早い 18
まとめ 動画生成モデルの流用をやめ ロボット制御のためにモデル全体を最初から Causal に事前学習 • ① 意味的な視覚・行動トークナイザ: 再構成に加えて凍結した基盤モデルの特徴に潜在表現を揃え、行動ラベルなし で潜在行動を取り出す • ② Causal pretraining: Bidirectional から Causal への作り替えを避け、Web 動画にスケールする自己教師あり信号で 、最初から制御と同じ時間構造を学ぶ • ③ 疎な MoE と複数チャンク予測: 容量を保ったまま1ステップの計算を減らし、軌道レベルの動力学を潜在表現に持 たせる • ④ Foresight Reasoning: 予測と実行を並列化しつつ、学習済み順動力学で毎回の実観測に接地し直す。少ステップ 蒸留や量子化と合わせ、実機で非同期実行の最大 225 Hz 19