【DL輪読会】Agent Learning via Early Experience

139 Views

July 30, 26

スライド概要

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

ダウンロード

関連スライド

各ページのテキスト
1.

DEEP LEARNING JP [DL Papers] “Agent Learning via Early Experience” (ICML 2026) Jianqi Yang (Matsuo-Iwasawa Lab, M1) http://deeplearning.jp/

2.

Bibliography Information Title Agent Learning via Early Experience Authors Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, et al.(計30名, †Yu Su, Yifan Wu) Affiliations Meta Superintelligence Labs / The Ohio State University / FAIR at Meta Publication ICML 2026(Poster) Arxiv https://arxiv.org/abs/2510.08558 (Code: github.com/OSU-NLP-Group/EarlyExperience) Summary • 報酬なしで、エージェント自身の行動が生む「次状態」を教師信号に変える early experience パラダイムを提案( 模倣学習とRLの中間) • Implicit World Modeling / Self-Reflection の2手法を8環境×3モデルで検証し、模倣学習比 +1〜+18pt、OOD汎化とRL のwarm startでも一貫した優位を確認

3.

背景:模倣学習とRLの間のギャップ • RL=「経験の時代 (era of experience)」は理想だが、実環境の多くで適用困難 – Webサイト等には検証可能な報酬がない(例:フォーム送信の成否が返らない) – マルチターンツール利用は long-horizon で credit assignment が不安定・非効率 • 現実の主流はSupervised Fine-Tuningだが、本質的な限界がある – 専門家デモは高コストでスケールしない/カバレッジが狭い – 自分の行動の結果を一度も観測しない → 分布シフトに脆弱・失敗から回復できない • 問い:報酬なしで、エージェント自身の経験から学習できないか?

4.

提案:Early Experience パラダイム • • 専門家デモの各状態 sᵢ を起点(アンカー)に、ポリシー自身が代替行動 aʲ を提案し実環境で実行 観測された次状態 sʲ を収集 → D_rollout = {(sᵢ, aʲ, sʲ)}:報酬ラベル不要の教師信号 – 行動の結果(エラーメッセージ・画面遷移・予算残高…)が環境からの暗黙のフィードバック • D_rollout の使い方として2つの戦略を提案:Implicit World Modeling / Self-Reflection

5.

手法①:Implicit World Modeling(IWM) • 次状態予測を補助タスクとしてポリシー自身に組み込む – 別モジュールの世界モデル(シミュレータ)は作らない — 方策と同一 パラメータ θ – 状態は自然言語 → ただの next-token prediction になる(下の式) • • 2段階学習:Stage1 世界モデル目的で1 epoch → Stage2 通常 のSFT(合計更新数はILと同一) 遷移の規則性・無効行動の帰結を内在化 → 脱線に頑健、軽量 な warm-up

6.

手法②:Self-Reflection(SR) • 専門家行動と代替行動、それぞれの「実際の結果」を並べて見 せ、専門家行動が良い理由 c を生成させる – プロンプト= sᵢ/専門家行動 aᵢ とその結果/代替行動 aʲ とその結果 • • • 学習目標は「説明 c + 専門家行動 a」の連結(下の式)。 D_expert と混合してSFT 例(WebShop):$30の赤シャツより$15の青シャツ →「予算 制約を優先」という転移可能な原則 理由は観測された事実に接地 — 事実を見ずに想像で理由を書 く方式(STaR)は幻覚を含み、学習すると劣化(Table 3)

7.

実験設定:2つの軸で選ばれた8環境 • • 行動空間(閉じた→構造化→開いた)×観測の複雑さ(短文→API→Webツリー)をカバー →「どこでも効くか」の検証 モデル:Llama-3.2-3B / Qwen-2.5-7B / Llama-3.1-8B(Instruct)。ベースラインは同一プロンプト・同一step予算の模倣学習(IL) 環境 タスク例(Appendix Cの実例) 行動空間 観測 ALFWorld 「本を2冊ベッドに置く」(テキスト家事) 有限(合法行動リストから選択) 短い場面テキスト ScienceWorld 「アルミ箔が導電性か実験で判定」 有限 実験の手続き的テキスト TravelPlanner 「予算$1,700で3日間の旅程を組む」 有限(有効行動を列挙) 予算・計画の構造化テキスト BFCLv3 「log.txt を archive へ移動」(関数呼び出し) 構造化・大(型付きツール+引数) APIスキーマ・実行結果 Tau-Bench (Retail) 「顧客の注文変更に対応」(対話+API) 構造化・大(多ドメインAPI) 顧客対話+ツール出力 SearchQA 「Boridiがある国の第9代総督は?」(多段検索) 開いた(検索語を自由生成) 検索文書スニペット WebShop 「$130以下の青いBTヘッドホンを購入」 ページ内の選択肢+検索語 商品ページテキスト WebArena-Lite 「2023年1月の売上上位3商品は?」(管理画面) 要素×操作の組合せ 数百要素のaccessibility tree

8.

結果①:8環境・3モデルすべてで模倣学習を上回る • IWM:遷移が安定した環境で特に大きい – WebShop +11.3〜+18.4 / ALFWorld +4.7〜+5.5 • SR:多段推論・制約充足が要る環境で最大 – TravelPlanner +12.8〜+15.0 – ScienceWorld(8B)+13.3 / BFCLv3(3B)+8.0 • 行動空間が閉じた環境から開いた環境まで一貫し て有効

9.

結果②:Out-of-Domain(OOD)でも一貫して改善 • • OODでは全手法とも性能が下がるが、early experience がギャップの相当部分を回復 SearchQA 等では相対利得が in-domain 以上 – 自分のrolloutの教師信号化が「デモ未カバーの状態」への備えになる • IWMはダイナミクスが安定した環境(ALFWorld +14.8)、SRはツール可用性・引数が変わるシフト( BFCLv3 +8.5)に強い

10.

結果③:RLのwarm startとしても有効 • • 報酬が使える3環境で、各チェックポイントから同一レシピ・同一step数のGRPOを実行 early experience 起点は post-RL の到達点が常にIL起点以上(例:WebShop 3B 82.0→92.2) – ベースモデルから直接RLは最弱・不安定 → 強い初期化としての価値 • 「人間データの時代」と「経験の時代」をつなぐ mid-training bridge

11.

分析:データ効率・分岐数K・モデルスケール • • デモを1/8に減らしても全量ILを超える(WebShop)→ 専門家デー タの大幅節約 IWMは分岐数K増で単調改善、SRはK=2〜4がベスト – Kが大きすぎると「成功しうる代替」が混ざり対比が薄まる • 70B(LoRA)でも利得が持続 → モデルサイズと相補的(右図)

12.

考察:なぜ効くのか — 観測された次状態への「接地」 • 環境と相互作用しない代替手法はすべて失敗(右表, Llama-3.1-8B) – Long CoT(推論時のみ):微増どまり。SFT済みモデルに 適用すると崩壊(−47〜−55pt) – Self-Taught Reasoner (STaR):接地なしで生成した根拠 は幻覚を含み、学習すると劣化 – DPO(rollout行動を負例に):数十stepで学習崩壊(報告 値は崩壊前ベスト) • 選好や根拠という「形式」ではなく、実際の遷移に接地 した教師信号が本質

13.

まとめと Limitations • まとめ – 報酬なしで「自分の行動の結果=次状態」を教師信号化する early experience を提案(ILと RLの中間) – IWM / SR の2手法が8環境×3モデルで一貫改善。OOD汎化・RL warm start・データ効率でも優位 • Limitations(論文記載+見解) – – – – • 専門家状態への「リセット+任意行動の実行」が可能な環境が前提 → 実Web・物理環境では収集コスト/安全性が課題 専門家状態からの1-step逸脱のみ:複合誤差やリカバリ軌道は学習しない IWMの実態は「タスク条件付き要約」の予測が多い(環境ごとの状態表現設計)/SRは品質フィルタに依存 分散・シード非報告:WebArena-Lite等の小さな差(+2〜3pt=数タスク差)はノイズ域の可能性 所感:「新パラダイム」というより堅実な mid-training レシピ。デモ半減で同性能は実務的価値が大きい