---
title: 【DL輪読会】Agent Learning via Early Experience
tags: 
author: [Deep Learning JP](https://www.docswell.com/user/DeepLearning2023)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/KE4WQDP3J1.jpg?width=480
description: 【DL輪読会】Agent Learning via Early Experience by Deep Learning JP
published: July 30, 26
canonical: https://www.docswell.com/s/DeepLearning2023/ZMQYRE-2026-07-31-165420
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/KE4WQDP3J1.jpg)

DEEP LEARNING JP
[DL Papers]
“Agent Learning via Early Experience” (ICML 2026)
Jianqi Yang (Matsuo-Iwasawa Lab, M1)
http://deeplearning.jp/


# Page. 2

![Page Image](https://bcdn.docswell.com/page/L71YPZ9ZJG.jpg)

Bibliography Information
Title
Agent Learning via Early Experience
Authors
Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, et al.（計30名, †Yu Su, Yifan Wu）
Affiliations
Meta Superintelligence Labs / The Ohio State University / FAIR at Meta
Publication
ICML 2026（Poster）
Arxiv
https://arxiv.org/abs/2510.08558
（Code: github.com/OSU-NLP-Group/EarlyExperience）
Summary
• 報酬なしで、エージェント自身の行動が生む「次状態」を教師信号に変える early experience パラダイムを提案（
模倣学習とRLの中間）
• Implicit World Modeling / Self-Reflection の2手法を8環境×3モデルで検証し、模倣学習比 +1〜+18pt、OOD汎化とRL
のwarm startでも一貫した優位を確認


# Page. 3

![Page Image](https://bcdn.docswell.com/page/G7WG29Q6E2.jpg)

背景：模倣学習とRLの間のギャップ
•
RL＝「経験の時代 (era of experience)」は理想だが、実環境の多くで適用困難
– Webサイト等には検証可能な報酬がない（例：フォーム送信の成否が返らない）
– マルチターンツール利用は long-horizon で credit assignment が不安定・非効率
•
現実の主流はSupervised Fine-Tuningだが、本質的な限界がある
– 専門家デモは高コストでスケールしない／カバレッジが狭い
– 自分の行動の結果を一度も観測しない → 分布シフトに脆弱・失敗から回復できない
•
問い：報酬なしで、エージェント自身の経験から学習できないか？


# Page. 4

![Page Image](https://bcdn.docswell.com/page/4JZLD9WRE3.jpg)

提案：Early Experience パラダイム
•
•
専門家デモの各状態 sᵢ を起点（アンカー）に、ポリシー自身が代替行動 aʲ を提案し実環境で実行
観測された次状態 sʲ を収集 → D_rollout = {(sᵢ, aʲ, sʲ)}：報酬ラベル不要の教師信号
– 行動の結果（エラーメッセージ・画面遷移・予算残高…）が環境からの暗黙のフィードバック
•
D_rollout の使い方として2つの戦略を提案：Implicit World Modeling / Self-Reflection


# Page. 5

![Page Image](https://bcdn.docswell.com/page/YE6W1KG1EV.jpg)

手法①：Implicit World Modeling（IWM）
•
次状態予測を補助タスクとしてポリシー自身に組み込む
– 別モジュールの世界モデル（シミュレータ）は作らない — 方策と同一
パラメータ θ
– 状態は自然言語 → ただの next-token prediction になる（下の式）
•
•
2段階学習：Stage1 世界モデル目的で1 epoch → Stage2 通常
のSFT（合計更新数はILと同一）
遷移の規則性・無効行動の帰結を内在化 → 脱線に頑健、軽量
な warm-up


# Page. 6

![Page Image](https://bcdn.docswell.com/page/GE5M4PVLE4.jpg)

手法②：Self-Reflection（SR）
•
専門家行動と代替行動、それぞれの「実際の結果」を並べて見
せ、専門家行動が良い理由 c を生成させる
– プロンプト＝ sᵢ／専門家行動 aᵢ とその結果／代替行動 aʲ とその結果
•
•
•
学習目標は「説明 c ＋ 専門家行動 a」の連結（下の式）。
D_expert と混合してSFT
例（WebShop）：$30の赤シャツより$15の青シャツ →「予算
制約を優先」という転移可能な原則
理由は観測された事実に接地 — 事実を見ずに想像で理由を書
く方式（STaR）は幻覚を含み、学習すると劣化（Table 3）


# Page. 7

![Page Image](https://bcdn.docswell.com/page/9729V633JR.jpg)

実験設定：2つの軸で選ばれた8環境
•
•
行動空間（閉じた→構造化→開いた）×観測の複雑さ（短文→API→Webツリー）をカバー →「どこでも効くか」の検証
モデル：Llama-3.2-3B / Qwen-2.5-7B / Llama-3.1-8B（Instruct）。ベースラインは同一プロンプト・同一step予算の模倣学習（IL）
環境
タスク例（Appendix Cの実例）
行動空間
観測
ALFWorld
「本を2冊ベッドに置く」（テキスト家事）
有限（合法行動リストから選択）
短い場面テキスト
ScienceWorld
「アルミ箔が導電性か実験で判定」
有限
実験の手続き的テキスト
TravelPlanner
「予算$1,700で3日間の旅程を組む」
有限（有効行動を列挙）
予算・計画の構造化テキスト
BFCLv3
「log.txt を archive へ移動」（関数呼び出し）
構造化・大（型付きツール＋引数）
APIスキーマ・実行結果
Tau-Bench (Retail)
「顧客の注文変更に対応」（対話＋API）
構造化・大（多ドメインAPI）
顧客対話＋ツール出力
SearchQA
「Boridiがある国の第9代総督は？」（多段検索）
開いた（検索語を自由生成）
検索文書スニペット
WebShop
「$130以下の青いBTヘッドホンを購入」
ページ内の選択肢＋検索語
商品ページテキスト
WebArena-Lite
「2023年1月の売上上位3商品は？」（管理画面）
要素×操作の組合せ
数百要素のaccessibility tree


# Page. 8

![Page Image](https://bcdn.docswell.com/page/DJY439187M.jpg)

結果①：8環境・3モデルすべてで模倣学習を上回る
•
IWM：遷移が安定した環境で特に大きい
– WebShop +11.3〜+18.4 / ALFWorld +4.7〜+5.5
•
SR：多段推論・制約充足が要る環境で最大
– TravelPlanner +12.8〜+15.0
– ScienceWorld（8B）+13.3 / BFCLv3（3B）+8.0
•
行動空間が閉じた環境から開いた環境まで一貫し
て有効


# Page. 9

![Page Image](https://bcdn.docswell.com/page/V7NYVL29E8.jpg)

結果②：Out-of-Domain（OOD）でも一貫して改善
•
•
OODでは全手法とも性能が下がるが、early experience がギャップの相当部分を回復
SearchQA 等では相対利得が in-domain 以上
– 自分のrolloutの教師信号化が「デモ未カバーの状態」への備えになる
•
IWMはダイナミクスが安定した環境（ALFWorld +14.8）、SRはツール可用性・引数が変わるシフト（
BFCLv3 +8.5）に強い


# Page. 10

![Page Image](https://bcdn.docswell.com/page/YJ9P641373.jpg)

結果③：RLのwarm startとしても有効
•
•
報酬が使える3環境で、各チェックポイントから同一レシピ・同一step数のGRPOを実行
early experience 起点は post-RL の到達点が常にIL起点以上（例：WebShop 3B 82.0→92.2）
– ベースモデルから直接RLは最弱・不安定 → 強い初期化としての価値
•
「人間データの時代」と「経験の時代」をつなぐ mid-training bridge


# Page. 11

![Page Image](https://bcdn.docswell.com/page/GJ8DZQ4LJD.jpg)

分析：データ効率・分岐数K・モデルスケール
•
•
デモを1/8に減らしても全量ILを超える（WebShop）→ 専門家デー
タの大幅節約
IWMは分岐数K増で単調改善、SRはK=2〜4がベスト
– Kが大きすぎると「成功しうる代替」が混ざり対比が薄まる
•
70B（LoRA）でも利得が持続 → モデルサイズと相補的（右図）


# Page. 12

![Page Image](https://bcdn.docswell.com/page/LJLMDX6QER.jpg)

考察：なぜ効くのか — 観測された次状態への「接地」
•
環境と相互作用しない代替手法はすべて失敗（右表,
Llama-3.1-8B）
– Long CoT（推論時のみ）：微増どまり。SFT済みモデルに
適用すると崩壊（−47〜−55pt）
– Self-Taught Reasoner (STaR)：接地なしで生成した根拠
は幻覚を含み、学習すると劣化
– DPO（rollout行動を負例に）：数十stepで学習崩壊（報告
値は崩壊前ベスト）
•
選好や根拠という「形式」ではなく、実際の遷移に接地
した教師信号が本質


# Page. 13

![Page Image](https://bcdn.docswell.com/page/47MYPLGK7W.jpg)

まとめと Limitations
•
まとめ
– 報酬なしで「自分の行動の結果＝次状態」を教師信号化する early experience を提案（ILと RLの中間）
– IWM / SR の2手法が8環境×3モデルで一貫改善。OOD汎化・RL warm start・データ効率でも優位
•
Limitations（論文記載＋見解）
–
–
–
–
•
専門家状態への「リセット＋任意行動の実行」が可能な環境が前提 → 実Web・物理環境では収集コスト/安全性が課題
専門家状態からの1-step逸脱のみ：複合誤差やリカバリ軌道は学習しない
IWMの実態は「タスク条件付き要約」の予測が多い（環境ごとの状態表現設計）／SRは品質フィルタに依存
分散・シード非報告：WebArena-Lite等の小さな差（+2〜3pt＝数タスク差）はノイズ域の可能性
所感：「新パラダイム」というより堅実な mid-training レシピ。デモ半減で同性能は実務的価値が大きい


