Self-Play Agentic RL

390 Views

October 08, 26

スライド概要

近年、自律的にツールを操作するLLMエージェントによる業務効率化が進んでいます。一方、現在の多くのエージェントは汎用的なAPIモデルを前提としており、モデル自体を特定の業務や探索戦略に最適化するアプローチはまだ発展途上です。本発表ではエージェント活用に特化したLLMの構築手法について、メール検索の事例をもとに紹介します。特にモデルが自ら学習データを生み出し学ぶ、一人二役型のSelf-Play強化学習について、実装方法と難所についてお話します。

profile-image

株式会社松尾研究所のスライドを共有します

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

ダウンロード

関連スライド

各ページのテキスト
1.

MKJ Deep Dive #1 Self-Play Agentic RL 2026/10/1 太田 幹 シニアデータサイエンティスト 許諾なく撮影や第三者への 開示を禁止します ©︎MATSUO INSTITUTE, INC.

2.

問題設定 ©︎MATSUO INSTITUTE, INC.

3.

問題設定 ユーザーは金融PJについて聞いている。これはプ ロジェクトAのことをさしているはずだ。まずは「プ ロジェクトA」「リスケ」で調べてみよう。 先月予定して今週にリスケされ た金融PJっていつだっけ?会議 室は予約してある? プロジェクトA月次定例ですね。 今週の火曜16時から会議室B の予定です。 search_tool(“プロジェクトA”, “リスケ”) Results: None メールがヒットしない。では「リスケ」ではなく「ミー ティング」で試してみよう。 search_tool(“プロジェクトA”, “ミーティング”) Results: [mail_iduh9d, mail_kad3, …] 「金融PJ」がどのプロジェクトを意味しているのか 理解する能力 そのうち今週にリスケされたものを 選択する能力 先月キャンセルされたミーティングを 検索する能力 該当メールから時間と会議室を 抽出する能力 Reflection-Actionでメールからメールへと遷移し回答する Multi-hop Q&Aタスク ©︎MATSUO INSTITUTE, INC. 4

4.

どう学習するのか?ざっくりGRPO 試行錯誤を.. ツール定義 プロンプト Mail DB <tool_call> search_keyword([“test”]} </tool_call> [SearchResult(message_id=“abc”, snippet=“This is a test…”), SearchResult..] テストっていつだっけ? 特殊トークンを使った ツール呼び出し <tool> search_keyword(kw)</tool> I have results… Let’s.. </think> <output> Test is Tomorrow SQLite実行による 検索結果返答 Fail … マルチターン会話による 情報収集 … 報酬 <tool>…</tool><output>Yesterday Fail <tool>…</tool><output>On Match Fail <tool>…</tool><output>Today! Pass データセット 1レコード(一 問)に対してN 回解答して都 度報酬を算出 xN <tool_call> return_answer(“Today”} </tool_call> ここの与え方が 肝となる! たくさんして.. 最終回答の提出 相対評価をする モデルのパフォーマンスに対して 報酬を与える ©︎MATSUO INSTITUTE, INC. 5

5.

前回のタスク 学習データ 学習方法 実メール(Enron Corpus)を使って 高難易度マルチホップデータセットを合成 Async GRPO+報酬デザイン Async GRPO Qwen3-4B-instruct Full-FT 4 x H100 Rubric (JudgeLLM) 報酬 デザイン -1点 0点 1点 間違った解答 解答なし 正しい解答 Evidence Retrieval メール群をグラフデータに変換したうえでノード間遷移の パスをサンプリングしこれを元にLLMで合成 ©︎MATSUO INSTITUTE, INC. 0.2 * 読んだエビデンスメールの数 6

6.

結果(JSAI2026) モデル GPT5 Qwen3-4B 精度 40.0% 55.4% 速度 23.1s 5.6s コスト 17.9USD 3.48USD はるかに小さなサイズのモデルで GPT5越えを実現 ©︎MATSUO INSTITUTE, INC. 7

7.

今回のタスク 学習データ Agentic RLを用いて想定の挙動を獲 得することができた。しかし、、 実メール(Enron Corpus)を使って 高難易度マルチホップデータセットを合成 学習データを作るのがとても大変... 新規のドメインでも都度作成が必要で あり導入も運用もスケールしづらい 今日のお話 メール群をグラフデータに変換したうえでノード間遷移の パスをサンプリングしこれを元にLLMで合成 ©︎MATSUO INSTITUTE, INC. なんとかデータ生成とモデル学習を 自動化できないか? 8

8.

Self-Play Agentic RL ©︎MATSUO INSTITUTE, INC.

9.

学習データの自動生成 LLM Generator Agentic Generator Self-Play 強いモデルを使って 与えたグラフに対して問題を生成 強いモデルを使って コーパスを自律的に探索し問題を生成 学習対象モデルが一人二役で自ら コーパスを自律的に探索し問題を生成 コーパスからルールあるいは LLMでグラフを構成 グラフ情報から マルチホップ質問を合成 回答 環境をエージェンティックに探索し質問を生成 回答 エージェンティックに探索し質問生成⇨学習 回答 グラフによりマルチホップ性を一定担保 強いモデルを利用することで問題を安定生成 同時学習による段階的難易度調整 ルールベースでの確認とフィルタが可能 セマンティックなマルチホップ質問を生成 外部モデル依存性からの脱却 適切なグラフを構築することが困難 時間・コストが大幅にかかる 汎用性(報酬デザインのみ) LLMの精度が低く大量生成が必要 指定したホップ数の質問が困難 学習がシビア 前回実施し大変だった 検討し一定効果はでたものの 面白みがなく断念 質問生成と回答を同時に学習! ©︎MATSUO INSTITUTE, INC. 10

10.

実施内容 質問構築と探索回答が本質的に同じスキルを要することに着目。同じモデルを異なるロールで安定に学習するうえで、ツー ルや出力フォーマットのシンメトリーを意識。 Proposer メールコーパスを探索し質問を生成する役割 Solver メールコーパスを探索し質問を回答する役割 あなたは Proposerです 太田幹が担当して いるPJTで研究所の 関心が特に高いの はどれ? あなたは Solverです 同じモデルの重みを同時に更新 提出質問 提出回答 質問 回答 根拠 利用ツール 回答 根拠 メール閲覧 回答提出 利用ツール KW検索 メール閲覧 質問提出 報酬設計 フォーマット等の ルールベース確認 <think>まずは太田 幹のPJTを探す...こ のうち研究所 が...</think> TOEです。 KW検索 報酬設計 Judgeによる 整合性確認 提出質問の Solver正答率 指定ホップ 実現確認 提出された回答の成否のみを判定 ©︎MATSUO INSTITUTE, INC. 11

11.

実施結果 Self-Play RLを用いることで検索能力が向上し、ベースモデルと比較してベンチマーク性能も大幅に改善されることを確認。 マニュアルでデータを作っていた時と同等の効果を得られた。 学習曲線 評価結果 H1のみ生成 H2生成 H2定義強固化 質問がだんだん難しくなるので Solverは大きく向上しないのが正 ©︎MATSUO INSTITUTE, INC. 12

12.

学習の学び 今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総 じて言えることはGRPOにおける学習崩壊時には(ほぼ)必ず理由があること。「運がなかった」で終わらせない。 つまづいたところ 学び GRPOにおけるTrain/Inferミスマッチによる崩壊 学習エンジンと推論エンジンのサンプリング設定の必要性 Proposer/Solverの学習トークン量インバランスによる崩壊 フィルタを使ったProposer:Solverトークン比の調整 Proposer/Solverの出力非対称性による崩壊 対照的な出力フォーマットで安定化 Proposer報酬ハックによる不明瞭質問の生成 Solverの出力を使って事後報酬調整 Proposer報酬ハックによる同質問群の生成 グループ内の多様性を評価して報酬化 無効質問フィルタによる学習効率の低下 「失敗」を捨てずに重要な報酬シグナルとして残す 中間チェックポイントのモデルバイアスによる再開効率の低下 Validation確認と必要に応じてゼロベース再開 メールデータセット大量重複レコードによるノイズ Self-Playであっても最低限のデータクリーニングは必要 ©︎MATSUO INSTITUTE, INC. 13

13.

学習の学び 今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総 じて言えることはGRPOにおける学習崩壊時には(ほぼ)必ず理由があること。「運がなかった」で終わらせない。 つまづいたところ 学び GRPOにおけるTrain/Inferミスマッチによる崩壊 学習エンジンと推論エンジンのサンプリング設定の必要性 Proposer/Solverの学習トークン量インバランスによる崩壊 フィルタを使ったProposer:Solverトークン比の調整 Proposer/Solverの出力非対称性による崩壊 対照的な出力フォーマットで安定化 Proposer報酬ハックによる不明瞭質問の生成 Solverの出力を使って事後報酬調整 Proposer報酬ハックによる同質問群の生成 グループ内の多様性を評価して報酬化 無効質問フィルタによる学習効率の低下 「失敗」を捨てずに重要な報酬シグナルとして残す 中間チェックポイントのモデルバイアスによる再開効率の低下 Validation確認と必要に応じてゼロベース再開 メールデータセット大量重複レコードによるノイズ Self-Playであっても最低限のデータクリーニングは必要 ©︎MATSUO INSTITUTE, INC. 14

14.

Train/Inferのミスマッチ GRPO実施の際に学習率やデータ等に関係なくモデルが一定のステップ後に崩壊することを確認。各種メトリクスを確認し たところ、Mismatch KLが高いことが起因していることを確認。 遭遇した問題 原因 Mismatch KLが高いことが起因 ロールアウト生成時のサンプリングパラメタ (top-k, top-p...)を無効にすることで学習を安定化 ハイパラに関係なく学習が一定のステップ後崩壊 なぜ起きたのか?? ©︎MATSUO INSTITUTE, INC. 15

15.
[beta]
Train/Inferのミスマッチ
GRPOは前述の通り実推論を伴い、この結果によって報酬を算出・勾配を計算する。この際に推論側のモデルと勾配降
下対照のモデルが全く同一であるとは限らない。
試行錯誤をたくさんして..

GRPOは勾配を計算するうえで推論が必要

テストっていつだっけ?

<tool> search_keyword(kw)</tool>
I have results… Let’s..
</think>
<output>
Test is Tomorrow

Fail

報酬

<tool>…</tool><output>Yesterday

Fail

<tool>…</tool><output>On Match

Fail

<tool>…</tool><output>Today!

Pass

データセット
1レコード(一
問)に対してN回
解答して都度報
酬を算出

勾配を計算する学習エンジンとロールアウトを生成する
推論エンジンの挙動が異なりMismatchを起こす!
今回のケース
推論時のサンプリングが学習時のモデル設定とずれ両エンジン
間の生成分布のズレ(=Mismatch KL)が生じ学習崩壊

xN

相対評価をする

他にもMismatch要因...
➢ 推論エンジンコピーと学習モデルの重み型違いのズレ※1
➢ 推論エンジンと学習エンジンのカーネルの違い※1
➢ Async GRPOによるコピーと学習モデルのズレ(後述)
➢ MITOによる入力トークン列のズレ ※2
※1https://tech-blog.abeja.asia/entry/llm-rl-rollout-correction-202606
※2[Agentic RLにおけるMITOとTITO](https://zenn.dev/mkj/articles/e63b7e25a1c853)

©︎MATSUO INSTITUTE, INC.

16

16.

学習の学び 今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総 じて言えることはGRPOにおける学習崩壊時には(ほぼ)必ず理由があること。「運がなかった」で終わらせない。 つまづいたところ 学び GRPOにおけるTrain/Inferミスマッチによる崩壊 学習エンジンと推論エンジンのサンプリング設定の必要性 Proposer/Solverの学習トークン量インバランスによる崩壊 フィルタを使ったProposer:Solverトークン比の調整 Proposer/Solverの出力非対称性による崩壊 対照的な出力フォーマットで安定化 Proposer報酬ハックによる不明瞭質問の生成 Solverの出力を使って事後報酬調整 Proposer報酬ハックによる同質問群の生成 グループ内の多様性を評価して報酬化 無効質問フィルタによる学習効率の低下 「失敗」を捨てずに重要な報酬シグナルとして残す 中間チェックポイントのモデルバイアスによる再開効率の低下 Validation確認と必要に応じてゼロベース再開 メールデータセット大量重複レコードによるノイズ Self-Playであっても最低限のデータクリーニングは必要 ©︎MATSUO INSTITUTE, INC. 17

17.

報酬ハック入門 本来意図している形とは別の形でモデルが報酬を獲得し、想定外の能力を伸ばすことを「報酬ハック」と呼ぶ。報酬ハックは オープンクエスチョンタスクでは特に生じやすく、今回も様々なパターンを観測。 初期の報酬 意図していること 実際に起きていること 正解率がまばら(=学習の余地がある) な質問にインセンティブを与えたい いちかばちかで当てる質問が高い報酬を得ている 「意図が読めない」質問にインセンティブが発生 Yes, Reward Hack! ©︎MATSUO INSTITUTE, INC. 18

18.

報酬ハックはそこにいる 一般的なゲームのSelf-Play RLにおいては互いが全く同一であるため、ある程度シンプルな報酬でもロバストに学習できる が、今回は一人二役であることがトリッキング(騙し合い)を可能としている。 その他報酬ハック Solverは報酬デザインが単純であるがゆえにロバスト なぜProposerもシンプルな報酬に設定できないのか? 回答 Proposerには問いの「質」の概念がある 回答する側は「正しいか否か」の二択だが質問する側は 「答えられるか否か」の二択ではなく「適切な難易度か否 か」を評価する必要がありこれが曲者 2+Hopの質問作成がそもそも難しく報酬も高いため 特定の質問パターンをこすりまくっている 一般的なゲームAIのSelf-Playにおいては役に対称性がある &勝敗のみで報酬を設計可能 Yes, Reward Hack! ©︎MATSUO INSTITUTE, INC. 19

19.

学習の学び 今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総 じて言えることはGRPOにおける学習崩壊時には(ほぼ)必ず理由があること。「運がなかった」で終わらせない。 つまづいたところ 学び GRPOにおけるTrain/Inferミスマッチによる崩壊 学習エンジンと推論エンジンのサンプリング設定の必要性 Proposer/Solverの学習トークン量インバランスによる崩壊 フィルタを使ったProposer:Solverトークン比の調整 Proposer/Solverの出力非対称性による崩壊 対照的な出力フォーマットで安定化 Proposer報酬ハックによる不明瞭質問の生成 Solverの出力を使って事後報酬調整 Proposer報酬ハックによる同質問群の生成 グループ内の多様性を評価して報酬化 無効質問フィルタによる学習効率の低下 「失敗」を捨てずに重要な報酬シグナルとして残す 中間チェックポイントのモデルバイアスによる再開効率の低下 Validation確認と必要に応じてゼロベース再開 メールデータセット大量重複レコードによるノイズ Self-Playであっても最低限のデータクリーニングは必要 ©︎MATSUO INSTITUTE, INC. 20

20.

GRPOにおけるフィルタリング GRPOを実施する際には「最も効果的なロールアウトを保持する」ことが学習効率を高めるうえで重要。しかしこの「学習へ の影響度」を適切に定義するのは困難。 「学習効率の悪い」ロールアウト例 全問(不)正解のロールアウト群 回答可能質問だけのロールアウト群 オンポリシーだけのロールアウト群 GRPOの性質上分散がゼロになるグルー プはアドバンテージの計算に貢献できない 報酬値が低いロールアウトを除外するとロー ルアウト間のアドバンテージ間のコントラスト が弱くなる(=失敗から学ばない) 非同期性(Mismatch)を一定許容しな いと推論エンジンが先走って、採択されない ロールアウトが多数生まれてしまう ©︎MATSUO INSTITUTE, INC. 21

21.

まとめ ©︎MATSUO INSTITUTE, INC.

22.

Next Actionと展望 メールコーパスを活用したSelf-Playは一定手の内化。今回得た結果を国内論文や営業アセットを通じて対外発信すると ともに、次のステップとして同じパラダイムを社内データ(Google Drive, Notion, Slack)に活用したい。 まとめ 今後の展望 Self-Play RLはゲーム以外でも有効! 社内実データへの拡張と局所世界モデルの獲得 データ読む データ探す 質問作る 質問答える しかし学習は一筋縄ではいかない、、 Self-Play Agentic RLを極めれば爆速で自社環 境に特化したモデルが作れる...!? 社内実データ 局所世界モデル ➢ 現在はOSのメールコーパスを利用し ている(リアルデータ) ➢ しかし実際には社内や特定領域に特 化した検索エージェントを量産したい ➢ 検索対象をクローズドかつ多様な ファイル群へと拡張したい ➢ 現状の強化学習では「検索の仕方」 のみを学んでいる ➢ しかし熟練者は「この内容ならここに 答えがある」と暗黙的にコーパスの構 造を捉えている(=予測できる) ➢ 現行手法では手の届かない世界内 省を実現したい ©︎MATSUO INSTITUTE, INC. 23

23.

©︎MATSUO INSTITUTE, INC.

24.

参考文献 SPICE: Self-Play In Corpus Environments Improves Reasoning; arXiv:2510.24684 SPADE: Self-Play in Adaptive Synthetic Executable Environments; arXiv:2608.19197 Self-Questioning Language Models; arXiv:2508.03682 SearchMaster: Grounded and Regulated Self-Play for Search Agents; arXiv:2608.01822 Search Self-play: Pushing the Frontier of Agent Capability without Supervision; arXiv:2510.18821 SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks; arXiv:2605.31433 ©︎MATSUO INSTITUTE, INC. 25