---
title: Self-Play Agentic RL
tags: 
author: [(株)松尾研究所](https://www.docswell.com/user/MatsuoInstitute)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/PJR9VK1679.jpg?width=480
description: 近年、自律的にツールを操作するLLMエージェントによる業務効率化が進んでいます。一方、現在の多くのエージェントは汎用的なAPIモデルを前提としており、モデル自体を特定の業務や探索戦略に最適化するアプローチはまだ発展途上です。本発表ではエージェント活用に特化したLLMの構築手法について、メール検索の事例をもとに紹介します。特にモデルが自ら学習データを生み出し学ぶ、一人二役型のSelf-Play強化学習について、実装方法と難所についてお話します。
published: October 08, 26
canonical: https://www.docswell.com/s/MatsuoInstitute/5R87RN-2026-10-08-165306
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/PJR9VK1679.jpg)

MKJ Deep Dive #1
Self-Play Agentic RL
2026/10/1
太田 幹
シニアデータサイエンティスト
許諾なく撮影や第三者への
開示を禁止します
©︎MATSUO INSTITUTE, INC.


# Page. 2

![Page Image](https://bcdn.docswell.com/page/PEXQZLYDJX.jpg)

問題設定
©︎MATSUO INSTITUTE, INC.


# Page. 3

![Page Image](https://bcdn.docswell.com/page/3EK98L3DED.jpg)

問題設定
ユーザーは金融PJについて聞いている。これはプ
ロジェクトAのことをさしているはずだ。まずは「プ
ロジェクトA」「リスケ」で調べてみよう。
先月予定して今週にリスケされ
た金融PJっていつだっけ？会議
室は予約してある？
プロジェクトA月次定例ですね。
今週の火曜16時から会議室B
の予定です。
search_tool(“プロジェクトA”, “リスケ”)
Results: None
メールがヒットしない。では「リスケ」ではなく「ミー
ティング」で試してみよう。
search_tool(“プロジェクトA”, “ミーティング”)
Results: [mail_iduh9d, mail_kad3, …]
「金融PJ」がどのプロジェクトを意味しているのか
理解する能力
そのうち今週にリスケされたものを
選択する能力
先月キャンセルされたミーティングを
検索する能力
該当メールから時間と会議室を
抽出する能力
Reflection-Actionでメールからメールへと遷移し回答する
Multi-hop Q&amp;Aタスク
©︎MATSUO INSTITUTE, INC.
4


# Page. 4

![Page Image](https://bcdn.docswell.com/page/L73W23GP75.jpg)

どう学習するのか？ざっくりGRPO
試行錯誤を..
ツール定義
プロンプト
Mail
DB
&lt;tool_call&gt;
search_keyword([“test”]}
&lt;/tool_call&gt;
[SearchResult(message_id=“abc”,
snippet=“This is a test…”),
SearchResult..]
テストっていつだっけ？
特殊トークンを使った
ツール呼び出し
&lt;tool&gt; search_keyword(kw)&lt;/tool&gt;
I have results… Let’s..
&lt;/think&gt;
&lt;output&gt;
Test is Tomorrow
SQLite実行による
検索結果返答
Fail
…
マルチターン会話による
情報収集
…
報酬
&lt;tool&gt;…&lt;/tool&gt;&lt;output&gt;Yesterday
Fail
&lt;tool&gt;…&lt;/tool&gt;&lt;output&gt;On Match
Fail
&lt;tool&gt;…&lt;/tool&gt;&lt;output&gt;Today!
Pass
データセット
１レコード（一
問）に対してN
回解答して都
度報酬を算出
xN
&lt;tool_call&gt;
return_answer(“Today”}
&lt;/tool_call&gt;
ここの与え方が
肝となる！
たくさんして..
最終回答の提出
相対評価をする
モデルのパフォーマンスに対して
報酬を与える
©︎MATSUO INSTITUTE, INC.
5


# Page. 5

![Page Image](https://bcdn.docswell.com/page/87DKZ413JG.jpg)

前回のタスク
学習データ
学習方法
実メール（Enron Corpus）を使って
高難易度マルチホップデータセットを合成
Async GRPO＋報酬デザイン
Async
GRPO
Qwen3-4B-instruct
Full-FT
4 x H100
Rubric (JudgeLLM)
報酬
デザイン
-1点
0点
1点
間違った解答
解答なし
正しい解答
Evidence Retrieval
メール群をグラフデータに変換したうえでノード間遷移の
パスをサンプリングしこれを元にLLMで合成
©︎MATSUO INSTITUTE, INC.
0.2 * 読んだエビデンスメールの数
6


# Page. 6

![Page Image](https://bcdn.docswell.com/page/VJPKDMQPE8.jpg)

結果（JSAI2026）
モデル
GPT5
Qwen3-4B
精度
40.0%
55.4%
速度
23.1s
5.6s
コスト
17.9USD
3.48USD
はるかに小さなサイズのモデルで
GPT5越えを実現
©︎MATSUO INSTITUTE, INC.
7


# Page. 7

![Page Image](https://bcdn.docswell.com/page/2EVV195VEQ.jpg)

今回のタスク
学習データ
Agentic RLを用いて想定の挙動を獲
得することができた。しかし、、
実メール（Enron Corpus）を使って
高難易度マルチホップデータセットを合成
学習データを作るのがとても大変...
新規のドメインでも都度作成が必要で
あり導入も運用もスケールしづらい
今日のお話
メール群をグラフデータに変換したうえでノード間遷移の
パスをサンプリングしこれを元にLLMで合成
©︎MATSUO INSTITUTE, INC.
なんとかデータ生成とモデル学習を
自動化できないか？
8


# Page. 8

![Page Image](https://bcdn.docswell.com/page/57GL2Z61EL.jpg)

Self-Play Agentic RL
©︎MATSUO INSTITUTE, INC.


# Page. 9

![Page Image](https://bcdn.docswell.com/page/4EQYPL4NJP.jpg)

学習データの自動生成
LLM Generator
Agentic Generator
Self-Play
強いモデルを使って
与えたグラフに対して問題を生成
強いモデルを使って
コーパスを自律的に探索し問題を生成
学習対象モデルが一人二役で自ら
コーパスを自律的に探索し問題を生成
コーパスからルールあるいは
LLMでグラフを構成
グラフ情報から
マルチホップ質問を合成
回答
環境をエージェンティックに探索し質問を生成
回答
エージェンティックに探索し質問生成⇨学習
回答
グラフによりマルチホップ性を一定担保
強いモデルを利用することで問題を安定生成
同時学習による段階的難易度調整
ルールベースでの確認とフィルタが可能
セマンティックなマルチホップ質問を生成
外部モデル依存性からの脱却
適切なグラフを構築することが困難
時間・コストが大幅にかかる
汎用性（報酬デザインのみ）
LLMの精度が低く大量生成が必要
指定したホップ数の質問が困難
学習がシビア
前回実施し大変だった
検討し一定効果はでたものの
面白みがなく断念
質問生成と回答を同時に学習！
©︎MATSUO INSTITUTE, INC.
10


# Page. 10

![Page Image](https://bcdn.docswell.com/page/KJ4WYDQ371.jpg)

実施内容
質問構築と探索回答が本質的に同じスキルを要することに着目。同じモデルを異なるロールで安定に学習するうえで、ツー
ルや出力フォーマットのシンメトリーを意識。
Proposer
メールコーパスを探索し質問を生成する役割
Solver
メールコーパスを探索し質問を回答する役割
あなたは
Proposerです
太田幹が担当して
いるPJTで研究所の
関心が特に高いの
はどれ？
あなたは
Solverです
同じモデルの重みを同時に更新
提出質問
提出回答
質問
回答
根拠
利用ツール
回答
根拠
メール閲覧
回答提出
利用ツール
KW検索
メール閲覧
質問提出
報酬設計
フォーマット等の
ルールベース確認
&lt;think&gt;まずは太田
幹のPJTを探す...こ
のうち研究所
が...&lt;/think&gt;
TOEです。
KW検索
報酬設計
Judgeによる
整合性確認
提出質問の
Solver正答率
指定ホップ
実現確認
提出された回答の成否のみを判定
©︎MATSUO INSTITUTE, INC.
11


# Page. 11

![Page Image](https://bcdn.docswell.com/page/LE1Y6ZPZ7G.jpg)

実施結果
Self-Play RLを用いることで検索能力が向上し、ベースモデルと比較してベンチマーク性能も大幅に改善されることを確認。
マニュアルでデータを作っていた時と同等の効果を得られた。
学習曲線
評価結果
H1のみ生成
H2生成
H2定義強固化
質問がだんだん難しくなるので
Solverは大きく向上しないのが正
©︎MATSUO INSTITUTE, INC.
12


# Page. 12

![Page Image](https://bcdn.docswell.com/page/GEWGW926J2.jpg)

学習の学び
今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総
じて言えることはGRPOにおける学習崩壊時には（ほぼ）必ず理由があること。「運がなかった」で終わらせない。
つまづいたところ
学び
GRPOにおけるTrain/Inferミスマッチによる崩壊
学習エンジンと推論エンジンのサンプリング設定の必要性
Proposer/Solverの学習トークン量インバランスによる崩壊
フィルタを使ったProposer:Solverトークン比の調整
Proposer/Solverの出力非対称性による崩壊
対照的な出力フォーマットで安定化
Proposer報酬ハックによる不明瞭質問の生成
Solverの出力を使って事後報酬調整
Proposer報酬ハックによる同質問群の生成
グループ内の多様性を評価して報酬化
無効質問フィルタによる学習効率の低下
「失敗」を捨てずに重要な報酬シグナルとして残す
中間チェックポイントのモデルバイアスによる再開効率の低下
Validation確認と必要に応じてゼロベース再開
メールデータセット大量重複レコードによるノイズ
Self-Playであっても最低限のデータクリーニングは必要
©︎MATSUO INSTITUTE, INC.
13


# Page. 13

![Page Image](https://bcdn.docswell.com/page/47ZL59DRJ3.jpg)

学習の学び
今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総
じて言えることはGRPOにおける学習崩壊時には（ほぼ）必ず理由があること。「運がなかった」で終わらせない。
つまづいたところ
学び
GRPOにおけるTrain/Inferミスマッチによる崩壊
学習エンジンと推論エンジンのサンプリング設定の必要性
Proposer/Solverの学習トークン量インバランスによる崩壊
フィルタを使ったProposer:Solverトークン比の調整
Proposer/Solverの出力非対称性による崩壊
対照的な出力フォーマットで安定化
Proposer報酬ハックによる不明瞭質問の生成
Solverの出力を使って事後報酬調整
Proposer報酬ハックによる同質問群の生成
グループ内の多様性を評価して報酬化
無効質問フィルタによる学習効率の低下
「失敗」を捨てずに重要な報酬シグナルとして残す
中間チェックポイントのモデルバイアスによる再開効率の低下
Validation確認と必要に応じてゼロベース再開
メールデータセット大量重複レコードによるノイズ
Self-Playであっても最低限のデータクリーニングは必要
©︎MATSUO INSTITUTE, INC.
14


# Page. 14

![Page Image](https://bcdn.docswell.com/page/YJ6W9K11JV.jpg)

Train/Inferのミスマッチ
GRPO実施の際に学習率やデータ等に関係なくモデルが一定のステップ後に崩壊することを確認。各種メトリクスを確認し
たところ、Mismatch KLが高いことが起因していることを確認。
遭遇した問題
原因
Mismatch KLが高いことが起因
ロールアウト生成時のサンプリングパラメタ
（top-k, top-p...）を無効にすることで学習を安定化
ハイパラに関係なく学習が一定のステップ後崩壊
なぜ起きたのか？？
©︎MATSUO INSTITUTE, INC.
15


# Page. 15

![Page Image](https://bcdn.docswell.com/page/GJ5MNP4LJ4.jpg)

Train/Inferのミスマッチ
GRPOは前述の通り実推論を伴い、この結果によって報酬を算出・勾配を計算する。この際に推論側のモデルと勾配降
下対照のモデルが全く同一であるとは限らない。
試行錯誤をたくさんして..
GRPOは勾配を計算するうえで推論が必要
テストっていつだっけ？
&lt;tool&gt; search_keyword(kw)&lt;/tool&gt;
I have results… Let’s..
&lt;/think&gt;
&lt;output&gt;
Test is Tomorrow
Fail
報酬
&lt;tool&gt;…&lt;/tool&gt;&lt;output&gt;Yesterday
Fail
&lt;tool&gt;…&lt;/tool&gt;&lt;output&gt;On Match
Fail
&lt;tool&gt;…&lt;/tool&gt;&lt;output&gt;Today!
Pass
データセット
１レコード（一
問）に対してN回
解答して都度報
酬を算出
勾配を計算する学習エンジンとロールアウトを生成する
推論エンジンの挙動が異なりMismatchを起こす！
今回のケース
推論時のサンプリングが学習時のモデル設定とずれ両エンジン
間の生成分布のズレ（＝Mismatch KL）が生じ学習崩壊
xN
相対評価をする
他にもMismatch要因...
➢ 推論エンジンコピーと学習モデルの重み型違いのズレ※1
➢ 推論エンジンと学習エンジンのカーネルの違い※1
➢ Async GRPOによるコピーと学習モデルのズレ（後述）
➢ MITOによる入力トークン列のズレ ※2
※1https://tech-blog.abeja.asia/entry/llm-rl-rollout-correction-202606
※2[Agentic RLにおけるMITOとTITO](https://zenn.dev/mkj/articles/e63b7e25a1c853)
©︎MATSUO INSTITUTE, INC.
16


# Page. 16

![Page Image](https://bcdn.docswell.com/page/LE3W23GDE5.jpg)

学習の学び
今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総
じて言えることはGRPOにおける学習崩壊時には（ほぼ）必ず理由があること。「運がなかった」で終わらせない。
つまづいたところ
学び
GRPOにおけるTrain/Inferミスマッチによる崩壊
学習エンジンと推論エンジンのサンプリング設定の必要性
Proposer/Solverの学習トークン量インバランスによる崩壊
フィルタを使ったProposer:Solverトークン比の調整
Proposer/Solverの出力非対称性による崩壊
対照的な出力フォーマットで安定化
Proposer報酬ハックによる不明瞭質問の生成
Solverの出力を使って事後報酬調整
Proposer報酬ハックによる同質問群の生成
グループ内の多様性を評価して報酬化
無効質問フィルタによる学習効率の低下
「失敗」を捨てずに重要な報酬シグナルとして残す
中間チェックポイントのモデルバイアスによる再開効率の低下
Validation確認と必要に応じてゼロベース再開
メールデータセット大量重複レコードによるノイズ
Self-Playであっても最低限のデータクリーニングは必要
©︎MATSUO INSTITUTE, INC.
17


# Page. 17

![Page Image](https://bcdn.docswell.com/page/8EDKZ4127G.jpg)

報酬ハック入門
本来意図している形とは別の形でモデルが報酬を獲得し、想定外の能力を伸ばすことを「報酬ハック」と呼ぶ。報酬ハックは
オープンクエスチョンタスクでは特に生じやすく、今回も様々なパターンを観測。
初期の報酬
意図していること
実際に起きていること
正解率がまばら（＝学習の余地がある）
な質問にインセンティブを与えたい
いちかばちかで当てる質問が高い報酬を得ている
「意図が読めない」質問にインセンティブが発生
Yes, Reward Hack!
©︎MATSUO INSTITUTE, INC.
18


# Page. 18

![Page Image](https://bcdn.docswell.com/page/V7PKDMQLJ8.jpg)

報酬ハックはそこにいる
一般的なゲームのSelf-Play RLにおいては互いが全く同一であるため、ある程度シンプルな報酬でもロバストに学習できる
が、今回は一人二役であることがトリッキング（騙し合い）を可能としている。
その他報酬ハック
Solverは報酬デザインが単純であるがゆえにロバスト
なぜProposerもシンプルな報酬に設定できないのか？
回答
Proposerには問いの「質」の概念がある
回答する側は「正しいか否か」の二択だが質問する側は
「答えられるか否か」の二択ではなく「適切な難易度か否
か」を評価する必要がありこれが曲者
2+Hopの質問作成がそもそも難しく報酬も高いため
特定の質問パターンをこすりまくっている
一般的なゲームAIのSelf-Playにおいては役に対称性がある
＆勝敗のみで報酬を設計可能
Yes, Reward Hack!
©︎MATSUO INSTITUTE, INC.
19


# Page. 19

![Page Image](https://bcdn.docswell.com/page/2JVV1956JQ.jpg)

学習の学び
今回はSelf-Play RLをAsync GRPOで実施。報酬設計はもちろん、学習手法の特殊性からいくつかの学びがあった。総
じて言えることはGRPOにおける学習崩壊時には（ほぼ）必ず理由があること。「運がなかった」で終わらせない。
つまづいたところ
学び
GRPOにおけるTrain/Inferミスマッチによる崩壊
学習エンジンと推論エンジンのサンプリング設定の必要性
Proposer/Solverの学習トークン量インバランスによる崩壊
フィルタを使ったProposer:Solverトークン比の調整
Proposer/Solverの出力非対称性による崩壊
対照的な出力フォーマットで安定化
Proposer報酬ハックによる不明瞭質問の生成
Solverの出力を使って事後報酬調整
Proposer報酬ハックによる同質問群の生成
グループ内の多様性を評価して報酬化
無効質問フィルタによる学習効率の低下
「失敗」を捨てずに重要な報酬シグナルとして残す
中間チェックポイントのモデルバイアスによる再開効率の低下
Validation確認と必要に応じてゼロベース再開
メールデータセット大量重複レコードによるノイズ
Self-Playであっても最低限のデータクリーニングは必要
©︎MATSUO INSTITUTE, INC.
20


# Page. 20

![Page Image](https://bcdn.docswell.com/page/5EGL2Z62JL.jpg)

GRPOにおけるフィルタリング
GRPOを実施する際には「最も効果的なロールアウトを保持する」ことが学習効率を高めるうえで重要。しかしこの「学習へ
の影響度」を適切に定義するのは困難。
「学習効率の悪い」ロールアウト例
全問（不）正解のロールアウト群
回答可能質問だけのロールアウト群
オンポリシーだけのロールアウト群
GRPOの性質上分散がゼロになるグルー
プはアドバンテージの計算に貢献できない
報酬値が低いロールアウトを除外するとロー
ルアウト間のアドバンテージ間のコントラスト
が弱くなる（＝失敗から学ばない）
非同期性（Mismatch）を一定許容しな
いと推論エンジンが先走って、採択されない
ロールアウトが多数生まれてしまう
©︎MATSUO INSTITUTE, INC.
21


# Page. 21

![Page Image](https://bcdn.docswell.com/page/4JQYPL497P.jpg)

まとめ
©︎MATSUO INSTITUTE, INC.


# Page. 22

![Page Image](https://bcdn.docswell.com/page/K74WYDLRE1.jpg)

Next Actionと展望
メールコーパスを活用したSelf-Playは一定手の内化。今回得た結果を国内論文や営業アセットを通じて対外発信すると
ともに、次のステップとして同じパラダイムを社内データ（Google Drive, Notion, Slack）に活用したい。
まとめ
今後の展望
Self-Play RLはゲーム以外でも有効！
社内実データへの拡張と局所世界モデルの獲得
データ読む
データ探す
質問作る
質問答える
しかし学習は一筋縄ではいかない、、
Self-Play Agentic RLを極めれば爆速で自社環
境に特化したモデルが作れる...!?
社内実データ
局所世界モデル
➢ 現在はOSのメールコーパスを利用し
ている（リアルデータ）
➢ しかし実際には社内や特定領域に特
化した検索エージェントを量産したい
➢ 検索対象をクローズドかつ多様な
ファイル群へと拡張したい
➢ 現状の強化学習では「検索の仕方」
のみを学んでいる
➢ しかし熟練者は「この内容ならここに
答えがある」と暗黙的にコーパスの構
造を捉えている（＝予測できる）
➢ 現行手法では手の届かない世界内
省を実現したい
©︎MATSUO INSTITUTE, INC.
23


# Page. 23

![Page Image](https://bcdn.docswell.com/page/LJ1Y6ZLVEG.jpg)

©︎MATSUO INSTITUTE, INC.


# Page. 24

![Page Image](https://bcdn.docswell.com/page/GJWGW9V372.jpg)

参考文献
SPICE: Self-Play In Corpus Environments Improves Reasoning; arXiv:2510.24684
SPADE: Self-Play in Adaptive Synthetic Executable Environments; arXiv:2608.19197
Self-Questioning Language Models; arXiv:2508.03682
SearchMaster: Grounded and Regulated Self-Play for Search Agents; arXiv:2608.01822
Search Self-play: Pushing the Frontier of Agent Capability without Supervision; arXiv:2510.18821
SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks; arXiv:2605.31433
©︎MATSUO INSTITUTE, INC.
25


