457 Views
October 08, 26
スライド概要
ブラウザやGUIを操作するComputer-use Agentに、強化学習を適用するには何が必要でしょうか。本発表では、The Agent Companyのような業務タスクを扱うベンチマーク環境を題材に、Computer-use Agentのモデル構築に向けた取り組みを紹介します。操作環境との接続や報酬設計、タスクの成否の評価など、「エージェントが動く」状態から「学習を回せる」状態に進むための実装上の課題と試行錯誤を共有します。
株式会社松尾研究所のスライドを共有します
Computer-Use Agentの強化学習 2026年10月1日 ©︎MATSUO INSTITUTE, INC.
自己紹介 穴井 晃太 経歴 〜2025年:トヨタグループ企業 現在:松尾研究所 松尾研究所で何してる? ・共同研究プロジェクトのPM ・LLMを活用した業務支援や、AIエージェントの設計・開発 趣味 ・平地、山、距離を問わず走れます。富士山を走る大会やマラソン、駅伝など ・Self-Supervised Learningとか好き ©︎MATSUO INSTITUTE, INC. 2
本日のまとめ Computer-Use Agentを、2Bサイズのモデル x GRPOでトライ。 操作の手順は変わったものの、タスク成功率は上がらず…。 取り組んだこと 結果 参考にしてほしいこと • 業務タスクのベンチマークTACで、 学習用の環境を構築した • 成功率は学習前46%、強化学 習後42〜47%で変わらず • 学習の数値が動いていても、目的 の操作を学んでいるとは限らない • 学習が進まなかったため、文献管 理アプリZoteroの単一操作に題 材を変えた • タスク遂行までの手数は減ったが、 遂行後も誤操作が残る • 学習の前に、環境と判定の不備 を直す • 同じ課題を、APIで提供される gpt-6-lunaは78%で解いた • 短時間かつ低費用で試せる環境 を先に用意する • 小型モデルQwen3.5-2Bを強化 学習した = 報酬 x 環境エンジニアリング ©︎MATSUO INSTITUTE, INC. 3
Computer-Use Agentとは Computer-Use Agentは、画面を見てクリックや入力を行うAIである。GUI操作では、1手の精度が全体の成功率を決め る。 全体の成功率は、1手の成功率を手数の分だけ掛けた値 CUAの動き方 画面のスクリーンショット モデルが次の操作を決める クリックや入力を実行 • 操作後の画面をもう一度入力し、課題が終わるまで繰り返す • APIのないアプリも、人と同じ画面から操作できる 1手の成功率 5手の課題 20手の課題 95% 77% 36% 99% 95% 82% • 1手の成功率が4ポイント違うと、20手の課題の成功率は 36%と82%に分かれる • 操作対象の画面に合わせた学習で、1手の精度を上げたい ©︎MATSUO INSTITUTE, INC. 4
なぜ手元で動く小型モデルを学習するのか APIで提供される大型モデルは急速に性能を上げている。それでも、クラウドに出せない現場や独自ソフトの操作には、手 元のモデルを学習する余地がある。 1. クラウドに出せない現場 2. 独自ソフトの画面 製造業の工場や装置のPCは、オンプレミスやオフラインで動く。外 部のAPIを呼べない。 ベンダー独自のソフトは、操作例がWebにほとんどない。汎用モデ ルは操作位置を誤りやすい。 3. 複数のソフトをまたぐ手順 4. 結果を見て次を決める操作 装置の制御、解析、記録とソフトをまたぐと、1手の誤りが積み重 なる。 画面に出た結果を業務知識で解釈し、次の操作や条件を決める 必要がある。 専門ソフトを対象にしたベンチマーク[1]の報告では、成功率は単一操作46%、1つのソフト内の手順24%、複数ソフトをまたぐ手順0% [1]:ProSoftArena(arXiv 2601.02399) ©︎MATSUO INSTITUTE, INC. 5
今回の題材と進め方 業務タスクのベンチマークTACから始めた。学習が進まなかったため、単一アプリのZoteroに題材を変えた。 題材1:The Agent Company(TAC) • • • 社内サービスをまたぐ業務タスク 学習用の環境は構築できた 学習は進まず、成功は0件 題材2:Zotero • • • 共通の設定 論文1件の年を書き換える単一操作 強化学習を実行し、評価まで完了 本日の結果はこちらが中心 内容 学習するモデル Qwen3.5-2B(約20億パラメータ)。画像を入力できる。先行研究で多い7B級より小さい 学習方法 LoRAで一部の重みだけを更新する。 学習手法はGRPO。同じ課題を4回試行し、報酬が高い試行の操作を強める 比較対象 OpenAI APIで提供されるGPT-6-lunaとGPT-5.4-nano ©︎MATSUO INSTITUTE, INC. 6
題材1:The Agent Company(TAC) TACは、社内サービス上の業務タスクを集めたベンチマークである。学習用の環境は構築できたが、学習は進まなかった。 実施したこと • GitLab、ownCloud、Rocket.Chatなどを自前で立てた仮想企業 • 175の業務タスク。約3分の1は複数のアプリをまたぐ • 成否をサービスのAPIで自動判定できる • 強化学習では同じ課題を何度も試行する。公式の初期化は評 価向けで時間がかかるため、試行ごとの初期化と分離を追加し た • 画面操作、採点、モデル更新までの処理を接続した • 75step、311回の試行を実行した 結果と判断 • 複合タスクの成功は311回中0回 • 目的の画面を開いた段階で止まり、タスクの手順には進めなかっ た • 手順が長すぎると判断し、単一アプリの単一操作に題材を変え た 出所:図はTheAgentCompany(MIT License)のREADME ©︎MATSUO INSTITUTE, INC. 7
題材1:TACのタスク例 1つのタスクが、複数のサービスをまたぐ数十手の手順になる。業務的なコンテキストを学びつつLong horizonなタスクを 実行することが求められる。 タスク指示例 1. ownCloudの表計算ファイルを開き、Group 2の担当を読み 取る 2. Rocket.Chatに公開チャンネル「Group2」を作り、該当するメ ンバーを全員追加する 3. 各メンバーに、担当するタスクをメンション付きで1件ずつ投稿 する 必要な操作 ファイルを開く、表を読む、サービスを移動する、チャンネルを作る、メン バーを追加する、投稿する 出所:TheAgentCompanyのタスクを要約。右は学習中の試行を保存画像から再構成したもの ©︎MATSUO INSTITUTE, INC. 8
題材2:Zoteroで論文の年を書き換える 高度な環境構築を避けるため、Gym-Anything[2]で雛形が公開されているZotero環境を選定。課題は、指定した論文 のDate欄を指定の年に書き換えて保存すること。 環境 本物のZoteroを仮想デスクトップで動かす 操作 論文を選ぶ、Date欄を押す、年を入力して保存する。最 大15手 判定 保存値が指定の年と完全に一致し、他の欄や論文が変わ っていないこと 評価 論文6件と年2種の組み合わせ。学習に使っていない年と 論文を含む [2]:Gym-Anything(github.com/cmu-l3/gym-anything)のCUA-Worldに含まれるZotero環境。これをもとに自社で構成 ©︎MATSUO INSTITUTE, INC. 9
操作の例:学習前のモデルが成功した回 指示:論文「On the Electrodynamics of Moving Bodies」のDate欄を1942に設定して保存し、終了する。他の論文や欄は変更しない 赤い印はモデルがクリックした位置、下の帯はモデルの出力。論文を選び、Date欄を押し、年を入力して保存している ©︎MATSUO INSTITUTE, INC. 10
モデルに与えた操作の選択肢 モデルはスクリーンショットを見て、マウスやキーボードの操作から1つを選ぶ。クリックの位置は、画面を0〜1000に正規化し た座標で答える。 種類 操作 マウス クリック、ダブルクリック、右クリック、ドラッグ、スクロ ール、移動 キーボード キー入力(Ctrl+Aなどの同時押しを含む)、 文字入力 その他 待機、終了の宣言 出力例 {"action": "left_click", "coordinate": [879, 402]} {"action": "key", "keys": ["ctrl", "a"]} • • • • 入力は、指示文、現在の画面、直近2手の画面と操作 画面は1,920×1,080ピクセル。目標の画像は与えない 隣の欄との間隔は約26ピクセル。座標では約24 全選択、入力、確定を1操作で行うオプションを追加 出所:自社で構成した操作の仕様。操作の種類はQwenのcomputer_useツールの定義に準拠 ©︎MATSUO INSTITUTE, INC. 11
学習の構成 学習の処理はPrime Intellectの学習基盤に、アプリの実行はModalに任せた。自分たちで作ったのは、環境サーバーの中 身である。 Prime Intellectの学習基盤(Hosted Training) 推論サーバー vLLMでQwen3.5-2Bを実 行 Modal 操作指示 オーケストレーター 試行を集め、報酬を付ける 環境サーバー(自作) 操作の仕様、報酬の計算 仮想デスクトップ 試行ごとに1台起動する。 Linuxのデスクトップ上で本物の Zoteroが動く 画面の スクショ 学習 試行と報酬からLoRAを更新し、推論サーバーに反映する • • Zoteroのデータベース 試行の最後に保存値を読む 推論サーバーとの間:OpenAI互換のAPI。スクリーンショットと指示を送り、操作を1つ受け取る 環境サーバーとの間:操作を渡し、次のスクリーンショットと、試行の最後に報酬を受け取る 出所:自社の構成。各サービスのアイコンは各社の公開アイコン ©︎MATSUO INSTITUTE, INC. 12
報酬の設計 報酬は、試行が終わった時点のデータベースの状態から計算する。対象以外の欄や論文を書き換えた場合は0点とし、正 しい保存に0.9点を与えた。 はい 0点 減点ありの条件では−0.2点 試行の終了 判定器がデータベースを検 査 対象以外の欄や論文が変 わったか 次の3項目を合計する 対象の論文を選んだ +0.05 いいえ Date欄を選んだ +0.05 指定の年が保存された +0.9 報酬の与え方は3回変えた 1. 最終結果だけに点 指定の年が保存されたら1点、それ以外は0点 。成功が0件で、試行の間に差が付かなかった 2. 途中の操作にも配点 論文を選ぶ0.05、Date欄を選ぶ0.10、保存 0.50など。差は付いたが、成功は0件のままだっ た 3. 最終版(上の図) 配点を保存に寄せた。保存0.9、途中の2項目 は各0.05。対象以外を書き換えたら0点 出所:自社で実装した報酬。途中の2項目は、アプリの状態から機械的に判定する ©︎MATSUO INSTITUTE, INC. 13
成功率を上げたのは、学習前の修正だった 強化学習を始める前に、学習前のモデルが課題を解けない原因を2つ直した。成功率は0から4割台に上がった。 原因1:開始時の画面 起きていたこと モデルが別の論文や別の欄をクリックしていた 原因2:文字の置き換え 年が「19051911」のように連結されて保存された 原因 アプリの窓が最大化されないまま始まり、モデルが出す座 値を置き換えるには全選択、入力、確定の3手が要る。 標と実際の画面がずれていた モデルは全選択を省いていた 対処 開始時に窓を最大化し、画面を撮り直してからモデルに 渡す 全選択、入力、確定を1つの操作として追加した 結果 座標のずれがなくなった 成功が24回中4回から11回に増えた 出所:自社実験。成功の回数は学習前のモデルを24回評価した値 ©︎MATSUO INSTITUTE, INC. 14
操作の例:修正前の開始状態 原因:仮想デスクトップがアプリ一覧の画面のまま始まり、Zoteroの窓が最大化されず二重に表示されていた モデルが出した座標と実際の画面がずれ、Date欄に年が連結して入力されている ©︎MATSUO INSTITUTE, INC. 15
強化学習のあと、保存までの操作は速くなった 保存の操作まで進む割合が増え、最短の3手で保存する割合も増えた。操作の手順は学習できているように見えた。 グラフの見方 • 灰色は学習前、濃紺は強化学習後 • A:論文2件で学習(50step) • B:Aに、他の欄を書き換えたときの減点を追加 • C:論文4件で学習(20step) • D:論文4件で学習(40step) • 右のグラフは、成功した回が対象 出所:自社評価。各112回、灰色は学習前、濃紺は強化学習後 ©︎MATSUO INSTITUTE, INC. 16
しかし、成功率は変わらなかった 強化学習後の成功率は42〜47%で、学習前の46%と変わらない。同じ課題をAPIモデルのgpt-6-lunaは78%で解いた 。 • 評価は論文6件と年2種の組み合わせで、各112 回。年はすべて学習に使っていない値 • 論文6件のうち2件は、どの条件でも学習に使って いない • その2件に限っても、成功は学習前が48回中24 回、強化学習後が20〜24回で変わらない • stepはモデルを1回更新する単位。1stepで同じ 課題を4回試行する 出所:自社評価。各112回、論文6件と年2種の組み合わせ。細い線は95%信頼区間、点線は学習前の値。APIモデルもQwenと同じ操作の書式で操作した ©︎MATSUO INSTITUTE, INC. 17
保存後の操作が、他の欄を書き換えていた モデルは保存に成功しても操作を続ける。保存後に画面が1行ずれ、同じ位置を押してPages欄を書き換える例が見つか った。 • • • 保存の直後に、Zoteroが同期を勧める案内を画面上部に表示する。表示された490回のうち380回は、最初の保存の1手後だった Pages欄を書き換えた67回のうち65回で、この案内が表示されていた モデルは新しい画面を受け取っているのに、同じ座標を出力した。画面の内容より位置に頼っている可能性がある。同じ傾向は学習前のモデルにもある 出所:自社評価の操作記録を分析。Qwenの5条件、計560回。赤線は同じクリックの高さ。件数は簡易な判定による暫定値 ©︎MATSUO INSTITUTE, INC. 18
操作の例:保存後にPages欄を書き換えた回 指示:論文「On the Electrodynamics of Moving Bodies」のDate欄を1911に設定して保存し、終了する 3手目で保存に成功する。その後に黄色い案内が表示され、モデルは同じ位置を押してPages欄を書き換える ©︎MATSUO INSTITUTE, INC. 19
減点を加えても、他の欄の書き換えは減らなかった 0.2点の減点を加えたBでも、他の欄を書き換える回は減らなかった。保存後に終了する操作を強める報酬がなかったこと が、主な要因と考えている。 • • 他の欄を書き換えた回は、減点なしのAが34回、減点ありの Bが37回 保存後の入力操作は1回あたり2.3〜2.6回で変わらない。 終了を正しく宣言した回はほぼ0回 考えられる要因 • 保存後に終了する操作への加点がなく、モデルは保存後も操 作を続けた • 減点が小さい。他の欄を書き換える危険があっても、 保存を試みるほうが報酬の期待値は高い 出所:自社評価。各112回、棒の中の数字は回数。AとBは論文2件で50step学習したモデル ©︎MATSUO INSTITUTE, INC. 20
速度と費用 1回の実験に数時間と7〜20ドルかかった。再実行と評価の繰り返しには、コスト最適化が必要である。 1実験の単位 時間 仮想デスクトップ (Modal) 学習と推論 (Prime) 合計 269秒 1回の試行にかかる時間の中央値。うち準備に50 秒 学習100step(試行400回) 3時間強 10.4ドル 8.8ドル 約19ドル 学習40step(試行160回) 約1.5時間 3.6ドル 3.3ドル 約7ドル 約2時間 学習がこの時間で停止した。4本中4本。区切って 再開した 評価112回(APIモデル) 30分以上 4.3ドル 2.3ドル 約7ドル 出所:PrimeとModalの請求および使用量(2026年10月1日12時時点)。OpenAIは公式料金と実測トークン数から計算 ©︎MATSUO INSTITUTE, INC. 21
本物のアプリとモックの比較 本物のアプリでは、実物の画面と挙動で学習できる。一方で1回の試行に時間と費用がかかる。 仮説を試す段階では、モックから始めるべきだった。 観点 本物のZotero(実測) モック(推定) 起動 デスクトップ環境を順に起動。300秒を 超えた回もある Webサーバーとブラウザだけ 課題ごとの準備 中央値50秒。アプリを再起動する 状態を直接設定する 動かせる場所 クラウドの仮想デスクトップが必須 通常のコンテナ。手元でも動く 並列化 試行1回に仮想マシン1台 1つのコンテナで複数の試行 特徴 実物の画面と挙動で学習できる 短時間かつ低費用。実物との差が残 る モックの例:CUA-Gym。Webアプリやデスクトップ アプリを模した環境を集めている 出所:本物のZoteroは自社実測。モックは構成からの推定で、今回は測定していない。図はCUA-Gym-Hub(Apache 2.0、arXiv 2605.25624) ©︎MATSUO INSTITUTE, INC. 22
Takeaways:今回の反省を、次に取り組む方へ 成功率は上がらなかった。同じことに取り組む方が同じ失敗を繰り返さないよう、反省を6つにまとめた。 1. 学習前の成功率を測る 2. 開始状態を固定する 3. 判定器の不備を先に直す 成功率が0か1に近い課題では、試行の 間に差が出ない。3〜6割になる課題を選 ぶ。 報酬を変える前に、操作を画像で見て、 画面と座標のずれを確認する。 成功は最終状態の事実で判定し、対象 以外への変更も検査する。 4. タスクの完了判断に報酬を設ける 5. 報酬と操作の関係を分析する 6. 短時間で試せる環境を用意する タスクを終えたら自分で終了する操作に加 点する。終了後も操作を続けると、意図し ない変更が起きる。副作用への減点は、 小さいと抑止にならない。 成功率や報酬の平均だけでは、何が強め られたか分からない。操作の内訳を集計し 、報酬が狙った操作を強めているかを確か める。 Rolloutや実験の高速化に直結。 評価環境のデプロイ費用にも影響。 ©︎MATSUO INSTITUTE, INC. 23
©︎MATSUO INSTITUTE, INC.
補足資料 ©︎MATSUO INSTITUTE, INC.
補足:TACが提供するものと、強化学習のために追加したもの TACは業務アプリ、タスク、初期化、採点を提供する評価用のベンチマークである。強化学習には、独立した試行を何度も 正しく生成する仕組みを追加する必要があった。 項目 公式が提供する範囲 今回追加したもの 難しかった点 業務サービス GitLab、ownCloud、Plane、Rocket.Chat の構成、データ、起動手順 クラウドへの配置、対象サービスの絞り込み アプリ、データベース、ブラウザから見た URLをすべて整合させる タスク 175タスクと、その指示文、作業用の環境 投稿などへのタスクの分解、指示の種類の 追加 小型モデルでも成功が出る難しさにする 初期化 依存データを初期化するスクリプトと、起動の 確認 試行ごとの初期化、ブラウザの状態管理、 開始画面の固定 前の試行の状態が残ると、学習データが 正しくなくなる 採点 途中経過にも点を与える採点 学習への接続、補助の報酬、報酬の内訳 報酬に差を作るだけでは、指示の達成 の監視 につながらない 学習と運用 公開されているのは評価の実行が中心 GRPOによる学習、途中保存、障害から の復旧 処理が動いていても、有効な試行が進 むとは限らない 出所:TheAgentCompanyの公式資料(SETUP.md、EVALUATION.md、evaluation/README.md、servers/README.md)と自社の実験記録 ©︎MATSUO INSTITUTE, INC. 26
補足:TACの環境構築が難しかった理由 難しさは3つの層に分かれる。アプリが起動することと、正しい学習データを継続して生成できることは、別の達成条件だった 。 1. 業務環境を安定して動かす • • • 複数のアプリとデータベースをDockerで動か す。空き容量は30GB以上、初回の起動は 数分から30分 タスクは専用のホスト名を使う。ブラウザから も正しいサービスに届く必要がある 公式資料にも、起動の失敗や人手での復 旧が必要な場合があると書かれている 2. 評価用の環境を反復学習に使う 3. 自分たちの構成と実装 • 公式の初期化は、1回に最大10分ほどかか る • CPUとGPUを別の場所に置く構成にし、接 続の準備に時間を使った • 同じユーザーを複数のブラウザで使うと、一 方の初期化が他方の投稿を消す。並列化 には環境一式の分離が必要 • 1回の障害のあと、後続の約30回の試行が 即失敗した • 5stepごとの保存にしたため、途中の障害で 区間ごと巻き戻った • 画面への到達に点を与えると差は付くが、業 務の達成には進まない 出所:TheAgentCompanyの公式資料(SETUP.md、EVALUATION.md、evaluation/README.md、servers/README.md)と自社の実験記録 ©︎MATSUO INSTITUTE, INC. 27
補足:次にTACで構築するときの優先順位 「動く」「学習できる」「良くなる」を別々に確かめる。小さく確かめてから、長時間の学習と並列化に進む。 確かめること 内容 1 最小の環境で1タスクを完了する 決まった操作の列で、画面操作の完了と採点を確認する 2 初期化の反復を確かめる 前の試行の投稿や開始画面が、次の試行に残らないことを連続実行で確認する 3 モデルに渡る画像と操作を確かめる 座標、キー入力、フォーカス、履歴を保存した記録で見る 4 部分点を業務の状態に結び付ける 対象のチャンネル、ユーザー、投稿文を検証し、画面への到達と達成を分ける 5 環境の障害を学習の失敗から分ける 障害が起きた試行は回復の対象とし、有効な試行数に含めない 6 短い区間で更新と保存を確かめてから長時間実行する GPUの確保時間ではなく、時間あたりの有効な試行数を監視する 7 並列化は状態の分離のあとに行う 試行を並べる単位ごとに環境一式を分ける 8 学習前と学習後を同じ条件で比べる タスク、開始状態、操作の上限、採点をそろえる 出所:自社の実験記録をもとに整理 ©︎MATSUO INSTITUTE, INC. 28
補足:学習したモデルと比較対象 学習したのはQwen3.5-2Bである。gpt-6-lunaとgpt-5.4-nanoは、同じ課題を解かせた比較対象である。 役割 モデル 規模と特徴 今回の成功率 学習したモデル Qwen3.5-2B 約20億パラメータ。画像を入力できる。LoRAで学習 学習前46%、学習後42 〜47% 比較対象 gpt-6-luna APIで提供される大型モデル。学習はしていない 78% 比較対象 gpt-5.4-nano APIで提供される小型モデル。画像入力に対応 4% 先行研究 学習したモデル 補足 GUI-R1 Qwen2.5-VLの3Bと7B 操作の予測を静的なデータで学習 ARPO、DART UI-TARS-1.5の7B GUI操作に特化した学習済みモデルを出発点にする MobileRL 7Bと9B 教師あり学習のあとに強化学習 出所:成功率は自社評価(各112回)。先行研究のモデルは各論文の記載による ©︎MATSUO INSTITUTE, INC. 29
補足:モデルへの入力と画像の解像度 モデルには、現在の画面と直近2手の画面と操作を与えた。画面は1,920×1,080ピクセルのまま渡している。 モデルへの入力 画像の解像度 • 指示文。論文名と設定する年を文章で与える • 1,920×1,080ピクセルのまま、縮小せずに渡している • 現在のスクリーンショット • 画像1枚は約2,000トークンに変換される(推定) • 直近2手のスクリーンショットと、そのときの操作 • 1トークンは約32×32ピクセルの範囲に当たる(推定) • 目標の状態を示す画像は与えていない • • 終了はモデルが宣言する。成否は試行のあとに判定器が決め る 情報欄の行の間隔は約26ピクセルで、1トークンの範囲より狭 い • 画面の拡大や、より高い解像度での入力は試していない 出所:自社の実装と評価記録。画像1枚あたりのトークン数と1トークンの範囲は、入力トークン数とモデルの仕様からの推定 ©︎MATSUO INSTITUTE, INC. 30
補足:学習データと強化学習の設定 1stepでは、1つの課題を4回試行する。課題は論文と年の組み合わせで、stepごとに入れ替わる。画面の構成は毎回同 じである。 項目 設定 1stepの構成 課題1つを4回試行する。グループは1つ、バッチサイズは4 課題の種類 論文2件×年4種の8通り、または論文4件×年4種の16通り。stepごとに1つを使う グループ内の4回 同じ論文、同じ年。違いはモデルの出力の揺らぎだけ(温度0.7) 画面 一覧の並びと画面の構成は毎回同じ。操作する位置は論文ごとに決まっている 評価 学習に使っていない年2種と、学習に使っていない論文2件を含む。各112回 その他 学習率1e-5、LoRA、1回の出力は最大256トークン、1試行は最大15手 出所:自社の学習設定。1群8回の条件は途中で停止した ©︎MATSUO INSTITUTE, INC. 31
補足:操作する位置を覚えているだけではないか 論文の選び分けはおおむねできている。懸念はDate欄の位置で、どの論文でも情報欄のほぼ同じ場所にあるため、案内の 表示で画面がずれると誤操作になる。 確認したこと 学習前 強化学習後 学習に使っていない論文2件での成功 48回中24回 48回中20〜24回 一覧を並べ替えたときの成功 48回中18回 48回中20〜24回 一覧を並べ替えたときに別の論文を選んだ回 48回中5回 48回中7〜12回 保存後に同じ高さを押し直して入力した回 112回中22回 112回中16〜23回 • • • 論文の選択:学習に使っていない論文や、並べ替えた一覧でも成功率は同程度。選び分けはおおむねできている Date欄:どの論文でも情報欄のほぼ同じ位置にある。論文による違いは1行程度 そのため、案内の表示で画面が1行ずれると、同じ座標がPages欄に当たる。情報欄の配置を変えた評価は行っていない 出所:自社評価。並べ替えは一覧を著者名の順にしたもの。別の論文を選んだ回の差は統計的に有意ではない ©︎MATSUO INSTITUTE, INC. 32
補足:成功率が上がらない要因の候補 モデルの規模だけでなく、報酬、学習の設定、画面の認識、操作の出し方のいずれも要因になりうる。今回切り分けられた のは一部である。 要因の候補 今回分かったこと 確かめていないこと モデルの規模 gpt-6-lunaは78%で解ける。課題そのものは解ける難しさ 4Bや7Bのモデルでの比較 報酬 保存後に他の欄を書き換える操作を区別していなかった。0.2 点の減点では差が出なかった より強い減点や、終了の宣言への加点 学習の設定 1群4回、バッチ4、学習率1e-5で固定した グループ数やバッチを大きくした場合 画面の認識 行の間隔約26ピクセルが、画像1トークンの範囲より狭い 画面の拡大や高解像度での入力 操作の出し方 座標を数値で直接出力させた 画面上の要素を指定する方式 ©︎MATSUO INSTITUTE, INC. 33
©︎MATSUO INSTITUTE, INC.