【Paper&Hacks Vol.89】RAGアプリハンズオン~LLM/Embedding選択~

>100 Views

August 04, 26

スライド概要

本イベントは、原則毎週火曜日20:00から松尾・岩澤研究室 LLMコミュニティが主催するLLMに関する輪読会 & 実装のオンラインイベントです。

【アーカイブはこちら】
https://youtu.be/Zyym5vBPBlA?si=V0aUrTktNcvs8WOD

【イベント概要】
対象: 普段から論文を読んでいる/普段からLLMの実装を行なっている方々

レベル: ★★★★☆ (Expert)

発表者: 井伊篤彦(異業種データサイエンス研究会®︎代表)

タイトル: 『RAGアプリハンズオン~LLM/Embedding選択~』

発表カテゴリ: やや実践寄り(ハンズオンやコード解説が多め)

イベント内容:(5回シリーズ)「RAGの仕組みを理解して改善し続けよう」の第4回目。今回は、RAGのタスクに応じたLLMとEmbeddingモデル選択の効果を解説します。実際にRAGアプリのコードを実行し体験してもらいます。

扱う論文:ハンズオンのためなし


【松尾研LLMコミュニティについて】
松尾研LLMコミュニティは、「大規模言語モデルについて知って学べるオンライン空間」として、東京大学松尾・岩澤研究室が運営するコミュニティです。現在、学生を中心とした16,000名以上が、原則無償で参加しています。

※ 現在、松尾研LLMコミュニティへの新規参加申込み受付を停止しております。

ーーー

【松尾研大規模言語モデル講座開講のお知らせ】

昨年大好評だった松尾研大規模言語モデル講座を今年も完全オンラインにて開講いたします! 今年は内容をグレードアップし、大規模言語モデル1,2,3の3段階構成でお送りすることになりました。 生成AIの基盤技術である大規模言語モデル(LLM)の原理からアーキテクチャーまで取り扱う実践的な講義となっております。座学のみならず演習を通して、手を動かしながら技術を深く理解し、幅広いトピックを網羅します。

詳細は以下のURLからご覧ください! 大規模言語モデル1:https://x.gd/Dy8yg

※事前に受講申込が必須 ※参加対象者やその他条件がございますので、必ずHPをご確認下さい。

profile-image

東京大学松尾・研究室が運営する「松尾研LLMコミュニティ」でのイベント資料などを公開します。 ◾️ 松尾研LLMコミュニティとは 松尾研LLMコミュニティは、「大規模言語モデルについて知って学べるオンライン空間」として、東京大学松尾・岩澤研究室が運営するコミュニティです。 現在、学生を中心とした10,000名以上が、原則無償で参加しています。 また、本コミュニティでは様々なイベント等を定期的に開催しております。 是非下記のリンクより参加申し込みをお待ちしております。 ◾️ 松尾研LLMコミュニティの各種リンク ・今後のイベント開催情報/参加申込;https://tr.ee/7d_W4DsImD ・松尾研LLMコミュニティ参加フォーム;https://tr.ee/RyDfuRzS55 ・過去イベントアーカイブ;https://tr.ee/wqdbFJJZ25

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

ダウンロード

関連スライド

各ページのテキスト
2.

(5回シリーズ)RAGの仕組みを理解して改善し続けよう 〜 LangChain Family × GradioによるRAGアプリ開発 〜 第4回:RAGの頭脳を選択しよう 〜 タスクに応じ LLM / Embedding 選択〜 2026/6/23異業種データサイエンス研 究会 ® 代表井伊 篤彦

3.

井伊篤彦 Who am I? 1963年(昭 38年)生まれ。京都大学工学部修士課程(合成化学専攻)修了。大学 和 院で量子化学を副専攻。 前職は一部上場大手日用品製造メーカー研究所。社内で各種製品開発を行うかた わらコンピューターケミストリーを手掛け、化学分子 3D表示ソフト等をC言語を用い て開発。 その後、海外駐在やグローバルな商品開発マネージャーを経て、2017年からAI及 びxR (VR, AR, MR) を用いた新規プロジェクトをゼロから立ち上げ率いた。AIプロ ジェクトでは、自ら機械学習モデルを開発した。 2019年に FBコミュニティ「異業種データサイエンス研究会 ®」を立ち上げる。現在 16個のFBコミュニティ を運営してい る。 プログラミングスクールで AIプログラミングの指導 をする傍ら、 年間数十回のデータサイエンス・ AI関連の セミナーを実施 している。

4.

RAGの仕組みを理解して改善し続けよう LangChain Family × Gradio で作る「作る → 測る → 改善 → 選択→ 自律化」5回シリーズ 2回目 1回目 測る 改善する Ragas × LangSmith chunk & prompt 戦略 / Advanced RAG 作る 動いて中身も見える RAGアプリ ・Retriever / Prompt / LLM ・ログ run_id)保存 ・Gradioで体験 ( 3回目 ・検索と生成を分解 ・Faithfulness / Relevance ・悪い例を追跡 ・chunk_size / overlap ・当たりチャンク探索 ・改善の再現性 4回目 5回目 選択 タスクに応じた generator 選択 / API 利用 ・Embedding選択 ・API利用 ・モデルサイズ選択 自律化 LangGraph / Agentic RAG ・検索 / 推論 / 生成 ・ループで精度改善 ・運用に近い形へ シリーズの狙い: RAGアプリをベースに「作る → 測る → 改善 → 選択 → 自律化」の流れを体験し、検 索・生成・評価・モデル選択を組み合わせた、継続的な改善サイクルを理解 する。

5.

ハンズオン用コード( zipファイル) https://drive.google.com/file/d/1AqldQ1IdVUNt025JVQXW_m-GSNar_KEY/view?usp=sharing ※ 本ハンズオンは、事前準備を完了していることを前提に進行します。 コード実行用のキー取得、Google Colab の基本操作、Google Drive のマウント確認は、必ず事前に済ませてください。 Google Colab から Google ドライブのマウントの方法については、添付のドキュメントを読み、事前確認お願いします。 ① https://docs.google.com/document/d/1wJEIOvWlEMdj-DwmvTPgVkWYUSvWsWNc/edit?usp=drive_link&ouid=106881452668 834877355&rtpof=true&sd=true ② ハンズオン用コードを動かすには、HuggingFace, OpenAI API (有料版)のシークレットトークン(キー)が必要です。 HuggingFace シークレットトークン取得参考記事: https://qiita.com/so9_Monodzukuri_AI/items/388e9b546ecb2ecfc420 OpenAI API キー取得参考記事: https://www.tis2010.jp/openai_apikey/ � Google Colab のシークレット機能の使い方記事: https://note.com/npaka/n/n79bb63e17685

6.

RAGの基本フロー Embedding ベクトル DB 生データ 検索 Embedding Retriever コンテキスト 回答 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ システム プロンプ ト

7.

RAGの基本フローと要素技術の関係 Embedding ベクトル DB RAG = 検索強化 x ICL x CoT 検索強化 とも解釈できる 検索 生データ Embedding コンテキスト Retriever In-Context L 回答 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ システム プロンプ ト Chain of T

8.

RAGの基本フローと各回の関係 Embedding ベクトルDB RAGの性能は、単一要素 の最適化ではなく、要素間 の協調設計で決まる 第 3回:チャンク戦 略 検索 生データ 第4回:Emb.比較 Embedding 何を渡すか コンテキスト Retriever 第 4回:LLM 選択 コンテキスト制御装置 第3回:Adv. RAG 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ どう振る 舞わせるか 制約付き 生成 第 3回:プロンプト戦 略 回答 第 2回:評 価

9.

第3回: Chunk / Prompt 戦略+アドバンス RAG Embedding ベクトルDB RAGの性能は、単一要素 の最適化ではなく、要素間 の協調設計で決まる 第 3回:チャンク戦 略 検索 生データ 第4回:Emb.比較 Embedding 何を渡すか Retriever コンテキスト 第 4回:LLM 選択 コンテキスト制御装置 制約付き 生成 第3回:Adv. RAG 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ どう振る 舞わせるか 第 3回:プロンプト戦 略 回答 第 2回:評 価

10.

魔法科高校 15問は「 RAG実験道具」 小型でも、検索・列挙・統合・取り違えを観察できるベンチマーク 15問のタイプ分散 単純な事実確認だけでなく、実務RAG で起き やすい失敗型を意図的に混在 単純事実確認 人物・属性対応 複数正答列挙 組織名列挙 人物関係対応 観察できること 複合文脈統合 DB用5分割テキスト 重点問題が診断軸になる 1つにまとめすぎず、細かく分けすぎ ない。 に近い距離感 「情報が散らばる」実務RAG を作る。 話題のまとまり を保持 巨大文書の偶 然ヒット抑制 複数ファイル 横断を再現 retrieval失敗 を追跡しやすい chunk戦略で改善する問題 promptで救える問題 Q12 Q15 複数要素列挙 prompt_detailで改善し やすい 複合文脈統合 generator 差が見える超難問 generator変更で残る問題を突破 「最高点探し」ではなく、失敗要因を分解し、次の仮説へつなぐための小型ベンチマーク

11.

魔法科高校 15問 一覧 Q番号・質問・正答・問題タイプ|検索・列挙・統合・取り違えを観察するための小型ベンチマーク Q 質問 Q1 「魔法科高校の劣等生」のキャラクター司波深雪の声優は誰ですか? Q2 九島家の説明では司波深雪に匹敵する魔法力を持つとされ、別の記述では十三使徒「アンジー・シリウス」と呼ばれる人物は誰ですか? Q3 Q4 正答 問題タイプ 早見沙織 単純事実確認 アンジェリーナ・クドウ・シールズ(リーナ)。 人物・属性対応(同一人物特定) 十三束鋼の二つ名「Range Zero(レンジ・ゼロ)」には、どのような二つの意味が込められていますか? 遠隔魔法が苦手だという揶揄と、ゼロ距離では無類の強さを発揮するという敬意の二つの 意味が込められている。 複数要素説明(二面性理解) 「魔法科高校の劣等生」のキャラクター九重八雲の身長と体重を教えて。 身長177cm、体重67kg 単純事実確認 Q5 「魔法科高校の劣等生」で、司波達也と九島光宣はどちらも「精霊の眼(エレメンタル・サイト)」を持っています。 2人の知覚の得 意分野はそれぞれ何ですか? 司波達也は分解・再成の特性から能動的な知覚に優れ、九島光宣は仮装行列(パレード) の特性から受動的な知覚に優れ、意識を向けていない状態でも遠方の魔法の兆候を感じ取 れる。 人物・属性対応(比較) Q6 「魔法科高校の劣等生」の中で「水晶眼」を持つキャラクターは以下の3人のうち誰でしょうか? 1. 司波深雪 2. 千葉エリカ 3. 柴田美月 柴田美月 単純事実確認(選択式) Q7 吉祥寺真紅郎の異名「カーディナル・ジョージ」は、どの二つの要素に由来していますか?また、彼がそれを活かして使う代表的な 仮説上の存在だった「基本(カーディナル)コード」の発見と、名前の「真紅(カーディ 魔法は何ですか? ナルレッド)」に由来する。代表的な魔法は「不可視の弾丸(インビジブル・ブリット)」。 Q8 一条将輝の戦略級魔法「海爆(オーシャン・ブラスト)」は、どの技術を基幹にし、誰が完成させたものですか? Q9 「魔法科高校の劣等生」に出てくる戦略級魔法「オゾンサークル」は誰の魔法ですか? Q10 各ファイルの記述に従うと、日本の国家公認戦略級魔法師について、五輪澪はどのような立場で記されており、一条将輝は何人目 として認定されましたか? Q11 「魔法科高校の劣等生」のキャラクター牛山欣治は社内で司波達也が「ミスター・シルバー」と呼ばれるのに対し、どのように呼 ばれていますか? Q12 『メイジアン・カンパニー』において、司波達也が設立した三つの組織・法人の名前をすべて 挙げてください。 複数要素列挙(異名の由来) 達也から提供されたトゥマーン・ボンバの基幹技術「チェイン・キャスト」を基に、吉祥 寺真紅郎が完成させた。 技術・人物対応 カーラ・シュミットとウィリアム・マクロード 複数正答列挙 五輪澪は「日本が公式に認定している唯一の戦略級魔法師」と記されており、一条将輝は「日 本で二人目の国家公認戦略級魔法師」として認定された。 複数ファイル記述比較 ミスター・トーラス 単純事実確認 「メイジアン・ソサエティ」「ステラ・ジェレネーター」 「一般社団 法人メイジアン・カンパニー」。 組織名列挙 Q13 「魔法科高校の劣等生」の中条あずさが持つ系統外魔法「梓弓」は、どのようなタイプの魔法で、どのような状況に適していますか? 情動干渉系の系統外魔法で、一定のエリア内にいる人間をある種のトランス状態に誘導する。 個人ではなくエリアに働きかける稀少な魔法で、無秩序な混乱の鎮圧に適している。 説明型(魔法の性質・用途) Q14 一条美登里は使えず、長女の一条茜がその適性を受け継いでいる。 人物関係対応(家系継承) 組んでいる人物は牛山欣治で、正体を確信した第一高校の生徒 は中条あずさ。 複合文脈統合 一色家の固有魔法「神経電流撹乱(神経撹乱)」について、一条家では誰が使えず、誰がその適性を受け継いでいますか? Q15 「トーラス・シルバー」に関して、司波達也がその名で製品を世に送り出す際に組んでいる人 物と、その正体を確信した第一高校の生徒をそれぞれ答えてください。

12.

RAGの基本フローと各回の関係 Embedding ベクトル DB RAGの性能は、単一要素 の最適化ではなく、要素間 の協調設計で決まる 第3回:チャンク戦略 検索 生データ 第4回:Emb.比較 Embedding 何を渡すか コンテキスト Retriever 第4回:LLM 選択 コンテキスト制御装置 制約付き 生成 第3回:Adv. RAG 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ どう振る舞 わせるか 第3回:プロンプト戦略 回答 第2回:評価

13.

RAGの基本フローと各回の関係 Embedding ベクトルDB RAGの性能は、単一要素 の最適化ではなく、要素間 の 協調設計 で決まる 第 3回:チャンク戦 略 検索 生データ 第4回:Emb.比較 Embedding 何を渡すか コンテキスト Retriever 第 4回:LLM 選択 コンテキスト制御装置 第3回:Adv. RAG 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ どう振る 舞わせるか 制約付き 生成 第 3回:プロンプト戦 略 回答 第 2回:評 価

14.

Embeddingモデル比較 実験条件(固定) RAG方式: Basic RAG 再現性実験込み / 魔法科高校15問 chunk条件:300/50/5 vs 450/50/5 15 平均正答数 / 15問(各条件 n=6) 10 8.67 9.17 最高平均 10.17 10.00 8.67 0 Ruri 300→450 +1.67 Sarashina 300→450 +0.83 chunk_size : 450 chunk_size : 300 chunk_size : 450 chunk_size : 300 chunk_size : 450 chunk_size : 300 7.00 5 generator:Qwen3-8B-bnb-4bit OpenAI 300→450 +1.50 prompt:simple 各条件 n=6(5/7単回+再現性 5回) 結論 最高平均 OpenAI 450/50/5 10.17/15 ただし Sarashina 450 も 10.00/15。 差は小さく、 「OpenAIが圧倒的」とは言わない。 再現性実験で確認 ● 300より450が全体として強い ● Q9は300が安定 → chunk拡大は万能ではない ● Q15は全36回不正解 Ruri : cl-nagoya/ruri-v3-130m Sarashina : sbintuitions/sarashina-embedding-v2-1b OpenAI : text-embedding-3-small Embeddingは重要。ただし、Basic RAG固定の単純比較だけでは難問突破条件までは判断できない

15.

sarashina-embedding-v2-1b 日本語に特化した「指示付き」テキスト埋め込みモデル 特徴 1:日本語特化 Sarashina2.2-1Bをベースに、対照学習で 構築された日本語向けEmbeddingモデル。 使い方のポイント Model クエリ側 task: 検索目的の指示 query: ユーザーの質問 特徴 2:指示を付与できる クエリ側に task: ... / query: ... を付与し、 Retrieval・STSなど用途に応じたベクトル に調整できる。 特徴 3:RAG向き JMTEB評価( 2025/7/28時点) ベクトル化 Sarashina-v2 Avg Retrieva STS Rerank l 76.38 76.48 84.22 86.28 Ruri-v3 75.85 76.03 81.59 85.84 OpenAI 3-large 73.86 71.95 82.52 83.06 検索対象側 Sarashinaは「日本語RAGで試す text: 検索対象のテキスト 価値があるEmbedding」 Retrieval・STS・Rerankingで高スコア。 日本語RAGの検索側候補として有力。 Sarashinaは日本語特化・指示付き Embedding。RAGでは「検索側の選択肢」として評価する。 https://www.sbintuitions.co.jp/blog/entry/2025/08/20/160139

16.

RAGの基本フローと各回の関係 Embedding ベクトル DB RAGの性能は、単一要素 の最適化ではなく、要素間 の協調設計で決まる 第3回:チャンク戦略 検索 生データ 第4回:Emb.比較 Embedding 何を渡すか コンテキスト Retriever 第4回:LLM 選択 コンテキスト制御装置 制約付き 生成 第3回:Adv. RAG 質問 図参照: https://www.techfirm.co.jp/blog/vector-database https://g-gen.co.jp/useful/General-tech/llm-ai/ https://blog-ja.allganize.ai/allganize_rag-1/ どう振る舞 わせるか 第3回:プロンプト戦略 回答 第2回:評価

17.

全 generator 比較 実験条件(固定) RAG方式 : Basic RAG Basic RAG / prompt simple / 魔法科高校15問 / 各条件3回 embedding : ruri-v3-130m chunk条件 : 300/50/5 vs 450/50/5 prompt : simple 各条件 n=3 (15問×3回) 15 0 Qwen3 8B 300→450 +1.67 Qwen3 14B 300→450 +0.00 結論 9.00 gpt-4o mini 300→450 +1.00 chunk_size : 450 chunk_size : 300 chunk_size : 450 chunk_size : 300 chunk_size : 450 chunk_size : 300 chunk_size : 450 5 10.00 8.00 chunk_size : 300 10 9.67 12.00 12.00 gpt-4.1 mini 300→450 +0.00 chunk_size : 300 11.00 11.00 11.00 9.67 最高平均 gpt-4.1-mini 12.00/15 chunk_size : 450 平均正答数 / 15問(各条件 n=3) ただし gpt-5.4-mini は最速。精度だけでなく時間軸 も別評価が必要。 • gpt-4.1-mini は 300/450 とも3回連続 12/15 • Qwen3-14B はOSSとして 11/15で安定 • Q15は全条件で不正解 gpt-5.4 mini 300→450 +0.67 Generator差は明確。最高精度は gpt-4.1-mini、速度最優先なら gpt-5.4-mini

18.

Qwen3-8B と 14B 比較 実験条件(固定) RAG方式 : Basic RAG OSS generator / 4bit量子化 / 魔法科高校15問 / 各条件3回 embedding : ruri-v3-130m chunk条件 : 300/50/5 vs 450/50/5 prompt : simple 各条件 n=3 (15問×3回) 15 平均正答数 / 15問(各条件 n=3) 結論 11.00 11.00 9.67 10 0 Qwen3-14B 11.00/15 Qwen3 8B 300→450 +1.67 chunk_size : 450 chunk_size : 300 回答速度(平均秒 /問) chunk_size : 450 5 chunk_size : 300 8.00 最高平均 Qwen3 14B 8B 14B 4.88秒 → 5.94秒 9.84秒 → 12.77秒 • 14Bは3回とも11/15で安定 • 8Bは450で改善するが変動あり • 14Bは高精度だが8Bの約2倍遅い 300→450 +0.00 OSSでは Qwen3-14B が有力。ただし速度・ VRAM負荷とのトレードオフが大きい

19.

OpenAI API generator 比較 実験条件(固定) RAG方式 : Basic RAG API generator / Basic RAG / 魔法科高校15問 / 各条件3回 embedding : ruri-v3-130m chunk条件 : 300/50/5 vs 450/50/5 15 10 平均正答数 / 15問(各条件 n=3) 10.00 11.00 prompt : simple 各条件 n=3 (15問×3回) 結論 12.00 12.00 最高平均 9.00 9.67 gpt-4.1-mini 12.00/15 0 gpt-4o mini 300→450 +1.00 gpt-4.1 mini 300→450 +0.00 chunk_size : 450 chunk_size : 300 chunk_size : 450 chunk_size : 300 chunk_size : 450 5 chunk_size : 300 回答速度(平均秒 /問) 4.1-mini 5.4-mini 1.50秒 → 2.35秒 0.81秒 → 0.93秒 • gpt-4.1-mini は精度・安定性が最良 • gpt-5.4-mini は最速だが精度は伸びない • gpt-4o-mini は450で改善 gpt-5.4 mini 300→450 +0.67 APIモデルでは gpt-4.1-mini が最有力。gpt-5.4-mini は高速比較枠として位置づける

20.

実験条件(固定) 全 generator 回答速度比較 RAG方式 : Basic RAG 平均秒/問(30実行・450回答)/ 小さいほど速い embedding : ruri-v3-130m chunk条件 : 300/50/5 vs 450/50/5 平均秒/問(小さいほど速い) gpt-5.4-mini 300 0.81秒 結論 gpt-5.4-mini 450 0.93秒 最高平均 gpt-4.1-mini 300 1.50秒 gpt-4o-mini 300 1.59秒 gpt-4o-mini 450 1.86秒 gpt-4.1-mini 450 Qwen3-8B 4bit 300 Qwen3-8B 4bit 450 Qwen3-14B 4bit 300 Qwen3-14B 4bit 450 prompt : simple 各条件 n=3 (15問×3回) gpt-5.4-mini 300 0.81秒/問 実用バランス: gpt-4.1-mini 300 = 12/15、1.50秒/問 gpt-4.1-mini 450 = 12/15、2.35秒/問 ※ 2.35秒 4.88秒 5.94秒 9.84秒 12.77秒 • APIモデルはOSSより大幅に高速 • gpt-4.1-mini 300は高精度かつ十分高速 • OSS 14Bは高精度だが時間コストが大きい ※chunk size=450は最初の1問回答前にretrieverを再作成し、 残りの14問は再作成したretrieverを使用。 速度だけなら gpt-5.4-mini。精度と速度の総合では gpt-4.1-mini が扱いやすい

21.

第4回RAGハンズオン 最難問 Q15に挑戦 ハンズオン用アプリ “04-1_RAG単問回答アプリ .ipynb” で 第3回( chunk/prompt戦略+アドバンス RAG) および、第 4回(generator選択※)のパラメータを 自由に変えて最難問攻略を目指せ! ※ 今回はEmbedding は ruri 固定

22.

第3回RAGハンズオンより 新 5問 新 元 Q1 Q5 新 元 Q2 Q9 新 元 Q3 Q11 新 元 Q4 Q12 新 元 Q5 質問 15問 元 Q15 魔法科高校 新5問 「魔法科高校の劣等生」で、司波達也と九島光宣はどちらも「精 霊の眼(エレメンタル・サイト) 」を持っています。2人の知覚 の得意分野はそれぞれ何ですか? 「魔法科高校の劣等生」に出てくる戦略級魔法「オゾンサー クル」は誰の魔法ですか? 正解 司波達也は分解・再成の特性から 能動的な知覚に優れ、九島 光宣は仮装行列(パレード)の特性から 受動的な知覚に優れ、 意識を向けていない状態でも遠方の魔法の兆候を感じ取れる。 カーラ・シュミットとウィリアム・マクロード 「魔法科高校の劣等生」のキャラクター牛山欣治は社内で司 波達也が「ミスター・シルバー」と呼ばれるのに対し、どの ミスター・トーラス ように呼ばれていますか? 『メイジアン・カンパニー』において、司波達也が設立した 「メイジアン・ソサエティ」 「ステラ・ジェレネーター」 「一般 三つの組織・法人の名前をすべて挙げてください。 社団法人メイジアン・カンパニー」 。 「トーラス・シルバー」に関して、司波達也がその名で製品を 世に送り出す際に組んでいる人物と、その正体を確信した第 一高校の生徒をそれぞれ答えてください。 組んでいる人物は牛山欣治で、正体を確信した第一高校の生 徒は中条あずさ。

23.

なぜ Q15は難しいのか? Q15 「トーラス・シルバー」に関して、司波達也がその名で製品を世に送り出す際に組んでいる人物と、 その正体を確信した第一高校の生徒をそれぞれ答えてください。。 登場人物 wiki_01.txt 登場人物 wiki_02.txt 登場人物 wiki_04.txt 技術者・事業側の文脈 第一高校・生徒側の文脈 人物・関連情報の補助文脈 「トーラス・シルバー」と して製品を世に出す枠組み 中条あずさが正体を確信 する手がかり 人物対応を取り違えないための 周辺情報・参照断片 必要な統合 難しさの本質 1 検索だけでは足りない 3ファイルに分散した断片を、同一 質問内で同時に回収する必要があ る。 「牛山欣治」+「中条あずさ」を 別々の文脈から対応づける 2「誰」と「誰」の対応づけが必要 牛山欣治=共同開発者/中条あずさ=正 体を確信した生徒、という役割分担を混 同しやすい。 3文脈統合型の最難問 単一チャンクの引用ではなく、複数 文脈を統合して初めて完全正答にな る。

24.

魔法科高校 15問攻略結果 第3回( chunk/prompt戦略+アドバンス RAG)および 第4回(embedding/generator選択)の知見を活かして検討

25.

魔法科高校 15問 一覧 Q番号・質問・正答・問題タイプ|検索・列挙・統合・取り違えを観察するための小型ベンチマーク Q 質問 Q1 「魔法科高校の劣等生」のキャラクター司波深雪の声優は誰ですか? Q2 九島家の説明では司波深雪に匹敵する魔法力を持つとされ、別の記述では十三使徒「アンジー・シリウス」と呼ばれる人物は誰ですか? Q3 Q4 正答 問題タイプ 早見沙織 単純事実確認 アンジェリーナ・クドウ・シールズ(リーナ)。 人物・属性対応(同一人物特定) 十三束鋼の二つ名「Range Zero(レンジ・ゼロ)」には、どのような二つの意味が込められていますか? 遠隔魔法が苦手だという揶揄と、ゼロ距離では無類の強さを発揮するという敬意の二つの 意味が込められている。 複数要素説明(二面性理解) 「魔法科高校の劣等生」のキャラクター九重八雲の身長と体重を教えて。 身長177cm、体重67kg 単純事実確認 Q5 「魔法科高校の劣等生」で、司波達也と九島光宣はどちらも「精霊の眼(エレメンタル・サイト)」を持っています。 2人の知覚の得 意分野はそれぞれ何ですか? 司波達也は分解・再成の特性から能動的な知覚に優れ、九島光宣は仮装行列(パレード) の特性から受動的な知覚に優れ、意識を向けていない状態でも遠方の魔法の兆候を感じ取 れる。 人物・属性対応(比較) Q6 「魔法科高校の劣等生」の中で「水晶眼」を持つキャラクターは以下の3人のうち誰でしょうか? 1. 司波深雪 2. 千葉エリカ 3. 柴田美月 柴田美月 単純事実確認(選択式) Q7 吉祥寺真紅郎の異名「カーディナル・ジョージ」は、どの二つの要素に由来していますか?また、彼がそれを活かして使う代表的な 仮説上の存在だった「基本(カーディナル)コード」の発見と、名前の「真紅(カーディ 魔法は何ですか? ナルレッド)」に由来する。代表的な魔法は「不可視の弾丸(インビジブル・ブリット)」。 Q8 一条将輝の戦略級魔法「海爆(オーシャン・ブラスト)」は、どの技術を基幹にし、誰が完成させたものですか? Q9 「魔法科高校の劣等生」に出てくる戦略級魔法「オゾンサークル」は誰の魔法ですか? Q10 各ファイルの記述に従うと、日本の国家公認戦略級魔法師について、五輪澪はどのような立場で記されており、一条将輝は何人目 として認定されましたか? Q11 「魔法科高校の劣等生」のキャラクター牛山欣治は社内で司波達也が「ミスター・シルバー」と呼ばれるのに対し、どのように呼 ばれていますか? Q12 『メイジアン・カンパニー』において、司波達也が設立した三つの組織・法人の名前をすべて 挙げてください。 複数要素列挙(異名の由来) 達也から提供されたトゥマーン・ボンバの基幹技術「チェイン・キャスト」を基に、吉祥 寺真紅郎が完成させた。 技術・人物対応 カーラ・シュミットとウィリアム・マクロード 複数正答列挙 五輪澪は「日本が公式に認定している唯一の戦略級魔法師」と記されており、一条将輝は「日 本で二人目の国家公認戦略級魔法師」として認定された。 複数ファイル記述比較 ミスター・トーラス 単純事実確認 「メイジアン・ソサエティ」「ステラ・ジェレネーター」 「一般社団 法人メイジアン・カンパニー」。 組織名列挙 Q13 「魔法科高校の劣等生」の中条あずさが持つ系統外魔法「梓弓」は、どのようなタイプの魔法で、どのような状況に適していますか? 情動干渉系の系統外魔法で、一定のエリア内にいる人間をある種のトランス状態に誘導する。 個人ではなくエリアに働きかける稀少な魔法で、無秩序な混乱の鎮圧に適している。 説明型(魔法の性質・用途) Q14 一条美登里は使えず、長女の一条茜がその適性を受け継いでいる。 人物関係対応(家系継承) 組んでいる人物は牛山欣治で、正体を確信した第一高校の生徒 は中条あずさ。 複合文脈統合 一色家の固有魔法「神経電流撹乱(神経撹乱)」について、一条家では誰が使えず、誰がその適性を受け継いでいますか? Q15 「トーラス・シルバー」に関して、司波達也がその名で製品を世に送り出す際に組んでいる人 物と、その正体を確信した第一高校の生徒をそれぞれ答えてください。

26.

15問全問攻略:成功条件 実験条件(全問攻略) Advanced RAG embedding: Ruriに固定 generator比較 prompt × RAG × generator を比較 17条件 / 魔法科高校 15問 / AI評価 chunk:1000/100/10 embedding : Ruri 条件別 AI評価正答数 / 15問 detail + Multi gpt-5.4-mini 15 simple + Multi gpt-4.1-mini 14 simple + Multi gpt-5.4-mini 14 detail + Hybrid gpt-4.1-mini 13 detail + Hybrid gpt-4o 13 detail + Hybrid gpt-5.4-mini 13 detail + Hybrid gpt-4o-mini 12 detail + Multi gpt-4o-mini 12 0 5 10 全問正解条件 generator: gpt-5.4-mini prompt: detail chunk条件: 1000/100/10 advanced RAG: Multi-Query 15/15 成功の解釈 • Multi-Queryで根拠候補を広く取得 • prompt_detailで役割分離を明示 • 強い generatorが広い文脈を統合 次点は Multi-Query × gpt-4.1-mini / gpt-5.4-mini の 14/15。最後に Q9 を落とした。 15 全問正解は「検索」 「prompt」 「generator」 「chunk条件」の総合設計で到達する

27.

最後の壁: Q9・Q12・Q15 実験条件(全問攻略) generator比較 chunk:1000/100/10 prompt × RAG × generator を比較 embedding : Ruri Advanced RAG 設問別成功条件数 / 17条件 設問別の正解条件数( 17条件中) 結論 15 15 15 15 15 15 15 14 難問の正体 14 14 13 列挙・統合・役割分離 13 12 Q9: 2名列挙の片落ち Q12: 三組織の列挙漏れ Q15: 牛山欣治と中条あずさの役割分離 10 5 5 4 4 0 Q1 Q2 Q3 Q4 Q5 Q6 Q7 Q8 Q9 Q10 Q11 Q12 Q13 Q14 Q15 単純な「似た文書を探す」だけでは最後の 3問を安定攻略できない。 第4回への接続 同じ検索結果でも generator によって、 • ノイズ耐性 • 複数要素の統合 • 捏造せず答える力 が変わる Q9成功: 4/17、Q12成功: 5/17、Q15成功: 4/17 主要失敗: カーラ・シュミット漏れ、三組織漏れ、中条あずさ漏れ 難問攻略では、検索精度だけでなく、Generatorの文脈統合力 が決定的に効く

28.

OpenAI Embedding 実験条件(全問攻略) embedding : text-embedding-3-small 15問全問正解条件 Basic RAG generator比較 chunk:700/70/7 3 15/15回数( 3試行中) 2/3 15/15が出た chunk条件 700/70/7 2 最高点 15/15 1 1/3 1/3 最高点 最高点 gpt-4o-mini gpt-5.4-mini 15/15 0 gpt-4.1-mini • gpt-4.1-mini:3試行中 2回 15/15 • gpt-4o-mini:3試行中1回 15/15 • gpt-5.4-mini:3試行中1回 15/15 15/15 OpenAI Embedding 条件では、全問正解は「 Basic RAG × detail × 700/70/7」で到達した

29.

RAGは「選択」と「検証」で強くなる 今回実験した RAGの要素: Embedding 選択 — 必要な文脈を拾えるか ※特に Embeddingは当初の予想よりも重要だと分かった( OpenAI Embeding) Generator 選択 — 拾った文脈を統合して答えられるか そして、前回と今回取り上げた種々の条件※を変えて検証しながら改善する (※Chunk戦略、Prompt戦略、アドバンス RAG、 Embedding、Genarator等) RAG最適化は「部品選び」ではなく、条件を変えて検証する 実験システムである

30.

RAGの仕組みを理解して改善し続けよう LangChain Family × Gradio で作る「作る → 測る → 改善 → 選択 → 自律化」5回シリーズ 2回目 1回目 測る 改善する Ragas × LangSmith chunk & prompt 戦略 / Advanced RAG 作る 動いて中身も見える RAGアプリ ・Retriever / Prompt / LLM ・ログ run_id)保存 ・Gradioで体験 ( 3回目 ・検索と生成を分解 ・Faithfulness / Relevance ・悪い例を追跡 ・chunk_size / overlap ・当たりチャンク探索 ・改善の再現性 4回目 5回目 選択 タスクに応じた generator 選択 / API 利 用 ・Embedding選択 ・API利用 ・モデルサイズ選択 自律化 LangGraph / Agentic RAG ・検索 / 推論 / 生成 ・ループで精度改善 ・運用に近い形へ シリーズの狙い: RAGアプリをベースに「作る → 測る → 改善 → 選択 → 自律化」の流れを体験し、検索・ 生成・評価・モデル選択を組み合わせた、継続的な改善サイクルを理解 する。

31.

generator (10) 選択 embedding (3) 選択 advanced rag (7)選 prompt (7) 選択 agentic rag 選 (2)択 択 応答 テキスト 検索 / Agentic trace / デバッグ情報 価指標との接続 / Agentic要約 agentic rag 最大ループ回数 Agentic trace 連続回答 chunk戦略 LangGraph構造図 設定 advanced rag 設定 生成ハイパーパラ メータ設定 5回目配布アプリ:ログ保存機能も含 め機能テンコ盛り 履歴

32.

agentic rag (2)選 択 LangGraphによる Agentic RAG 実行結果可視化実装 LangGraph構造図 Agentic trace

33.

9 回+1 シリーズ: RAG の基礎から実践まで 第一部 基礎編:RAGの仕組みを理解して改善し続けよう 1回目 作る 動いて中身も見える RAGアプリ ・Retriever / Prompt / LLM ・ログ run_id)保存 ・Gradioで体験 ( 2回目 測る Ragas × LangSmith ・検索と生成を分解 ・Faithfulness / Relevance ・悪い例を追跡 3回目 改善する chunk & prompt 戦略 / Advanced RAG ・chunk_size / overlap ・当たりチャンク探索 ・改善の再現性 7/21(火) 予定 4回目 選択 タスクに応じた generator 選択 / API 利 用 ・Embedding選択 ・API利用 ・モデルサイズ選択 5回目 自律化 LangGraph / Agentic RAG ・検索 / 推論 / 生成 ・ループで精度改善 ・運用に近い形へ 第二部 実践編:現場で扱うための拡張と運用 GPU 効率利用 LLM 量子化 (8月予定) 6回目 7回目 8回目 評価と基盤固め 目をもつ 関係を知る 評価法/検索システム /データ前処理 VLM RAG (10月予定) Graph RAG (11月予 (9月予定) 定) 9回目 運用 MLOpsを組み込んだ実 用的なRAGシステム (12月予定)

34.

9 回 +1 シリーズ:RAG の基礎から実践まで 第一部 基礎編:RAGの仕組みを理解して改善し続けよう 1回目 作る 7/21(火) 予定 4回目 3回目 2回目 選択 改善する 測る タスクに応じた 動いて中身も見える RAGアプリ chunk & prompt 戦略 /選択 / API 利 generator Advanced RAG ・Gradioで体験 ( ・当たりチャンク探索 ・改善の再現性 導 入Ragas × ・Faithfulness / Relevance ・検索と生成を分解 LangSmith ・ログ run_id)保存 ・Retriever / Prompt / LLM ・悪い例を追跡 ソリュー ション用 ・Embedding選択 ・chunk_size / overlap ・API利用 ・モデルサイズ選択 5回目 自律化 LangGraph / Agentic RAG技術紹介 ・検索 / 推論 / 生成 ・ループで精度改善 ・運用に近い形へ 第二部 実践編:現場で扱うための拡張と運用 GPU 効率利用 LLM 量子化 7回目 6回目 評価と基盤固め 評価法/検索システム/データ前処理 ソ リューション(9月予定) (8月予定) 目をもつ 8回目 関係を知る VLM RAG技術紹介(Graph 11月予定) RAG (10月予 定) 9回目 運用 MLOpsを組み込んだ実 実運用 用的な RAG システム (12月予定)

35.

APPENDIX

36.

RAGでFine Tuning (FT) が効くのは「どこが壊れているか」で決まる generator FT と embedding FT は役割が違う。まず retrieval 側か generation 側かを切り分ける。 最初に見ること:失敗原因の切り分け Embedding FT Generator FT 「正しい材料を取ってくる力」を上げる 「取ってきた材料の読み方・出し方」を整える 効きやすいケース 効きやすいケース 専門用語・略語・社内語・型番・法令番号などで、汎用 embedding が意味的に近い文書を拾えない 厳密フォーマット、長文要約、no-answer、ノイズ文書、複合推論 などで回答が不安定 好事例:金融・法務・医療・建設・コード文書など、検索漏れが 主ボトルネックの専門 DB 好事例:契約書要約、構造化出力、distractor耐性、多段 QAなど、 context活用が主ボトルネックの業務 retrieval miss context活用の失敗 まず試す代替:chunking / hybrid / reranker まず試す代替:prompt / few-shot / 上位モデル 最新知識の注入目的なら FTよりRAG / tool。専門検索の失敗は Embedding、読み方・形式の失敗は Generatorを疑う。

37.

Embeddingモデルの FTユースケース(情報提供版) 目的:retrieval miss を減らし、「正しい材料を取ってくる力」を上げ る 判断基準:Recall@k / nDCG / 検索上位の根拠文書を見て、汎用embeddingが専門語・略語・型番・法令番号・コード識別子を拾えていないなら検討する 効きやすいケース 金融・法務・医療・建設・コード文書など、語彙・表記・略語が一般 文書とずれる専門DB。 query と正解文書の語が一致しにくい、または「意味的に近いが別物」 の hard negative が多い。 FAQよりも、社内規程・契約書・仕様書・技術文書など、検索漏れが 回答失敗の主因になっている場合。 最新知識をモデルに覚え込ませたい場合ではなく、検索空間の意味 対応をドメインに寄せたい場合。 データ設計・実装の要点 理想は query-positive-hard negative の三点セット。少数ラベルか ら始め、 LLM合成queryで補う。 SentenceTransformersのTSDAE/GPLのように、ラベルなしコー パスからdomain adaptationを始める選択肢もある。 学習後は corpus vector の再生成が必要。index更新・評価漏洩・ バージョン管理が運用上の注意点。 まず chunking / hybrid search / reranker / metadata filter を試 し、それでも retrieval が主ボトルネックならFTへ進む。 代替・注意点 強いbase embeddingで十分な場合、 FTの改善余地は小さい。 DatabricksのDocsQAでは改善が限定的。 検索指標が改善しても、回答品質に転写されるとは限らない。 end-to-end評価と必ず分けて見る。 Embedding FTはAPIベンダー差が大きい。OSS/self-hostまたは専 用embeddingベンダー経由が現実的。 最新・頻繁更新知識はFTよりRAG / DB / web tool / cache。知識注 入目的のFTを第一選択にしない。 代表的な根拠・数値 Databricks FinanceBench: gte-large-en-v1.5 Recall@10 0.293→0.552、e5-mistral-7b-instruct 0.479→0.670。ManufactQAでも改善。 [D1] SentenceTransformers TSDAE / GPL による domain adaptation で最大8〜10ポイント級の改善。ラベルなし/弱ラベルから始めやすい。 [D2] FinMTEB / 日本語専門事例 汎用embeddingの強さはドメイン内性能を保証しない。建設ドメイン事例ではドメイン特化モデルがTop-5精度80%。 [D3][D4] 意思決定 検索ミスは embedding FT、読み方の失敗は generator FT。両方まとめて始めず、まず失敗箇所を計測で切り分ける。 結論:専門検索の取りこぼしを減らすなら Embedding FT。ただし、検索改善が回答改善に転写されるかは別問題なので、 retrieval metrics と end-to-end metrics を分けて評価する。 出典:[D1] Databricks, “Improving Retrieval and RAG with Embedding Model Finetuning” / [D2] SentenceTransformers Domain Adaptation / [D3] FinMTEB / [D4] AKARI construction-domain example

38.

GeneratorのFTユースケース(情報提供版) 目的:retrieved context の読み方・出し方・no-answer・distractor耐性を整える 判断基準:retrieval は十分なのに、回答形式が崩れる/contextを読み違える/ノイズ文書に引っ張られる/複合推論で片落ちするなら検討する 効きやすいケース データ設計・実装の要点 no-answer / abstention:根拠がない時に無理に答えない、過剰拒 RbFT型:retrieval defectを含む訓練で、怪しい文書検出と有用情報 複合推論・多段QA:retrieved context上で複数根拠を統合し、 distractorに負けないようにする。 まず prompt / few-shot / structured outputs / function calling / 上 位モデルを試し、それでも不安定ならFTへ進む。 厳密フォーマット:JSON / XML / DSL / 関数引数 / 分類ラベル など、後段処理に使う出力を安定化したい。 長文要約・契約書要約:観点・構造・粒度を揃え、抜け漏れを減らしたい。 否しない振る舞いを整える。 単なるQ&Aではなく、 retrieved background + 理想回答 + no-answer例 + distractor例を含める。 RAFT型:正解文書とdistractorを混ぜ、どの文書を使い、どれを無視 するかを学習させる。 抽出を鍛える。 代替・注意点 最新知識を覚え込ませる用途には不向き。知識更新はretrieval / tool calling / DB連携が主軸。 FTのgainが小さい場合もある。OpenAI 高性能APIモデルでは、 Cookbookにも新モデルではgain最小の注記あり。 仕様変更時の再学習、format overfit、過剰拒否、評価困難性がリスク。 canary deployと監視が必要。 現在のRAGでは「知識を持つ」より「渡されたcontextを正しく読む」 能力がgenerator選択の中心。 代表的な根拠・数値 RAFT retrieved documentsを見せ、distractor込みで引用しながら答えるgeneratorを訓練。HotpotQA / HuggingFace APIBenchで単純RAGやdomain FTを上回る。 [G1] RA-DIT retriever と generator を別々に instruction tuning。0-shot平均で最大 +8.9%、Natural Questionsで +22% 改善。 [G2] RbFT retrieval defect耐性を改善。Hard+Mix F1 17.1→40.9、推論時間はVanilla RAGとほぼ同等。 [G3] OpenAI / Anthropic OpenAIはSFTを分類・翻訳・特定フォーマット・instruction-following修正に整理。Anthropicは法務要約でprompt→meta-summarization→FTを提案。 結論: Generator FTは「知識注入」より、context活用・出力形式・ no-answer・distractor耐性を安定させるために使う。第 4回本編では FTよりgenerator選択を主役にする。 出典:[G1] RAFT paper / [G2] RA-DIT paper / [G3] RbFT paper / [G4] OpenAI model optimization / FT best practices / [G5] Anthropic legal summarization guide [G4][G5]

39.

出典・参考情報(公開 URL) ※ DeepResearch report ではなく、ユーザー自身が確認できる公開情報ソースのみを列挙 Embedding FT / retrieval 側の根拠 Generator FT / API・実装側の根拠 ・RAG原論文: https://arxiv.org/abs/2005.11401 ・知識注入比較 : https://aclanthology.org/2024.emnlp-main.15.pdf ・ Databricks embedding FT: https://www.databricks.com/jp/blog/improving-retrieval-and-rag-embedding -model-finetuning ・ SentenceTransformers domain adaptation: https://sbert.net/examples/sentence_transformer/domain_adaptation/READ ME.html ・ FinMTEB / domain-specific embedding: https://arxiv.org/html/2501.18365v1 ・ AKARI 建設ドメイン RAG: https://tech.akariinc.co.jp/entry/2025/04/24/190000 ・Qwen3 / embedding関連情報: https://qwenlm.github.io/blog/qwen3/ ・ OpenAI model optimization: https://developers.openai.com/api/docs/guides/model-optimization ・ OpenAI fine-tuning best practices: https://developers.openai.com/api/docs/guides/fine-tuning-best-practices ・OpenAI retrieval: https://developers.openai.com/api/docs/guides/retrieval ・ OpenAI RAG + FT cookbook: https://developers.openai.com/cookbook/examples/fine-tuned_qa/ft_retrieval_augment ed_generation_qdrant ・ Anthropic legal summarization: https://docs.anthropic.com/en/docs/about-claude/use-case-guides/legal-summarization ・ Anthropic embeddings / Voyage案内: https://docs.anthropic.com/en/docs/build-with-claude/embeddings RAG向け generator FT / both FT の研究・実務事例 ・RAFT: https://ar5iv.org/pdf/2403.10131 ・RA-DIT: https://ar5iv.org/pdf/2310.01352 ・RbFT: https://arxiv.org/html/2501.18365v1 ・PFN 日本医師国家試験・知識注入 /RAG: https://tech.preferred.jp/ja/blog/llm_knowledge_injection/ ・OpenAI reasoning best practices: https://developers.openai.com/api/docs/guides/reasoning-best-practices 出典は公開 URLで追えるものに限定。FT判断は「検索が壊れているか/読み方が壊れているか」を分けて確認する。 4

40.

RAGの仕組みを理解して改善し続けよう 〜 LangChain Family × GradioによるRAGアプリ開発 〜 第1回:動いて中身も見える RAGを作って触ろう 〜 LangChainで基本RAGアプリ開発 〜 第2回: RAGを測るモノサシを作ろう 〜 Ragas × LangSmithでRAG評価アプリ開発 〜 第3回: RAGを最適化しよう 〜 チャンクとプロンプトの戦略+アドバンス RAGアプリ開発 〜 第4回: RAGの頭脳を選択しよう(改訂版) 〜 タスクに応じ LLM / Embedding 選択 〜 第5回:進化系 RAGに挑戦 〜 LangGraphでAgentic RAG開発 〜