本書で用いる主要な用語を、初出章とともにまとめる。表記は本書全体で統一されている。
| 用語 |
英語 |
定義 |
初出 |
| AIエージェント |
AI Agent |
目標を与えられると、環境を観測し、次の行動を自ら決定し、ツールを通じて働きかけ、結果を観測して次を決める、というループを目標達成まで繰り返すシステム |
4.2.1 |
| ワークフロー |
Workflow |
LLMとツールを、あらかじめ定義されたコードパスに沿って組み合わせたもの。制御は開発者側にある |
4.3.1 |
| 拡張されたLLM |
Augmented LLM |
検索・ツール・メモリを備えたLLM。エージェントの最小構成単位 |
4.2.3 |
| エージェントループ |
Agent Loop |
知覚 → 推論と計画 → 行動 → 観察の4段階の繰り返し |
5.2 |
| サブエージェント |
Subagent |
親エージェントから1つのツールとして呼ばれる、独立したコンテキストを持つエージェントループ |
9.2.5 |
| マルチエージェント |
Multi-agent |
複数のエージェントが協調して動く構成の総称 |
9.2.5 |
| ツール |
Tool / Function / Action |
LLMが呼び出せる外部機能。モデルは「呼びたい」と宣言するだけで、実行はアプリケーション側が行う |
4.4.1 |
| ポカヨケ |
Poka-yoke |
そもそも間違えられない引数設計にする、という設計思想 |
4.4.5 |
| 用語 |
英語 |
定義 |
初出 |
| トークン |
Token |
LLMがテキストを扱う単位。日本語は英語の2〜3倍を消費する |
2.2.2 |
| コンテキストウィンドウ |
Context Window |
一度に処理できる入力と出力の合計トークン数の上限 |
2.2.2 |
| プロンプトキャッシュ |
Prompt Caching |
毎ターン変わらない前半部分をサーバー側に保持し、割引レートで再利用する仕組み |
2.2.2 |
| Temperature |
— |
確率分布の尖り具合を調整するパラメータ。ツール呼び出しでは 0 が基本 |
2.3.1 |
| Top-p |
Nucleus Sampling |
累積確率で候補範囲を切る方式。Temperature と同時に動かさない |
2.3.2 |
| 推論モデル |
Reasoning Model |
最終回答の前に内部で思考過程を生成するモデル |
3.3.1 |
| adaptive thinking |
— |
思考の有無と深さをモデル自身が判断する既定の動作 |
3.3.1 |
| effort |
— |
思考の深さと頻度を制御するパラメータ。既定値は high、output_config にネストする |
3.3.2 |
| オープンウェイトモデル |
Open Weight Model |
重みがダウンロード可能なモデル。オープンソースとは別概念 |
2.5.1 |
| 用語 |
英語 |
定義 |
初出 |
| 埋め込み |
Embedding |
テキストを固定長の数値ベクトルに変換したもの |
3.5.1 |
| RAG |
Retrieval-Augmented Generation |
回答前に外部知識源から関連情報を検索し、コンテキストに含める手法 |
3.6.1 |
| エージェント型RAG |
Agentic RAG |
検索をツールとして与え、いつ・何回検索するかをモデルに委ねる方式 |
3.6.4 |
| チャンク分割 |
Chunking |
文書を検索単位に切り分ける工程。300〜800トークンが目安 |
3.6.2 |
| ハイブリッド検索 |
Hybrid Search |
ベクトル検索とキーワード検索を組み合わせ、スコアを統合する方式 |
3.5.4 |
| 短期記憶 |
Short Term Memory |
コンテキスト内に保持され、セッション終了で消える記憶 |
8.2.1 |
| 長期記憶 |
Long Term Memory |
外部ストレージに保持され、セッションをまたいで残る記憶 |
8.2.1 |
| エピソード記憶 |
Episodic Memory |
出来事の記録。特定の時点に紐づく |
8.5.1 |
| 意味記憶 |
Semantic Memory |
知識の抽象。時点に依存しない |
8.5.1 |
| context editing |
— |
古いツール結果をサーバー側で自動削除する機能 |
8.3.3 |
| compaction |
— |
履歴を要約に置き換えるサーバー側の機能 |
8.3.4 |
| 時間減衰 |
Time Decay |
想起スコアに時間の要素を掛け、古い記憶を想起されにくくする手法 |
8.7.2 |
| 用語 |
英語 |
定義 |
初出 |
| ReAct |
Reason + Act |
推論と行動を交互に繰り返す最も基本的な構成 |
9.2.1 |
| Planner-Executor |
— |
先に全体の計画を立て、それから実行する構成 |
9.2.3 |
| DAGエージェント |
— |
タスクを依存グラフとして表現し、依存が解決したノードから並列実行する構成 |
9.2.4 |
| CoT |
Chain-of-Thought |
最終回答の前に推論過程を明示的に生成させる技法 |
9.3.1 |
| ToT |
Tree-of-Thought |
複数の可能性を並行展開し、評価して有望な枝を伸ばす技法。標準比10〜100倍のトークンを消費 |
9.4.1 |
| MCP |
Model Context Protocol |
AIアプリケーションと外部システムを繋ぐ標準規格。M×N 問題を M+N に変える |
9.5.1 |
| MCPホスト / クライアント / サーバー |
— |
ホスト=AIアプリ本体、クライアント=接続1本につき1つ、サーバー=機能提供側(実行場所は問わない) |
9.5.2 |
| 用語 |
英語 |
定義 |
初出 |
| ツール呼び出し |
Tool Use / Function Calling |
モデルが「どのツールをどの引数で呼ぶか」を構造化データとして出力すること |
4.4.2 |
| 冪等性 |
Idempotency |
同じ操作を複数回実行しても結果が変わらない性質。副作用のあるツールで必要 |
1.4.2 |
| 停滞 |
Stall |
同じツールを同じ引数で繰り返し呼ぶなど、進展のない状態 |
5.4.2 |
| 誤りの累積 |
Compounding Errors |
序盤の小さな誤りが後続に伝播し、増幅すること |
5.4.4 |
| システム介入メッセージ |
— |
停滞検知や予算警告を、実行時に動的にコンテキストへ注入するプロンプト |
5.4.2 |
| Human-in-the-Loop |
HITL |
取り返しのつかない操作の前に人間の承認を挟む設計 |
4.3.3 |
| 耐久実行 |
Durable Execution |
途中で落ちても中断地点から再開できる仕組み |
10.4.1 |
| 用語 |
英語 |
定義 |
初出 |
| タスク完遂率 |
Task Completion Rate |
目標が達成された割合。エージェント評価の中心指標 |
11.3.1 |
| ツール正確性 |
Tool Correctness |
適切なツールを選んだかどうか。決定的に測れる |
11.3.1 |
| 軌跡評価 |
Trajectory Evaluation |
計画・ツール選択・中間ステップという経路を評価すること |
11.2.2 |
| LLM-as-a-Judge |
— |
LLMに出力を採点・分類・比較させる評価手法 |
11.7.1 |
| 回帰テストセット |
— |
過去に直した失敗が再発しないことを確認するデータセット。最も費用対効果が高い |
11.4.2 |
| トレース / スパン |
Trace / Span |
トレース=1回の実行全体、スパン=個々の処理単位。共通の trace_id で紐づく |
12.2.1 |
| GenAI セマンティック規約 |
— |
OpenTelemetry における LLM・エージェント向けの属性名の取り決め。2026年7月時点で Development ステータス |
12.4.1 |
| ドリフト |
Drift |
モデル更新やデータ分布の変化による、じわじわした品質低下 |
12.5.3 |
| 用語 |
英語 |
定義 |
初出 |
| プロンプトインジェクション |
Prompt Injection |
プロンプトに悪意ある指示を注入し、モデルの挙動を乗っ取る攻撃 |
13.3.1 |
| 間接プロンプトインジェクション |
Indirect Prompt Injection |
第三者が、ツールが取得するデータ経由で攻撃する形態。エージェントでは最も深刻 |
13.3.1 |
| ジェイルブレイク |
Jailbreak |
利用者自身が直接入力で制約を回避しようとする攻撃 |
13.3.1 |
| OWASP Top 10 for Agentic Applications |
ASI01〜ASI10 |
エージェント固有の脅威の分類。従来のLLM Top 10と補完関係にある |
13.2.1 |
| 最小権限の原則 |
Least Privilege |
エージェントに与える権限をタスク遂行に必要な最小限にすること |
13.5.1 |
| パストラバーサル |
Path Traversal |
../ などで想定範囲外のファイルにアクセスする攻撃。resolve() 後に検査する |
7.6.6 |
| サンドボックス |
Sandbox |
コード実行などを隔離された環境に閉じ込めること |
7.6.2 |
| レッドチームテスト |
Red Teaming |
攻撃者の視点で意図的に攻撃を試み、防御を検証する作業 |
13.7.1 |
| fail closed |
— |
検査が失敗したときに、通すのではなく止める側に倒す設計 |
13.3.2 |
| PII |
Personally Identifiable Information |
個人を特定しうる情報。記録・送信の前にマスキングを検討する |
13.4 |
本書では以下の表記に統一している。
- ツール呼び出し — 「関数呼び出し」「ツールコール」は使わない(Anthropic以外のAPIを指す場合のみ「Function Calling」を用いる)
- タスク完遂率 — 「タスク成功率」は使わない
- マルチエージェント — 「多エージェント」「複数エージェント」は使わない
- リレーショナルDB — 表や図の制約で短縮する場合のみ「RDB」
- 可観測性 — 「オブザーバビリティ」は使わない
[システム] — システム介入メッセージの接頭辞
- 技術用語は初出時に「日本語(English)」で併記し、以降は読みやすい方を使う
本書のコード例では、可読性のためエイリアス(claude-sonnet-5、claude-opus-5、claude-haiku-4-5)を用いている。本番ではスナップショットID(claude-haiku-4-5-20251001 のように日付が付くもの)に置き換えること(第2章2.6節)。