LLM評価・モニタリングの実践 — 3層設計とゴールデンデータセットの作り方

LLM評価・モニタリングの実践 — 3層設計とゴールデンデータセットの作り方
画像: Generated by OpenAI via Codex

LLMを本番運用するときは、精度・幻覚率・遅延・コストの4指標を継続で見える化する必要がある。指標を並べるだけでは品質低下を判断できず、変更のたびに合否が揺れる。

この記事では、オフライン評価・オンライン評価・人手レビューの3層設計を整理する。ゴールデンデータセットとLLM-as-a-judgeの使い分けも扱う。運用開始時に決める合格基準と、月次で追うべき指標を判断できる。

この記事でわかること

この記事でわかることの図解

  • LLM評価とモニタリングの違いと役割
  • 3層(オフライン評価・オンライン評価・人手レビュー)の組み方
  • ゴールデンデータセットの作り方と更新運用
  • LLM-as-a-judgeを使ってよい場面と避ける場面
  • 導入前に決める合格基準と運用体制

結論サマリー

読者の課題ごとに、最初に見る指標と次の行動を整理した。運用整備の順序を決める起点として使う。

読者の課題 最初に見る指標 確認すること 次の行動
回答品質が安定しない 正答率、幻覚率、修正率 失敗ログと合格例の有無 ゴールデンデータセット作成
API費用が読めない 1リクエスト単価、トークン数 モデル選択とプロンプト長 ルーティングとキャッシュ導入
体感が悪化した P95応答時間、失敗率 変更履歴と監視アラート 変更前後の指標比較
ガバナンス上不安 監査ログ、入力データ種別 保存範囲と権限管理 ログ保管方針と統制整備

LLM評価とモニタリングの基本

LLM評価は「新しいプロンプトやモデルが業務要件を満たすか」を判断する行為である。モニタリングは「本番で品質・コスト・遅延が想定内に収まっているか」を継続確認する行為である。

LLM評価とモニタリングの基本の図解

両者は目的が異なる。評価は変更判断、モニタリングは日次・週次の傾向監視で使い分ける。

用語は次のとおり整理する。本文前半では専門語を連続させない。

用語 意味
LLMOps LLMを業務で継続利用するための運用管理
ゴールデンデータセット 正解や合格例をまとめた評価用データ
LLM-as-a-judge 別のLLMで回答の合否を判定する自動評価
幻覚率 事実と異なる回答を返す割合
修正率 後工程やユーザーが回答を修正した割合

なぜ今この論点が重要か

LLMアプリの本番導入が広がるほど、品質と費用の変動を同時に管理する必要が高まる。評価と監視が整っていないと、モデル差し替えやプロンプト改訂で合否判断ができなくなる。

特に問題になりやすいのは次の3点である。

  • モデル提供元がバージョンを差し替えても気づかない
  • プロンプト改訂で幻覚率が上がっても検知できない
  • 月次のAPI費用が上振れした要因を切り分けられない

これらは、いずれも合格基準と指標の記録がないことに起因する。

3層で組む評価と監視

評価と監視は、オフライン評価・オンライン評価・人手レビューの3層で組む。1つに寄せると判断が偏る。

3層で組む評価と監視の図解

3層は次のように補い合う。

方式 一言でいうと 向くケース 注意点
オフライン評価 事前用意した正解データで採点 プロンプト改訂・モデル切替の判断 データが古いと本番と乖離する
オンライン評価 本番トラフィックの指標監視 継続監視・SLO維持 正解データがなく間接指標中心
人手レビュー 担当者が回答を実際に確認 高リスク業務・自動評価の校正 コストが高く頻度設計が必要

ゴールデンデータセットの作り方

ゴールデンデータセットは、業務で正解が明確な入出力ペアを集めて作る。最初は30〜100件でよい。

守ること:

  • 本番プロンプトと同じ形式でそろえる
  • 期待出力は「必須項目」「許容表現」「禁止表現」で分ける
  • 業務変更や新機能追加のたびに追加・見直す

件数を増やすより、期待出力の粒度をそろえるほうが評価の再現性は上がる。

LLM-as-a-judgeを使ってよい場面

LLM-as-a-judgeは、大量回答を一次評価するときに使う。全件を人手で見る余力がない場合の効率化手段である。

避けるべき条件:

  • 判定基準が業務ドメイン固有で、モデルに前提が伝わりにくい
  • 医療・法務・金融など、誤判定コストが高い領域
  • 判定精度そのものを検証していない

判定用プロンプトは、必ず人手評価と突合し、判定LLM自身の精度を測る。

実装・運用で見る指標

本番で見る指標は、品質・コスト・遅延・安全の4カテゴリに分ける。すべてを毎日見る必要はない。

比較軸 確認すること 実務上の意味
品質 正答率、幻覚率、修正率 業務要件に合っているか
コスト 1リクエスト単価、キャッシュ率 月次費用の変動要因
遅延 P50・P95応答時間、失敗率 体感速度とタイムアウト設計
安全 プロンプト逸脱、監査ログ ガバナンスと事故対応

導入前チェックリスト

評価と監視の整備前に、次を決めておく。

  • ゴールデンデータセットの担当者と初期件数
  • 品質・コスト・遅延の合格基準と警告基準
  • モデルとプロンプトの変更承認フロー
  • 本番ログの保存期間と権限
  • 監査ログを誰がどの頻度で確認するか
  • ユーザー苦情や修正要求を集める窓口

運用開始後に見る指標

運用開始後は、頻度を分けて定点観測する。

  • 週次: 幻覚率、修正率、失敗率、平均コスト
  • 月次: モデル別コスト、キャッシュ率、遅延分布
  • 変更時: ゴールデンデータの再評価、A/B結果

採用しないほうがよい条件

以下の状況では、評価基盤や監視ツールの導入を先に急がないほうがよい。

採用しないほうがよい条件の図解

  • 業務要件と合格基準が未定義
  • 対象業務のリクエスト数が少なく、傾向が見えにくい
  • 人手レビュー担当者を確保できない
  • ログ保存とデータ利用ポリシーが未整備

これらは、まず運用体制と業務要件の整理を先に進めるほうが、後戻りが少ない。

リスクと限界

LLM評価は本番品質を保証する仕組みではない。過信を避けるため、次のリスクを踏まえる。

  • ゴールデンデータセットが本番と乖離すると、評価が空回りする
  • LLM-as-a-judgeは判定LLM自身の偏りを持ち込む
  • 監視ツールの導入だけでは品質は上がらない
  • ログ保管はプライバシー・機密情報の扱いと直結する

※LLM関連サービスの料金、データ保持条件、提供機能は変更される場合があります。導入前に公式情報で最新条件を確認してください。

Blackfordの見解

Blackford Technologiesは、LLM・AIエージェント開発支援の一環として、LLM評価・モニタリングの整備を「ツール選定」ではなく業務要件と運用責任の設計から始める方針で支援する。

Blackfordの見解の図解

具体的には次の視点で整理する。

  • 対象業務の合格基準を業務側と合意する
  • ゴールデンデータセットの初期件数と更新頻度を決める
  • 本番ログの保存範囲・権限・監査要件を先に決める
  • 監視ダッシュボードは「見る人」を先に決めてから設計する
  • モデル・プロンプト変更の承認フローと責任者を明確化する

社内データやRAG基盤の運用と一体で評価データを整えたい場合は、DataRoidやDataRoid Cloudと組み合わせて設計できる。営業・顧客対応でのLLM運用は、SalesRoidと評価データを連動させると、修正率の傾向を業務改善につなげやすい。

関連コラムとして、コスト設計とプロンプト運用はLLMのプロンプト管理とコスト最適化を参照できる。事故対応の観点ではLLMインシデント対応プレイブックも参考になる。

よくある質問

Q1. LLM評価とモニタリングは何が違いますか?

評価は変更前後で品質を比較する行為、モニタリングは本番運用中の品質・コスト・遅延を継続確認する行為です。評価は不定期、モニタリングは日次〜週次で回します。両者を組み合わせて使います。

Q2. LLM評価では最初に何を見ればよいですか?

正答率、幻覚率、修正率、遅延、1リクエスト単価の5つに絞ります。業務によっては、指示遵守率やツール呼び出し成功率を追加します。指標を増やしすぎると、判断が遅くなります。

Q3. ゴールデンデータセットは何件から作れば足りますか?

最初は30〜100件で始めます。業務ドメインが広い場合は、機能単位で30件ずつ整えます。本番ログから失敗例と重要事例を追加し、四半期ごとに見直します。件数を増やすより粒度をそろえるほうが重要です。

Q4. 中小企業でもLLMモニタリングは必要ですか?

リクエスト数が少なくても、幻覚率と修正率の記録は必要です。スプレッドシートで週次に手集計する形でも始められます。事故対応と改善のため、最低限のログと合格基準は運用開始時から用意します。

Q5. LLM-as-a-judgeはどこまで信頼できますか?

判定LLM自身の精度を人手レビューで検証していない場合、そのままでは信頼できません。まず判定LLMの合格率を人手結果と突合し、乖離傾向を把握します。高リスク業務では必ず人手レビューを併用します。

まとめ

LLMを本番で使うときは、評価とモニタリングを分けて設計する。オフライン評価・オンライン評価・人手レビューの3層をつなぐと、変更判断と継続監視の両方が回りやすい。

ただし、ツール選定より先に、合格基準・ゴールデンデータ・ログ運用の合意が必要である。運用体制を伴わない評価基盤は形骸化しやすい。

社内でLLM評価・モニタリング設計を組み込みたい場合は、業務要件と既存データを整理したうえで、専門家への相談を推奨する。

\LLM評価・監視の運用設計を相談できます/
Blackfordに相談する

White Paper

2026年度版: AI・DX補助金徹底活用ガイド

AI導入の投資判断、対象業務の整理、補助金活用時の確認ポイントをまとめたPDF資料を用意しています。

相談する資料請求