AI研究
AIメモリガバナンスの枠組み:何を記憶し、いつ忘れ、どう個人情報保護を守るか
記憶を持つAIは使うほど賢くなりますが、ガバナンスのない記憶は使うほど企業を露出させます。本稿は個人情報保護法、GDPR、EU AI法の実際の条文を用い、実装可能なAIメモリガバナンスの枠組み——情報の階層化、保持と忘却、PIIコンプライアンス、アクセス制御と監査——を示します。
従来ソフトウェアのSLAは明快です。可用性99.9%、応答は何ミリ秒、達成の可否は二元的です。しかしAIシステムの「正しさ」は白黒ではなく、連続したスペクトラムです。同じ質問でも、モデルは正しく答えることも、曖昧に答えることも、自信たっぷりに間違えることもあります。2026年に37のモデルを横断した第三者の評価集計では、幻覚率は15%〜52%に分布し、タスクの形状と強く相関しました。根拠から抽出する閉じたQAが最も低く、オープンな生成は明らかに高く、ツールを連続的に呼び出すAgentワークフローが最も誤りやすいのです。つまり「AIが稼働し応答している」ことは「出力が信頼できる」ことと同義ではありません。そして出力の信頼性は、法的には企業自身が負います。2024年カナダのMoffatt対Air Canada訴訟では、ブリティッシュコロンビア州の民事裁定機関(Civil Resolution Tribunal)が、公式サイトのチャットボットが忌引運賃(bereavement fare)の遡及申請の規定を誤って伝えたと認定し、責任は「AI自身」ではなく航空会社にあるとして賠償を命じ、企業がAIの出力に責任を負うという先例を確立しました。ですからAIのSLAには「品質」と「可用性」を必ず一緒に書き込む必要があります。
AIのSLAを二本の線に分けて定めると、はじめて管理できます。可用性は成熟したSREの慣行を踏襲しますが、正しい指標を使う必要があります。ストリーミング体験では、最初のtokenまでの遅延(TTFT)とtoken間隔(ITL)を見ます。2026年の本番レベルの参照基準はTTFT p95 < 500ms、ITL p95 < 250msで、しかも平均ではなくp95を見るべきです。実測では30組のモデル×プロバイダーの組み合わせで、p95対p50の比が平均2.1倍、最悪で3.2倍に達し、平均だけでは不運な5%を大きく過小評価します。品質は別途定義が必要です。タスク完了率、事実整合性(faithfulness/groundedness)に加え、安価で有用な三つの先行指標——高評価率、リトライ率(何度も再生成する)、拒否回答率です。この三つが悪化すると、たいてい品質問題はすでに進行中です。
| 次元 | 指標 | 本番レベルの参照基準 | 測定方法 |
|---|---|---|---|
| 可用性 | 稼働時間 | ≥ 99.5% | ヘルスチェック/uptime監視 |
| 可用性 | TTFT p95 / ITL p95 | < 500ms / < 250ms | ストリーミング遅延監視 |
| 品質 | faithfulness(事実整合性) | ≥ 0.9(支持されたclaimの比率) | RAGAS/DeepEval LLM-as-judge |
| 品質 | 幻覚率 | 抽出型 < 8%、生成型 < 20% | 評価セット+本番サンプリング |
| 体験 | リトライ率/拒否回答率 | 基準値を定めて傾向を見る | プロダクト計測 |
基準は丸写しするものではなく、シーンに合わせて較正します。社内ナレッジQAは厳しく、創作的な生成は緩めます。肝心なのは、各セルが「なんとなく良い」ではなく測定可能な数値を持つことです。
品質は感覚に頼れず、再実行できる評価が必要です。2026年の主流である三つのオープンソースフレームワークは、それぞれ立ち位置が異なります。RAGASはRAGに特化し、四つの指標は正解ラベルを必要とせず、Pythonのセットアップも軽量です。DeepEvalは指標ライブラリが最も充実し、Pytest経由でCI/CDに組み込め、「品質が退行していない」ことをリリース前の自動ゲートに変えます。TruLensはRAGトライアド(groundedness、answer relevance、context relevance)を提唱し、OpenTelemetryと統合して監視に接続しやすくしています。三者の核心はいずれもfaithfulness/groundednessで、モデル出力を一つひとつのclaimに分解し、「検索された内容にどれだけの割合が支持されているか」を算出します。これこそRAGの幻覚を捉える中心的な仕組みです。ただし一つの落とし穴に注意してください。土台となるナレッジベース自体が古い、あるいは自己矛盾している場合、faithfulnessスコアは高くても答えは依然として誤りうるため、評価はナレッジベースの鮮度も併せて管理しなければなりません。
SLAは検収時に一度測って終わりではありません。AIはドリフト(drift)します。モデルやデータの分布が徐々に変わり、出力が体系的に変化し、悪い方向に動けばそれが劣化です。2026年の実務はこうです。安価な蒸留評価器を本番の全量で継続的に走らせ、確信度の低い判定だけを人へエスカレーションし、定期的な人手のサンプリングで評価器を較正し、評価をruntimeに直接ガードレールとして組み込みます。監視層はLLMのオブザーバビリティ基盤——LangSmith、Arize Phoenix(評価指標とembeddingドリフト検知を内蔵)、Langfuseといったツールに任せます。これらはインフラ監視では見えない幻覚ドリフト、検索失敗、promptの退行を捉えるために作られています。最後は降格戦略です。品質指標が基準を下回ったら、システムは低品質な出力を出し続けるのではなく、自動で降格し、バックアップモデルに切り替え、あるいは人へ引き継げなければなりません。研究では、出力側に事実単位の照合と修正(FactSelfCheckなど)を加えると、未照合時に比べて出力中の事実的な内容が約35%向上すると報告されています。
SLAを明確に定めることは、エンジニアの潔癖ではなく止血です。RANDの2024年の研究は、一部の推計では8割超のAIプロジェクトが失敗に終わり、これはAIを含まないITプロジェクトの失敗率の2倍だと指摘しています。Gartnerは2026年4月の調査で、インフラ・運用領域のAIユースケースは五つに一つが完全に失敗し、投資回収の期待を完全に満たすのは28%にとどまると指摘しました。これらの失敗に共通する病根の一つが、「成功の定義が最初から曖昧」であることです。測定可能な基準がなければ、システムが本当にリリースできるのか、リリース後も健全なのかを、誰も言えません。明確に書かれたAI SLAこそ、その曖昧さを数値に変えるものです。
以上のデータが示すように、AIの安定性は「システムが落ちないか」と「出力が信頼できるか」という二つを同時に意味し、その両方が測定・監視され、降格を発動できて初めてSLAは意味を持ちます。恩梯科技のAIシステム顧問サービスは、お客様の業務シーンに合わせて可用性と品質の基準を検収可能なSLAに落とし込み、RAGASやDeepEvalといった評価フレームワークとオブザーバビリティ基盤を導入し、リリース後の継続監視と降格の仕組みを構築します。それによりお客様のAIは単に動くだけでなく、いま本当に健全かどうかを客観的な基準で語れるようになり、リリース後に耐えられないと気づいて作り直す事態を避けられます。
これらの手法を自社に導入したいですか?
LINEで無料相談サポートが必要ですか?
ここをクリックしてお問い合わせください!