AIシステムの安定性をどう評価するか:品質と可用性を両立するSLAフレームワーク

AI研究
Author
恩梯科技
2026-07-28 250 回閲覧 6 分鐘閱讀

AIのSLAが従来ソフトを流用できない理由

従来ソフトウェアのSLAは明快です。可用性99.9%、応答は何ミリ秒、達成の可否は二元的です。しかしAIシステムの「正しさ」は白黒ではなく、連続したスペクトラムです。同じ質問でも、モデルは正しく答えることも、曖昧に答えることも、自信たっぷりに間違えることもあります。2026年に37のモデルを横断した第三者の評価集計では、幻覚率は15%〜52%に分布し、タスクの形状と強く相関しました。根拠から抽出する閉じたQAが最も低く、オープンな生成は明らかに高く、ツールを連続的に呼び出すAgentワークフローが最も誤りやすいのです。つまり「AIが稼働し応答している」ことは「出力が信頼できる」ことと同義ではありません。そして出力の信頼性は、法的には企業自身が負います。2024年カナダのMoffatt対Air Canada訴訟では、ブリティッシュコロンビア州の民事裁定機関(Civil Resolution Tribunal)が、公式サイトのチャットボットが忌引運賃(bereavement fare)の遡及申請の規定を誤って伝えたと認定し、責任は「AI自身」ではなく航空会社にあるとして賠償を命じ、企業がAIの出力に責任を負うという先例を確立しました。ですからAIのSLAには「品質」と「可用性」を必ず一緒に書き込む必要があります。

二つの次元:可用性SLOと品質SLO

AIのSLAを二本の線に分けて定めると、はじめて管理できます。可用性は成熟したSREの慣行を踏襲しますが、正しい指標を使う必要があります。ストリーミング体験では、最初のtokenまでの遅延(TTFT)とtoken間隔(ITL)を見ます。2026年の本番レベルの参照基準はTTFT p95 < 500ms、ITL p95 < 250msで、しかも平均ではなくp95を見るべきです。実測では30組のモデル×プロバイダーの組み合わせで、p95対p50の比が平均2.1倍、最悪で3.2倍に達し、平均だけでは不運な5%を大きく過小評価します。品質は別途定義が必要です。タスク完了率、事実整合性(faithfulness/groundedness)に加え、安価で有用な三つの先行指標——高評価率、リトライ率(何度も再生成する)、拒否回答率です。この三つが悪化すると、たいてい品質問題はすでに進行中です。

実践できるAI SLA指標表

次元指標本番レベルの参照基準測定方法
可用性稼働時間≥ 99.5%ヘルスチェック/uptime監視
可用性TTFT p95 / ITL p95< 500ms / < 250msストリーミング遅延監視
品質faithfulness(事実整合性)≥ 0.9(支持されたclaimの比率)RAGAS/DeepEval LLM-as-judge
品質幻覚率抽出型 < 8%、生成型 < 20%評価セット+本番サンプリング
体験リトライ率/拒否回答率基準値を定めて傾向を見るプロダクト計測

基準は丸写しするものではなく、シーンに合わせて較正します。社内ナレッジQAは厳しく、創作的な生成は緩めます。肝心なのは、各セルが「なんとなく良い」ではなく測定可能な数値を持つことです。

品質をどう測るか:groundednessと評価フレームワーク

品質は感覚に頼れず、再実行できる評価が必要です。2026年の主流である三つのオープンソースフレームワークは、それぞれ立ち位置が異なります。RAGASはRAGに特化し、四つの指標は正解ラベルを必要とせず、Pythonのセットアップも軽量です。DeepEvalは指標ライブラリが最も充実し、Pytest経由でCI/CDに組み込め、「品質が退行していない」ことをリリース前の自動ゲートに変えます。TruLensはRAGトライアド(groundedness、answer relevance、context relevance)を提唱し、OpenTelemetryと統合して監視に接続しやすくしています。三者の核心はいずれもfaithfulness/groundednessで、モデル出力を一つひとつのclaimに分解し、「検索された内容にどれだけの割合が支持されているか」を算出します。これこそRAGの幻覚を捉える中心的な仕組みです。ただし一つの落とし穴に注意してください。土台となるナレッジベース自体が古い、あるいは自己矛盾している場合、faithfulnessスコアは高くても答えは依然として誤りうるため、評価はナレッジベースの鮮度も併せて管理しなければなりません。

本番でどう守るか:継続監視・降格・drift

SLAは検収時に一度測って終わりではありません。AIはドリフト(drift)します。モデルやデータの分布が徐々に変わり、出力が体系的に変化し、悪い方向に動けばそれが劣化です。2026年の実務はこうです。安価な蒸留評価器を本番の全量で継続的に走らせ、確信度の低い判定だけを人へエスカレーションし、定期的な人手のサンプリングで評価器を較正し、評価をruntimeに直接ガードレールとして組み込みます。監視層はLLMのオブザーバビリティ基盤——LangSmith、Arize Phoenix(評価指標とembeddingドリフト検知を内蔵)、Langfuseといったツールに任せます。これらはインフラ監視では見えない幻覚ドリフト、検索失敗、promptの退行を捉えるために作られています。最後は降格戦略です。品質指標が基準を下回ったら、システムは低品質な出力を出し続けるのではなく、自動で降格し、バックアップモデルに切り替え、あるいは人へ引き継げなければなりません。研究では、出力側に事実単位の照合と修正(FactSelfCheckなど)を加えると、未照合時に比べて出力中の事実的な内容が約35%向上すると報告されています。

SLAを持たない代償

SLAを明確に定めることは、エンジニアの潔癖ではなく止血です。RANDの2024年の研究は、一部の推計では8割超のAIプロジェクトが失敗に終わり、これはAIを含まないITプロジェクトの失敗率の2倍だと指摘しています。Gartnerは2026年4月の調査で、インフラ・運用領域のAIユースケースは五つに一つが完全に失敗し、投資回収の期待を完全に満たすのは28%にとどまると指摘しました。これらの失敗に共通する病根の一つが、「成功の定義が最初から曖昧」であることです。測定可能な基準がなければ、システムが本当にリリースできるのか、リリース後も健全なのかを、誰も言えません。明確に書かれたAI SLAこそ、その曖昧さを数値に変えるものです。

恩梯科技(Nerdtechnic):SLAを持続的に管理できる能力へ

以上のデータが示すように、AIの安定性は「システムが落ちないか」と「出力が信頼できるか」という二つを同時に意味し、その両方が測定・監視され、降格を発動できて初めてSLAは意味を持ちます。恩梯科技のAIシステム顧問サービスは、お客様の業務シーンに合わせて可用性と品質の基準を検収可能なSLAに落とし込み、RAGASやDeepEvalといった評価フレームワークとオブザーバビリティ基盤を導入し、リリース後の継続監視と降格の仕組みを構築します。それによりお客様のAIは単に動くだけでなく、いま本当に健全かどうかを客観的な基準で語れるようになり、リリース後に耐えられないと気づいて作り直す事態を避けられます。

参考資料

  • SQ Magazine,《LLM Hallucination Statistics》,2026年。出典リンク
  • McCarthy Tétrault,《Moffatt v. Air Canada: A Misrepresentation by an AI Chatbot》,2024年。出典リンク
  • Spheron,《LLM Inference SLO Engineering: TTFT, ITL, and P99 Latency Budgets for Production AI》,2026年。出典リンク
  • Digital Applied,《AI Model Latency Benchmarks 2026: TTFT & TPS Data》,2026年。出典リンク
  • Ragas 公式ドキュメント,《Available Metrics》。出典リンク
  • TruLens 公式ドキュメント,《RAG Triad》。出典リンク
  • Particula Tech,《DeepEval vs RAGAS vs TruLens: Pick Your RAG Eval Stack》,2026年。出典リンク
  • Arize Phoenix 公式ドキュメント,《Quickstart: Inferences》。出典リンク
  • arXiv,《FactSelfCheck: Fact-Level Black-Box Hallucination Detection for LLMs》,2025年。出典リンク
  • RAND,《The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed》,2024年。出典リンク
  • Gartner,《Gartner Says AI Projects in I&O Stall Ahead of Meaningful ROI Returns》,2026年。出典リンク

これらの手法を自社に導入したいですか?

LINEで無料相談

私たちは案件数を追いません。

深く取り組む価値のある、少数の企業と長期的な関係を築きます。

無料システム健診

サポートが必要ですか?

ここをクリックしてお問い合わせください!