PRACTICAL DOCUMENT
AI評価プロトコルと
テンプレート
ABOUT THE DOCUMENTS
NEDO事業
AIセーフティ強化に関する研究開発・検証等の推進事業/
AIセーフティ強化に関する研究開発の成果を公開
このたび当社は、国立研究開発法人新エネルギー・産業技術総合開発機構(NEDO)の事業「AIセーフティ強化に関する研究開発・検証等の推進事業/AIセーフティ強化に関する研究開発」において、2025年4月より取り組んできた、生成AIの安全性評価における「運用計画・管理の観点からの企業向け実装解説の作成」の研究開発成果を公開いたしました。
本取り組みの背景:生成AIの安全性確保と国際標準への対応が急務に
生成AIの急速な普及に伴い、ハルシネーション(事実と異なる出力)、プロンプトインジェクション(悪意ある入力による誤動作)、有害コンテンツの生成といった安全性に関するリスクが社会的な課題となっています。欧州ではEU AI Actが段階的に施行されるなど、国際的なAI規制の動きも加速しており、日本国内の企業においても、AIの安全性を体系的に管理・評価する体制の整備が強く求められています。
こうした中、AIマネジメントシステムの国際規格であるISO/IEC 42001は、組織がAIリスクに対応するための枠組みを提供しています。しかし、同規格は具体的な安全性評価の手法や基準を規定しておらず、「何をどの順序で評価すべきか」は各組織に委ねられているのが現状です。
研究開発の概要と成果
コーピーは本事業において、ISO/IEC 42001の要件と生成AIの安全性評価の実践との間に存在する実務的な「ギャップ」を埋めることを目的に、以下の成果物を開発しました。
成果物①:報告書「AIマネジメントシステムに基づく生成AI安全性評価プロトコルとその実装ガイド」
ISO/IEC 42001に整合した生成AIの安全性評価プロトコルを、3つのフェーズ(分析・テスト・報告)で体系化した実装ガイドです。リスクアセスメントからテスト計画の策定、評価の実施、報告書作成に至るまでの一連のプロセスを、実務者が具体的に把握できるよう整理しました。視覚言語モデル(*1)を用いた仮想的な顧客サポートシステムを題材に、ジェイルブレイク攻撃(*2)に対する統合テスト(*3)やデータポイズニング検知(*4)のための単体テスト(*5)など、具体的な評価事例も示しています。
また、リスクアセスメントにおける「アクセス」と「エージェンシー」(*6)の概念、安全性評価にLLM-as-a-Judge(*7)を用いる際の「暴露マッピング」(*8)、サプライチェーン管理における「信頼の連鎖」(*9)など、実務上の重要な概念についても問題提起と例示を行いました。
成果物②:生成AI安全性評価テンプレート(記載例付き)
評価プロトコルの各ステップに対応する記録用テンプレートです。ビジネス状況分析からステークホルダー分析、システム構造分析、リスクアセスメント、リスク対応計画・適用宣言書、テスト計画、テスト方法、テストに用いる資源など、全工程をカバーしています。
仮想的なチャットボットシステムを想定して、具体的な記載例を付しており、企業が自社のAIシステムに適用する際の参考としてご活用いただけます。
成果物の特徴
成果物の公開について
今後の展望
コーピーは、本事業で得られた知見を活かし、AIの安全性評価技術の国際標準化と社会実装への貢献を続けていきます。ISO/IEC 42001をはじめとするAIマネジメントシステム規格に準拠するためのアプローチを普及させ、企業が安心してAIを活用できる環境の整備を支援することで、「ミッションクリティカルAI」の実現を加速させてまいります。
