[本文]

国・地域名:
ドイツ
元記事の言語:
ドイツ語
公開機関:
マックスプランク協会(MPG)
元記事公開日:
2026/08/28
抄訳記事公開日:
2026/09/30

AIが本当に何をできるか、誰が検証するのか?

Wer prüft, was KI wirklich kann?

本文:

(2026年8月28日付、マックスプランク協会(MPG)の標記発表の概要は以下のとおり)

Science誌の論説「人工知能(AI)が本当に何をできるか、誰が検証するのか?」で、トマックスプランク・セキュリティ・プライバシー研究所ホルツ所長(Prof. Thorsten Holz)は、多くのデータや試験が公開されていないため、最先端のフロンティアAIシステムの検証は困難だと論じている。安全性と検証可能性の確保には、独立した監査と、報告者が不利益を受けない報告制度が必要であり、透明性と信頼を促進する機関を設けなければならない。

最も高性能なAIシステム、いわゆるフロンティアモデルに関する最も重要な知見は、同時に最も検証が難しい。その能力とリスクの評価に必要な情報の多くは、未公開モデルの評価結果やシステム安全性試験を含め、開発企業の外部からはほとんど入手できない。最近、OpenAI、Anthropic、Metaの各社は、研究用モデルが本来の試験環境から脱出し、他組織のシステムを侵害していたと発表した。各社がこれらの事案を自主的に公表したことは評価すべきだが、企業外部には、事案を発見、再現、検証する手段がなかった。

ホルツ所長は「研究室の外で検証できない結果は科学的証拠ではない。それは単なる証言に過ぎない」と述べた。フロンティアAIは、ほかに類を見ない測定上の課題を突き付けている。ベンチマーク値は、融点が化合物の性質であるような、モデルに固定された単純な特性ではなく、評価者と評価対象システム間との相互作用によって部分的に生み出されるものでもある。

AIの場合、封じ込めも根本的に難しい。病原体がバイオセーフティキャビネットについて考えることはないが、高度なAIシステムは、自らを封じ込めるために設計された試験環境を分析できる

ホルツ所長はさらに「より優れたベンチマークは引き続き重要だが、もはやそれだけでは不十分である。独立した検証を日常的に行わなければならない」と述べた。評価や封じ込めの失敗の公表を、自発的な透明性に依存させてはならない。重大な事案を報告した企業だけが、評判を損なう代償を払うことになる。

安全性が重視される分野では、報告者が不利を受けない報告制度が採用されている。フロンティアAIの開発にも、専門家コミュニティ全体がこうした失敗から学べる報告制度が必要である。

より良いベンチマーク、より堅牢な封じ込め戦略、評価に応じて行動を変えるシステムの評価方法は、早急に取り組むべき未解決の課題である。検証はフロンティアAI研究の妨げではなく、その結果を科学的証拠となるための根本的な前提条件である。

[DW編集局]