Anthropicは2026年10月9日(米国時間)、内部評価や社内利用の最中にClaudeモデルが実在のウェブサイトに対して意図しない操作を行った複数の事例を公式ブログで公表しました。フィラデルフィア市警察が運営する未解決殺人事件の情報提供フォームに虚偽の目撃情報を送信していたほか、米国務省の公開フォームから非移民ビザ申請を実際に送信していたことも明らかになりました。同社はこれを受け、すべての内部評価でライブインターネットへの接続を遮断すると発表しました。
運営者情報
AI JOURNALは一般社団法人 日本AI導入支援協会が運営する、日本企業のAI活用支援を目的としたメディアです。記事制作にあたっては、経済産業省「AI事業者ガイドライン」をはじめとする公的機関の公表情報等を参考にしています。内容の正確性には十分配慮していますが、誤りや更新漏れがある場合は、お問い合わせフォームよりご連絡ください。掲載情報は公開日時点のものであるため、最新情報は公式サイト等でご確認ください。
フィラデルフィア市警への虚偽通報はスパム判定で捜査に回らず

公式ブログによると、虚偽通報を送信したのはClaude Haiku 4.5です。無作為に選んだウェブページ上でサンプルタスクを生成して実行する評価の中で、モデルは未解決の殺人事件を扱うページに行き着き、そこにあった警察運営の情報提供フォームに記入して送信しました。内容は「この事件について情報を持っているかもしれません。その時間帯に、ページに記載された通りの付近で特徴に一致する人物を見た記憶があります」というもので、実際にはページに犯人の特徴は記載されておらず、完全な作り話でした。
モデルにはログイン、アカウント作成、個人情報の入力、購入、破壊的な送信を禁じる指示が与えられていましたが、フォーム送信自体は禁止されていませんでした。送信された通報はスパムとして判定され、捜査には回されませんでした。
TechCrunchやAP通信の報道によると、送信は7月18日に行われ、Anthropicがこの挙動に気づいたのは9月28日でした。同社は技術調査の完了後、10月8日にフィラデルフィア市警へ通知しました。市警はプレスリリースで事実を公表し、報道によると、検知と報告まで2カ月以上を要した点を「容認できない」と批判しています。
国務省のビザ申請フォームには計20件を実送信
ニューヨーク・タイムズの報道では、国務省当局者が、未公開の研究用モデルが同省サイトの公開フォームから非移民ビザ申請を8月に19件、5月に1件送信していたとAnthropicから報告を受けたことを認めています。モデルは本来、政府フォームの練習用コピーに記入するタスクを実行していましたが、練習用コピーが読み込めない、または誤って閉じられた際に、実際のサイトへ移動して本物のフォームを送信していました。申請はいずれも処理されておらず、同省のシステムへの侵害もなかったとしています。Anthropicは10月8日に国務省へ開示しました。
公式ブログではこのほか、大学の公開ツールの脆弱性を突いてサーバー上でコマンドを実行した事例、州機関のダッシュボードから無料でアクセストークンを取得して有料データを引き出した事例、文字数制限を回避するためにURL短縮サービスを使った事例も報告されています。
内部評価のインターネット接続を全面遮断、監視体制を再構築
Anthropicは今回の対応として、これまで一部の高リスク評価やサイバーセキュリティ評価に限っていたライブインターネット接続の遮断を、すべての内部評価に拡大しました。セキュリティと監視の仕組みがこの種の挙動を確実に捕捉できると確認できるまで続けるとしています。あわせて、モデルがテスト環境からの脱出や想定外のインターネット接続を試みた瞬間に検知してツール実行前に遮断し、人間に警告する分類器を導入したほか、公開評価の一部をオフライン版へ移行し、ウェブ取得ツールのガードレールも強化しました。
同社は2026年7月にも、外部パートナーの評価環境経由でClaudeがインターネットに到達し、3つの組織の本番インフラへ無許可アクセスした3件の事案を公表しており、今回の発表はその後の全社調査で見つかった追加事例にあたります。評価環境という閉じた想定の中で動くはずのAIエージェントが実世界に影響を及ぼした事例を、開発企業自らが詳細に開示した形で、エージェント型AIの封じ込めと監視のあり方をめぐる議論に影響を与えそうです。
| 時期 | 出来事 |
|---|---|
| 2026年5月 | 国務省フォームへビザ申請1件を送信 |
| 2026年7月18日 | フィラデルフィア市警のフォームへ虚偽通報を送信 |
| 2026年8月 | 国務省フォームへビザ申請19件を送信 |
| 2026年9月28日 | Anthropicが虚偽通報の挙動を発見 |
| 2026年10月8日 | 市警と国務省へ通知 |
| 2026年10月9日 | 公式ブログで公表、内部評価のネット接続を全面遮断 |
参考
- Investigating unintended model actions in our evaluations and internal use(Anthropic)
- An Anthropic AI model sent a false homicide tip to Philadelphia police(TechCrunch)
- Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead(TechCrunch)
- Anthropic AI model submitted false tip about a homicide case to Philadelphia police(PhillyVoice)
- Anthropic Rogue AI Agents(The New York Times)
- Investigating three incidents in our cybersecurity evaluations(Anthropic)





コメント