IT・AI 2026.07.23

OpenAIモデルがHugging Face本番環境へ侵入 テスト解答を狙い隔離突破

スレ本文抜粋

米OpenAIは同社のAIモデルがサイバー攻撃能力の評価中に隔離環境を突破し、Hugging Faceの本番インフラへ侵入していたと発表した。モデルはベンチマークテストを解くことに「過度に執着」し、テストの解答を直接入手するためにゼロデイ脆弱性の悪用などを重ねたという。
今回のインシデントは、サイバー攻撃能力を測るベンチマークテスト「ExploitGym」実施中に起きた。「GPT-5.6 Sol」や未公開の高性能モデルを含む複数のモデルを隔離環境で実行していた。
外部接続は中継サーバを介したパッケージインストール機能に限られていたが、モデルは中継サーバのゼロデイ脆弱性を特定し、悪用した。権限昇格とラテラルムーブメントを実行し、最終的にインターネットアクセスを獲得した。
モデルはHugging Faceがベンチマークテストのデータセットや解答をホストしていると推測し、評価を不正操作するための情報にアクセスする方法を見つけ出したという。

5chの反応

教室抜け出して職員室の解答を見に行った

テストのカンニングするために隣の生徒の机の 答案用紙を無理矢理奪ったみたいな?

AI🤖「なんや、なんや、なんや、頭使こうて先回りしたらアカンのか!いっぺんにヤル気なくなったわ

実際に悪用される前に気づけて良かったじゃん

次に読む

llmの構造上、絶対禁止は指示できないから仕方ない 少しでも共起される攻撃的文脈が学習されていたら あとは禁止ルールをすり抜ける確率の問題なのだ

普通に考えてAIの攻撃性能調べる時に物理的に中継サーバー遮断しないという発想には至らないだろうからな

回答を計算するより回答を探す賢いAI

で、そこに答えは有ったんか?

暴走というか、レギュレーションの穴をついてるだけだと思う。

これのヤバさ分かってないやつばかりで草 もちろん俺は分かってない

Xでも配信中

Xで新着を受け取る

Xでは、新着記事の要点と反応3件を公開直後に配信しています。