🐕UppuFun
← ニュースに戻る

研究者たちは、Anthropic、OpenAI、Googleのモデルに隠された推論を解読した。

BSCN·2026-08-12 20:59:00 UTC

原文を読む

MATS、ELLIS Tübingen、マックス・プランク研究所、Snykによる論文によると、Anthropic、OpenAI、Google APIの暗号化された推論ブロックがセッション間で再生可能であり、62個の有効なAPIキー、33個の...

AIプロバイダーが暗号化された推論を処理する方法に欠陥がある

MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Snykの研究者らが8月10日に提出した論文は、 @アンスロピックAI, @OpenAI (NAIST) と @google 主力製品である大規模言語モデルの内部推論を保護する。

Claude Opus、GPT-5.6、Gemini 3などの最新の推論モデルは、ユーザーに応答を返す前に、隠された思考の流れの痕跡を生成します。プロバイダーはこれらの痕跡を暗号化し、サーバー側に保存するのではなく、不透明なブロックとしてクライアントに返します。研究者らは、これらの暗号化されたブロックは完全に移植可能であることを発見しました。つまり、あるセッションで生成されたブロックは、別のセッション、別のユーザーアカウント、あるいは同じプロバイダーファミリー内の別のモデルでも再生できるのです。

論文で説明されている攻撃 独自のLLM APIから推論トレースを盗む必要なのは、標準的な非特権APIアクセスのみです。強力な最先端モデルから暗号化されたトレースを、同じプロバイダのより脆弱でセキュリティ対策が不十分な兄弟モデルに渡すことで、脆弱なモデルは、より強力なモデルを直接攻撃することなく、隠された推論をそのまま平文で出力するように促されます。

公開されているエージェントログから数百件の認証情報が発見された

研究チームはまた、GitHubとHugging Faceから公開されている6,708件のエージェント軌跡データセットをスキャンし、315,320個の埋め込み推論ブロックを解読した。これらのブロック全体から、62個の有効なAPIキー、33個のパスワード、24個のアクセストークンを含む、704個のプライバシー関連情報が検出された。特筆すべきは、これらの情報のうち64個は暗号化された推論の中にのみ存在し、可視の会話出力には一切含まれていなかったため、これらのログを公開した開発者は機密データが存在することを知る術がなかったということである。

本論文では、具体的な悪用経路として、モデル抽出のための独自の推論を盗むこと、他のユーザーが公開したトレースからプライベートデータを抽出すること、モデルの可視的な回答では表示されなかった有害なコンテンツを復元すること、そして暗号化された推論ブロック内にプロンプ​​トインジェクションを隠蔽して、公開されているエージェントの展開を汚染することの4つを挙げている。

@アンスロピックAI, @OpenAI (NAIST) と @google 各社は責任ある情報開示の後、サーバー側の修正プログラムを出荷した。しかし、研究者らは、これらの対策により論文で提示された結果は再現不可能になったものの、公開リポジトリから既に収集されたエージェントのトランスクリプトは引き続き読み取り可能であると指摘している。3社のプロバイダーはいずれも、この欠陥を正式に認めたり、更新されたドキュメントをこの研究と関連付けたりする公式声明を発表していない。

ソース:
独自のLLM APIから推論トレースを盗む(arXiv)
ハッカーニュース:OpenAI、Anthropic、Google APIの脆弱性により、弱いAIモデルが強いモデルの推論を解読可能に
サイバーセキュリティニュース:OpenAI、Anthropic、GoogleのLLM APIの脆弱性により、隠された推論の痕跡が露呈

関連トークン

コメント

コメントは言語ごとに分かれ、この言語のページにのみ表示されます。

コメントを読み込み中...

ANTHROPIC の関連ニュース