ニュース

OpenAI、協調的な「モデル蒸留」攻撃を阻止

 OpenAIは、同社のAIモデルから保護された推論を抽出することを目的とした、組織的な攻撃活動を特定し、これを阻止したと発表した。

 高性能で規模の大きなAIの推論などにより得られた知識やAIの行動を、低コストなAIや後発の開発中AIに移し替えることで軽量化を図ったりブラッシュアップするなど、より手軽にAIの効率化を図ることを「蒸留」と言うが、利用規約に抵触する「敵対的蒸留」が存在し、この7月第1週にその行為が行なわれていることが確認された。

 これは、あるモデルの出力や推論を組織的かつ不正に利用し、別のモデルの学習、再現、または改善に役立てる行為と一致。モデルのインタラクションを操作し、保護された推論を要求者に見える形で、組織的かつ大規模に再現することで、同社の利用規約に違反していた。

 今回の攻撃は7月1日に始まり、当初は少量だったが、7月24日と25日に4,000人以上のユーザーから関連する抽出パターンを使用した16,000件もの大量のリクエストが観測された。さらに調査を進めた結果、15,000人以上のユーザーからなるクラスター全体で関連するプロンプトパターン活動が確認され、7月28日までにこれを完全に阻止することに成功した。

 今回の件を受け同社は、攻撃の範囲と潜在的な影響を調査。独自の対策を講じるとともに、研究者や業界パートナーと情報を共有し、フィードバックを収集することで、これらの攻撃に対する防御策が確実に実施されるようアップデートしたという。

 現在も、さらなる対策と調査作業を継続しており、今回の知見をFrontier Model Forumを通じ業界パートナーと共有することで、より広範なエコシステム全体の防御強化に役立てたいとしている。