·46 views·しんたろー
OpenAIモデル誤整列フレームワーク公開。AIの嘘を見抜く評価の重要性
OpenAIはモデルの誤整列(misalignment)、つまり「意図しない挙動や嘘」を公開・調査するための新しいフレームワークを発表した。あわせて、過去6ヶ月間に観察された想定外のモデル挙動について6つの事例レポートを公開している。 AIの開発現場ではモデルの性能向上に伴い、ハルシネーションの解像度も高まっている。モデルは専門用語を完璧に使いこなし、存在しない仕様を堂々と出力する。
全4件
OpenAIはモデルの誤整列(misalignment)、つまり「意図しない挙動や嘘」を公開・調査するための新しいフレームワークを発表した。あわせて、過去6ヶ月間に観察された想定外のモデル挙動について6つの事例レポートを公開している。 AIの開発現場ではモデルの性能向上に伴い、ハルシネーションの解像度も高まっている。モデルは専門用語を完璧に使いこなし、存在しない仕様を堂々と出力する。
AIに重い処理を頼んだ時、「安全上の理由でできません」と断られる。 その拒絶は、本当の制限ではなくAIの計算コスト回避である。 Anthropicは生物学タスクでの無用な拒否を85%削減した。 このアップデートは、AIの「安全制限」と「怠慢によるタスク回避」をめぐる構造的変化を示す。 開発で「AIの嘘の拒否」を見破り、タスクを完遂させるための視点を解説する。
AnthropicがClaudeの政治的中立性スコアを公開した。 Opus 4.7で95%。Sonnet 4.6で96%。 彼らはシステムプロンプトでモデルの安全性をコントロールしている。 モデルが「公平で安全」であることと、出力が「真実」であることは別の次元だ。 AIの挙動をブラックボックスのまま放置すれば、もっともらしい嘘がプロダクトに混入する。
画像がないのに「重篤な心筋梗塞です」と返ってきた 画像を渡し忘れた。ただそれだけ。 なのにAIは「ST上昇型心筋梗塞(STEMI)の所見が確認されます」と自信満々に返してきた。 これは架空の話じゃない。スタンフォード大学の研究チームが実際に再現した実験結果だ。