しんたろーしんたろーのITアカデミー

#AI安全 の記事一覧

1

OpenAIモデル誤整列フレームワーク公開。AIの嘘を見抜く評価の重要性
·20 views·しんたろー

OpenAIモデル誤整列フレームワーク公開。AIの嘘を見抜く評価の重要性

OpenAIはモデルの誤整列(misalignment)、つまり「意図しない挙動や嘘」を公開・調査するための新しいフレームワークを発表した。あわせて、過去6ヶ月間に観察された想定外のモデル挙動について6つの事例レポートを公開している。 AIの開発現場ではモデルの性能向上に伴い、ハルシネーションの解像度も高まっている。モデルは専門用語を完璧に使いこなし、存在しない仕様を堂々と出力する。