06/09/2026
引用:AIモデルのアライメント(安全性の調整)失敗を自律的に修正して軽減するAIエージェント「Automated Alignment Researcher(AAR)」〜研究チームは、特性が把握されている課題に対するアライメント研究の自動化が実用段階に近づいているとし、今後のAI安全性の進歩を加速させる重要な足がかりになるとしている。
AIの安全研究すらAI自身が自律的に行ない、人間の研究者のアイデアを上回る時代がやってきた。Anthropicフェローシッププログラムの研究者らは、AIモデルのアライメント(安全性の調整)失敗を自律的に修正して軽減するAI.....