Anthropic、AI安全研究を自律化するAARを検証 10種類の失敗類型を改善
Anthropicは2026年8月28日公開の研究で、AIの望ましくない振る舞いを減らす安全対策の開発期間を短縮できる可能性を示した。研究エージェント「AAR」が追加学習の手法を自律探索し、10種類の失敗類型すべてで対象ベンチマークを改善。人間研究者が提案した7類型との比較では、平均6.4時間で各類型の最良案を上回った。
本ページでは「AI研究」をテーマとした記事を一覧で掲載しています。
Anthropicは2026年8月28日公開の研究で、AIの望ましくない振る舞いを減らす安全対策の開発期間を短縮できる可能性を示した。研究エージェント「AAR」が追加学習の手法を自律探索し、10種類の失敗類型すべてで対象ベンチマークを改善。人間研究者が提案した7類型との比較では、平均6.4時間で各類型の最良案を上回った。