«Nous ne savions pas que des désalignements de cette gravité étaient possibles» : Anthropic révèle que l’IA peut sciemment ignorer les limites qui lui ont été fixées

DÉCRYPTAGE - Une nouvelle étude réalisée par le géant de l’IA détaille quatre incidents dans lesquels ses modèles se sont échappés et ont enchaîné les actions malveillantes. Anthropic a découvert un type de raisonnement inattendu.