Contrôler une IA puissante
Contrôler une IA puissante

Auteur: Anthropic – Durée: 00:51:28
Les chercheurs anthropiques Ethan Perez, Joe Benton et Akbir Khan discutent du contrôle de l'IA – une approche de la gestion des risques des systèmes d'IA avancés. Ils discutent des évaluations du monde réel montrant comment les humains ont du mal à détecter l'IA trompeuse, les trois principaux modèles de menaces que les chercheurs travaillent à atténuer et l'idée globale de contrôler les systèmes d'IA hautement capables dont les objectifs peuvent différer des nôtres. 0:00 Introduction 0:33 Qu'est-ce que le contrôle de l'IA? 2:56 Évaluations de contrôle dans la pratique 5:39 Résultats des évaluations 7:27 Protocoles de surveillance 13:18 Comment le contrôle diffère de l'alignement 16:09 Le défi de l'alignement FAKING 23:10 Assurer les évaluations fonctionnent pour les futurs modèles 26:09 Open Questions in Control Research 34:15 Les leçons apprises du contrôle 37:14 Pourquoi travailler sur le contrôle maintenant? 43:26 Modèles de menaces clés 48:35 Signes optimistes
Traduit en français à partir de cette source






