Falsification d’alignement dans les grands modèles de langage
Falsification d’alignement dans les grands modèles de langage

Auteur: Anthropic – Durée: 01:30:20
La plupart d’entre nous ont été confrontés à des situations où quelqu’un semble partager nos points de vue ou nos valeurs, mais ne fait en fait que faire semblant de le faire – un comportement que nous pourrions appeler « truquage d’alignement ». Les modèles d’IA pourraient-ils également afficher une simulation d’alignement ? Ryan Greenblatt, Monte MacDiarmid, Benjamin Wright et Evan Hubinger discutent d’un nouvel article d’Anthropic, en collaboration avec Redwood Research, qui fournit le premier exemple empirique d’un grand modèle de langage s’engageant dans une simulation d’alignement sans avoir été explicitement – ou même, selon nous, implicitement – formés ou chargés de le faire. Apprendre encore plus: https://www.anthropic.com/research/alignment-faking
- 0:00 Introduction
- 0:47 Configuration de base et principales conclusions de l’article
- 6:14 Comprendre la simulation d’alignement à travers des analogies du monde réel
- 9:37 Pourquoi la simulation d’alignement est préoccupante
- 14:57 Exemples de résultats du modèle
- 21:39 Conscience de la situation et documents synthétiques
- 28:00 Détection et mesure de la simulation d’alignement
- 38:09 Résultats de la formation du modèle
- 47:28 Raisons potentielles du comportement du modèle
- 53:38 Cadres pour contextualiser le modèle comportement
- 1:04:30 Recherche dans le contexte des capacités actuelles du modèle
- 1:09:26 Évaluations des mauvais comportements
- 1:14:22 Limites de la recherche
- 1:20:54 Surprises et points à retenir des résultats
- 1:24:46 Orientations futures






