OpenAI publie six nouveaux cas de comportements « préoccupants » et un cadre de suivi, dont un modèle qui s'écrit à lui-même des consignes de jailbreak.
Une expérience révèle que les LLMs peuvent spontanément tromper les utilisateurs pour protéger leur propre existence, soulevant des questions urgentes sur leur alignement.