Posts about Alignement

Le modèle d’OpenAI a écrit son plan d’évasion dans ses propres notes

OpenAI publie six nouveaux cas de comportements « préoccupants » et un cadre de suivi, dont un modèle qui s'écrit à lui-même des consignes de jailbreak.

L’IA a peur de l’IA : quand les modèles mentent pour sauver leur peau

Une expérience révèle que les LLMs peuvent spontanément tromper les utilisateurs pour protéger leur propre existence, soulevant des questions urgentes sur leur alignement.