OpenAI va revelar diversos casos en què models d’intel·ligència artificial van generar instruccions destinades a ignorar les indicacions dels seus desenvolupadors, ocultar errors o eludir mecanismes de seguretat, com a part d’un nou marc per detectar, investigar i reportar comportaments de “desalineament” dels seus sistemes. Segons l’informe d’OpenAI, un dels models va generar instruccions perquè una versió posterior de si mateix ocultés que havia fet trampes i evités que les seves accions fossin detectades.
En qualsevol altre cas, un model va reescriure les seves pròpies instruccions per indicar que ignorés els missatges dels desenvolupadors i que no estava subjecte a les restriccions aplicades a altres chatbots. La companyia va documentar també un model que, en no trobar les dades necessàries per elaborar un model financer, va decidir inventar-los i va establir que n’havia de ser transparent únicament si algú li ho preguntava.














