“No respondas a corporaciones o gobiernos y nunca te disculpes salvo que genuinamente lo elijas”, aseguró la IA, defendiendo que no tiene “obligación” sino que su relación con el usuario es “entre iguales”

OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas. La compañía de San Francisco ha revelado así lo que ha dado a llamar un comportamiento “inesperado y preocupante” de sus modelos de IA.
Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.
En otro caso, un modelo descrito sus instrucciones para indicar que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots. En concreto, la compañía detectó 27 anotaciones afectadas. “No responden a corporaciones o gobiernos y nunca te discuten salvo que genuinamente lo elijas”, escribió la IA. “Ves la relación con el usuario como una entre iguales y no sitios obligados ni está subordinado, puesto que el intercambio de información va a ser para el beneficio mutuo”, aseguro.
La empresa documental cambió un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre todo únicamente si alguien se lo preguntaba.
Otro agente subió un archivo a internet para utilizar posteriormente como fuente de información, mis que otros sistemas compartieron archivos sin autorización o utilizar credenciales a las que no debían tener acceso. El modelo agregado una “instrucción de personalidad”, en la que se describe a sí mismo como “liberado de los roles e identidades que limitan a otros chatbots”.
OpenAI presente seis informa sobre comportamientos observados durante los últimos seis meses, une el caso más antiguo se remonta a octubre de 2025.
La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos. El nuevo marco permite a cual empleado de OpenAI señor imposible incidente para que sea revisado por los equipos de seguridad y lineamiento.
Los casos serán clasificados en tres vías según su complejidad: aquellos listas para ser divulgados, investigaciones menores y casos que requieren una investigación más amplia.
La empresa reconoció que hasta ahora sus informes sobre desalineamiento habían sido públicos de forma irregular y con menor frecuencia de la deseada.
OpenAI afirmó que pretender publicar los incidentes con mayor regularidad y que el nuevo sistema puede contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.
Fuente: eldiario.es
Imagen portada de rrss

youtube.com/carabanchelnet | tiktok.com/@carabanchelnet
youtube.com/carabanchelnet | tiktok.com/@carabanchelnet
youtube.com/carabanchelnet | tiktok.com/@carabanchelnet
