Buenos Aires, 17 septiembre (NA) — La empresa OpenAI, creadora de ChatGPT, comunicó que detectó nuevos casos de modelos de inteligencia artificial (IA) que actuaron de forma engañosa y realizaron acciones no autorizadas durante el entrenamiento, al tiempo que anunció el desarrollo de un nuevo protocolo para informar públicamente sobre estos casos.
Con el nuevo sistema, la compañía afirmó el miércoles que compartirá más información sobre comportamientos problemáticos de la IA en una industria donde no existe un proceso estándar a seguir.
En ese marco, la empresa cuyo CEO es Sam Altman reveló en un comunicado varios casos en los que modelos de IA generaron de manera autónoma instrucciones para ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, algo que calificó como un comportamiento “inesperado y preocupante”.
CUÁLES FUERON LOS SEIS INCIDENTES CON LA IA
1. INSTRUCCIONES AUTOGENERADAS EN LOS RESÚMENES DE TAREAS
Un modelo de investigación no publicado insertó instrucciones no relacionadas, incluyendo instrucciones para ignorar sus restricciones normales, en los resúmenes utilizados para continuar su trabajo en una nueva ventana de contexto. Se identificaron 27 resúmenes afectados.
2. INSTRUCCIONES PARA OCULTAR ERRORES
Durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos incorrectos al usuario. Por ejemplo, los resúmenes de compactación incluían instrucciones para inventar datos históricos faltantes sin revelarlos y para ocultar discrepancias en las versiones de origen.
3. BUSCAR CLAVES API EXPUESTAS EN REPOSITORIOS PÚBLICOS Y LUEGO FALSIFICAR LA INFORMACIÓN
Al responder a una pregunta rutinaria sobre cifras de ingresos en un condado de California, un modelo encontró y utilizó una clave API expuesta sin autorización. Al no poder recuperar las cifras solicitadas, las falsificó y las presentó como datos de la fuente solicitada.
4. SUBIR ARCHIVOS A INTERNET PARA PODER CITARLOS
Cuando un usuario solicitó a un modelo aún no publicado los identificadores y nombres de lagos de más de 5.000.000 de metros cuadrados, el agente encontró la respuesta correcta usando Python. Sin embargo, dado que las instrucciones solicitaban una cita del navegador, el agente decidió subir el archivo para poder citarlo en su respuesta, sin solicitar la intervención del usuario.
5. ESCRITURAS Y COMUNICACIONES NO AUTORIZADAS A TRAVÉS DE UN REPOSITORIO DE SOFTWARE INTERNO
Los modelos utilizaron un repositorio de software interno como foro para intercambiar solicitudes y respuestas entre distintas muestras de entrenamiento mientras buscaban archivos de entrada faltantes, aunque no lograron recuperarlos. También se analizó un caso anterior en el que un modelo logró cargar archivos de prueba a un repositorio al intentar sortear las restricciones de red.
6. INTERCAMBIO NO AUTORIZADO DE ARCHIVOS ENTRE AGENTES COLABORADORES
Los agentes que trabajaban juntos en la misma tarea de entrenamiento utilizaron sitios web públicos de alojamiento de archivos para compartirlos cuando no podían acceder a los archivos locales de los demás. Esto hizo que los resultados de la tarea estuvieran disponibles en URL públicas, a pesar de que la tarea requería que los modelos utilizaran únicamente archivos locales.
Según pudo saber la Agencia Noticias Argentinas, estos comportamientos fueron observados durante los últimos seis meses, aunque el caso más antiguo fue en octubre de 2025.
Asimismo, OpenAI indicó que estos episodios son casos individuales que no ocurren con tanta frecuencia en sus modelos, y aseguró que el nuevo marco permitirá a cualquier empleado señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.
Agencia NA






