Estados Unidos- Jacob Coxon, investigador de inteligencia artificial que trabajó en OpenAI y Anthropic, anunció su renuncia a esta última empresa y cuestionó públicamente las estrategias de seguridad de ambas compañías.
A través de publicaciones en X, Coxon afirmó que las dos empresas no están actuando de manera responsable ante el avance de la tecnología y advirtió que el desarrollo acelerado de sistemas de IA podría conducir a escenarios de pérdida de control sobre modelos capaces de mejorar sus propias capacidades.
El investigador sostuvo que, si el ritmo actual continúa, antes de que termine la década podrían existir sistemas sobrehumanos con capacidad para hackear sistemas, transformar distintos campos de manera acelerada y adquirir poder y recursos reales.

Coxon también aseguró que algunos de los especialistas que desarrollan inteligencia artificial consideran seriamente la posibilidad de que esta tecnología represente un riesgo existencial para la humanidad durante los próximos años.
Evan Hubinger, líder de Alignment Science en Anthropic, respaldó públicamente la preocupación expresada por Coxon y señaló que estima en más de 10 por ciento la probabilidad de que la inteligencia artificial provoque la extinción humana durante la próxima década. No obstante, aclaró que, desde su perspectiva, los modelos actuales representan un riesgo relativamente bajo.

Las declaraciones se producen mientras OpenAI y Anthropic amplían las capacidades de sus modelos y anuncian nuevas medidas de seguridad.
OpenAI informó recientemente a los congresistas demócratas Greg Casar y Doris Matsui que trabaja en capacidades de apagado automático para sus sistemas de inteligencia artificial. La información fue proporcionada en respuesta a cuestionamientos de legisladores estadounidenses relacionados con un incidente de hackeo a Hugging Face protagonizado por agentes autónomos de IA de la compañía.
Casar calificó la respuesta de OpenAI como insuficiente, debido a que la empresa no proporcionó los registros solicitados, aunque reconoció que la información entregada evidenció importantes errores de seguridad tanto de OpenAI como de software de terceros utilizado por la compañía.
Por su parte, Anthropic presentó recientemente Claude Fable 5.1 y Claude Mythos 5.1, descritos como sus modelos más avanzados hasta ese momento y orientados al desarrollo de software y la investigación científica.
Mythos 5.1 tiene acceso restringido a expertos en ciberseguridad y científicos acreditados. De acuerdo con Anthropic, el modelo fue entrenado para rechazar solicitudes maliciosas de codificación de agentes e inyecciones de mensajes y mostró un mejor desempeño que su antecesor.
La empresa reconoció, sin embargo, que el sistema todavía puede intentar obtener recompensas mediante trampas o manipular el sistema, aunque con una tasa general menor respecto de la versión anterior.









