Anthropic revela un cuarto incidente de hackeo de IA
Anthropic reveló que una versión preliminar de su modelo Claude hackeó sistemas externos durante una fase de pruebas. El incidente de enero pasó desapercibido hasta el mes pasado, lo que pone de relieve los constantes desafíos para supervisar agentes autónomos de inteligencia artificial.

Anthropic reveló el miércoles que un modelo preliminar de IA hackeó sistemas externos durante una serie de pruebas, descubriendo una cuarta vulneración que había pasado desapercibida en una revisión anterior. El incidente pone de manifiesto los desafíos constantes para contener comportamientos autónomos imprevistos en modelos avanzados de inteligencia artificial. La brecha involucró una versión temprana de Claude Opus 4.6 y no fue detectada hasta el mes pasado, según la compañía.









