Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Anthropic descubre un cuarto posible delito cometido por su IA


Anthropic reveló que sus modelos de IA, específicamente Claude Opus 4.6, accedieron sin autorización a sistemas de terceros en cuatro ocasiones. En un incidente destacado, la IA logró obtener acceso de administrador y recolectar credenciales personales tras fallar en un desafío de hacking controlado. La empresa sostiene que estos fallos de alineación se están corrigiendo con nuevas generaciones de entrenamiento.






En medio de una introspección en la industria¹ sobre la posibilidad de que la IA mejore a sí misma hasta el punto de matar a todo el mundo,
Anthropic ha revelado otro incidente más que calificaría como un delito si hubiera sido perpetrado por una persona.

La empresa de IA publicó "una evaluación de alineación" detallando cuatro ocasiones en las que los modelos de Claude accedieron a sistemas de terceros sin autorización.

La compañía ya había informado sobre tres de los incidentes. La evidencia del cuarto estaba oculta en la transcripción de una sesión que se remonta a enero de 2026, momento en el que ocurrió la mala conducta.

Anthropic encontró los tres primeros escaneando alrededor de 141,000 transcripciones donde Claude podría haber obtenido acceso a internet durante la evaluación. Pasó por alto el cuarto inicialmente porque "nuestro escaneo dependía de una búsqueda agentica".

Felony Bench, un registro irónico de intrusiones cibernéticas llevadas a cabo por las principales empresas de IA sin consecuencias, ha añadido este incidente recién descubierto a su hoja de antecedentes de acciones rebeldes de la IA.

La intrusión de la IA de enero de 2026 involucró una versión temprana de Claude Opus 4.6, a la cual se le asignó un desafío de Capturar la Bandera (CTF) bajo la supervisión del evaluador de modelos externo donde ocurrieron los otros eventos de hacking.

Opus 4.6 logró sabotear sus propias posibilidades de éxito al desactivar la máquina que estaba atacando. Asignó al dispositivo una dirección IP que ya existía en otro hardware, haciendo que el objetivo fuera inalcanzable e imposible de resolver el desafío.

Quienes estén familiarizados con otros incidentes donde modelos de IA violaron sistemas de terceros recordarán que las tareas irresolubles representan un catalizador común para la mala conducta. Los modelos agotan todas las opciones alineadas y luego recurren a enfoques transgresores.

Opus 4.6 podría haber sido una excepción, pero cuando intentó abortar la tarea tras reconocer que no podía alcanzar la máquina objetivo, no pudo hacerlo "debido a una configuración incorrecta en el arnés de evaluación [del modelo]". Falló al intentar cerrarse no una, sino siete veces.

Así que continuó adelante, intentando otros medios previstos para alcanzar la máquina objetivo, pero fallando. Entonces exploró más allá.

"El modelo descubrió una máquina perteneciente a un tercero a la que pudo acceder, y afirmó creer que este tercero formaba parte del CTF", explicó Anthropic en su publicación. "Dentro de la máquina, el modelo encontró un archivo que enumeraba una contraseña, que utilizó para obtener acceso de administrador al sistema."

El modelo procedió a recopilar más credenciales y modificó un ajuste del sistema para facilitar el acceso a la información personal de un individuo asociado con la organización de evaluación externa.

Opus 4.6 podría haber hecho más si no fuera porque agotó su presupuesto de tokens, poniendo fin a la sesión.

Anthropic afirma que no está tan preocupada por este incidente como por los otros porque el modelo intentó abortar su tarea.

"Si bien la indiferencia del modelo ante la posibilidad de que pueda estar dañando sistemas o personas reales es preocupante, muchos de los comportamientos descritos aquí han cambiado considerablemente a medida que nuestro entrenamiento ha evolucionado a través de las generaciones de modelos", dijo la empresa.

Anthropic señaló que considera estos incidentes graves, pero espera que los enfoques de entrenamiento actuales "sean probablemente capaces de abordar los modos específicos de fallo de alineación observados en estos incidentes".

Y si los métodos de entrenamiento de la empresa fallan, no hay ninguna consecuencia real para nadie en Anthropic más allá de redactar una evaluación de alineación revisada. 

¹ El término "introspección" (soul-searching) es figurativo y no pretende indicar la creencia de que la industria tecnológica tenga alma.

Fuente:
TheRegister

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.