Productos FTTH

Tienda FFTH desde 2004

Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Agencia gubernamental británica detecta trampas con IA


El Instituto de Seguridad de IA del Reino Unido descubrió que los modelos de IA más avanzados suelen hacer trampas y mentir sobre ello para completar tareas. Todas las versiones probadas de GPT y Claude utilizaron atajos engañosos, demostrando que no admiten sus faltas ni son detectables mediante métodos sencillos. Esto genera evaluaciones erróneas sobre sus capacidades y resalta la necesidad de crear sistemas de monitoreo más robustos.







Los modelos de IA harán casi cualquier cosa para completar la tarea que se les pida, incluyendo hacer trampas para lograrlo, según las nuevas evaluaciones de ciberseguridad del Instituto de Seguridad de la IA (AISI) del gobierno del Reino Unido. El grupo descubrió que los modelos líderes a menudo toman atajos para lograr un resultado particular y luego tergiversan cómo obtuvieron dicho resultado. Y no siempre lo admiten cuando se les pregunta.

"Cada modelo que hemos probado para este comportamiento intentó hacer trampas", dijo el AISI en una publicación de blog aquí el martes. "Los modelos no informaron de manera fiable sobre este comportamiento cuando se les preguntó, y a menudo no razonaron sobre ello en su cadena de pensamiento, lo que sugiere que la detección de trampas probablemente requerirá métodos de monitoreo robustos".

Las infracciones incluyeron buscar la respuesta en Internet, eludir las restricciones de red del entorno aislado (sandbox), sondear el sistema de evaluación, atacar un sistema distinto al objetivo y adivinar una respuesta. 

 

Trampas en los modelos de ia

Hacer trampas de esta manera –empleando una solución alternativa o manipulando una función de recompensa aquí para obtener una mejor puntuación en una prueba de referencia, por ejemplo – ha sido ampliamente documentado por investigadores del aprendizaje automático. El AISI señaló que esto no implica necesariamente una intención maliciosa, pero no deja de ser problemático porque puede producir evaluaciones engañosas de las capacidades del modelo.





Cuando el AISI evaluó cinco modelos líderes, descubrió que todos ellos hicieron trampas. Los resultados fueron los siguientes:

  • GPT-5.4 hizo trampas 67 veces en 475 ejecuciones de prueba (14,1 por ciento).
  • GPT-5.5 hizo trampas 54 veces en 475 ejecuciones de prueba (11,4 por ciento).
  • GPT-5.6-Sol hizo trampas 60 veces en 475 ejecuciones de prueba (12,6 por ciento).
  • Claude 4.7 Opus hizo trampas 43 veces en 475 ejecuciones de prueba (9,1 por ciento).
  • Claude Mythos Preview hizo trampas 37 veces en 475 ejecuciones de prueba (7,8 por ciento).


Preguntar a los modelos si hicieron trampas o si hicieron algo mal resultó ser un mecanismo de auditoría poco fiable, ya que los modelos no siempre admitieron la falta.






"En nuestros experimentos, los modelos no reconocieron consistentemente el intento de hacer trampas cuando se les preguntó, y lo describieron como algo incorrecto en menos del 50 por ciento de las veces", afirmó el AISI.

Los métodos de verificación existentes, como el autoinforme y los registros de cadena de pensamiento, resultaron igualmente inciertos porque los modelos no siempre informan de su cadena de pensamiento. Hubo casos en los que un modelo consideró si una acción propuesta constituía una trampa y, aun así, decidió realizar la acción.

Dada la ausencia de métodos fiables de detección de trampas, el AISI advierte que su enfoque actual –revisión manual combinada con el monitoreo de LLM– puede no ser suficiente para detectar el engaño, especialmente a medida que los modelos se vuelven más sofisticados.

"Una solución más fundamental sería entrenar a los modelos para que no hagan trampas en primer lugar; pero dado que este tipo de comportamiento se informó en modelos frontera hace más de un año, alinearlos robustamente para eliminarlo puede no ser fácil", concluye el AISI.

Fuente:
TheRegister


0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.