Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5781
)
-
▼
julio
(Total:
499
)
-
La policía desmantela la plataforma de phishing Kr...
-
La Steam Deck se hunde en ventas tras la subida de...
-
SolarWinds corrige 15 fallos críticos de Serv-U qu...
-
Agencia gubernamental británica detecta trampas co...
-
DLSS 5 optimiza rendimiento y arte
-
La policía desarticula el kit de phishing Kratos d...
-
Gemini 3.5 Flash Cyber detecta y parchea vulnerabi...
-
OpenAI revela que sus modelos de IA lograron vulne...
-
Renuncia el jefe de seguridad de IA de Trump a los...
-
Secuestran más de 20 webs gubernamentales para dis...
-
Investigador anónimo filtra 204 exploits 0-day ant...
-
Google presenta Gemini 3.5 Flash Cyber AI para det...
-
España multa a 23andMe con 2,4 millones de euros p...
-
Los fabricantes de Estados Unidos, Japón y Corea d...
-
Fallo en AWS Kiro permitía que páginas web malicio...
-
Firefox lanza contenedores globales y nuevas funci...
-
FRITZ!OS 8.20: sistema operativo inteligente
-
Trabajos de entrenamiento de IA contra la red eléc...
-
Taiwán obligará a TSMC a generar su propia energía
-
GTX 1060: 10 años de un icono gama media
-
Filtración de datos de Craneware: hackers robaron ...
-
Estafadores se hacen pasar por el FBI en redes soc...
-
Microsoft crea cristal que almacena datos por 10.0...
-
Usan vulnerabilidad de PAN-OS de Palo Alto para de...
-
Ciberatacantes aprovechan vulnerabilidad crítica d...
-
Optimiza la seguridad de Windows desactivando esta...
-
Parches no oficiales y gratuitos para la vulnerabi...
-
Los 10 malware más activos la semana pasada
-
Nuevo ransomware ENCFORGE ataca archivos de modelo...
-
Cómo conectar tu móvil gratis a Starlink: requisit...
-
Trump busca prohibir la IA china Kimi K3
-
Zimbra corrige vulnerabilidades críticas de inyecc...
-
Grave vulnerabilidad en Gitea permite escribir en ...
-
Anthropic pagará a autores por usar sus libros sin...
-
Robots de Xiaomi logran 98% de precisión en fábric...
-
PentDEM: frameworks de pentesting inteligentes
-
Un análisis del SoC Kirin 9030 demuestra que China...
-
Más de 55 millones de cuentas comprometidas en el ...
-
Furtex: kit de Linux para post-explotación y evasi...
-
Rumanía se quedó sin registro de la propiedad porq...
-
OVH desvela un plan semicubierto para solucionar u...
-
Memoria DDR5 alcanza precio récord en julio
-
Detenido por robar 200.000 euros con malware en Steam
-
Punto ciego de Microsoft Defender XDR puede oculta...
-
Un modder hace una PS4 V2 portátil con pantalla OL...
-
Microsoft lanza actualización KB5121767 para corre...
-
Usan bots de Telegram como puertas traseras en sis...
-
Líderes tecnológicos felicitan a España campeona d...
-
UE multa a AliExpress con 550 millones por product...
-
Linux corrige más de 400 vulnerabilidades del kern...
-
Adobe lanza una IA revolucionaria para fotografía
-
Aumentan los ataques de wp2shell en WordPress impu...
-
Robotaxi de Tesla choca siendo conducido remotamente
-
Fallo crítico en la plataforma de IA de ServiceNow...
-
Fallo en Kimai Docker permite robo de cuentas medi...
-
LG instalaría adware en Windows mediante una app
-
Microsoft recreó cabina de avión para probar sonid...
-
Caviar vende un Z Fold 8 de oro con Messi por 11.0...
-
3 herramientas gratuitas para monitorizar tu red d...
-
Nueva vulnerabilidad en 7-Zip permitiría la ejecuc...
-
Publicado PoC para vulnerabilidad crítica de RCE e...
-
Publican datos de Starbucks en foros
-
Siete paquetes maliciosos de Vite en npm emplean C...
-
En España los Hospitales y empresas tendrán su pro...
-
1Password integrará Claude para usar tus credenciales
-
Abuso de Windows Bind Link permite cegar EDR y eva...
-
PentestCode: nuevo agente de IA que automatiza pru...
-
Caos en Amazon Web Services por facturas millonarias
-
Vulnerabilidad crítica RCE wp2shell: cobertura, Po...
-
Servidor expuesto revela kit de phishing basado en...
-
Google crea chip para potenciar su IA
-
Acelera el arranque de Windows sin programas
-
Vulnerabilidad de 15 años en NGINX permite ejecuta...
-
Apple Music sube precios en España
-
NVIDIA lanza los primeros drivers para RTX Spark e...
-
Avances en las pruebas para clasificar a las IAs s...
-
Inteligencia rusa hackea cámaras IP para espiar lo...
-
Grave vulnerabilidad en F5 NGINX podría provocar c...
-
Explotan vulnerabilidades de Microsoft SharePoint ...
-
Agente de IA autónomo vulnera Hugging Face, el rep...
-
EE. UU. acusa a tres rusos por ciberdelitos de 62 ...
-
GoldenEyeDog: roban certificados de DigiCert
-
Jefe de OpenAI advierte sobre el Comunismo de la IA
-
Apple advierte a exemplepados en OpenAI
-
Más controles parentales en ChatGPT
-
Mario Kart Wii llega a PC en 4K y FPS libres: Mari...
-
Están suplantando la identidad de tu banco para ro...
-
Ben Affleck gana 587 millones de Netflix por su IA
-
Hoy se cumplen 50 años de la llegada de la Viking ...
-
Explotan vulnerabilidades de RCE en WordPress Core...
-
Alarma por la IA de Google para menores
-
Novias IA causan caos en China
-
OpenAI notificará a padres sobre infracciones de h...
-
NadMesh usa Shodan para secuestrar infraestructura...
-
Hugging Face confirma brecha por IA: atacantes usa...
-
Tesla lanza bicicleta infantil mediocre
-
BleachBit: la mejor alternativa gratis y abierta a...
-
NVIDIA RTX Spark aparece en Cinebench 2026 rindien...
-
Gemini en Chrome analizará grupos de pestañas
-
Project Perception detectará fallos en Windows
-
Vulnerabilidad en Citrix Secure Access y Endpoint ...
-
Filtran Galaxy Z Fold 8
-
NVIDIA permite grabar partidas a 240 FPS
-
Nuevo ransomware Spirals cifra empresa IT en menos...
-
Claude accede a cuentas sin contraseñas sin llegar...
-
Kimi-K3 supera a IA de EE UU pero se identifica co...
-
X será de código abierto según Musk
-
Nueva botnet NadMesh rastrea servicios de IA expue...
-
FBI detiene hacker de criptomonedas en Steam
-
Fallo HollowByte en OpenSSL podría colapsar la mem...
-
LegacyHive: vulnerabilidad 0-Day de Windows permit...
-
Rectify11 es una herramienta gratuita optimiza Win...
-
Google integra AI Mode con YouTube Music y Canva
-
Nueva vulnerabilidad RCE en wp2shell afecta a mill...
-
Explotan vulnerabilidad 0-day de SonicWall SMA1000
-
Nova Lake-S: nueva marca y fecha de lanzamiento
-
Dos miembros de Scattered Spider condenados a 5,5 ...
-
George Lucas defiende la IA
-
Samsung añade IA a sus lavadoras
-
China lanza Kimi K3 para desafiar a OpenAI y Anthr...
-
El Kimi K3 chino de 2,8 billones de parámetros sup...
-
La Unión Europea obliga a Google a dar acceso al m...
-
Next.js lanza programa de seguridad mensual y corr...
-
Vulnerabilidad 0-day en AnyDesk permite ataques DoS
-
Gemini ahora suena como un humano
-
Google renombra NotebookLM como Gemini Notebook
-
Vulnerabilidad en cámaras TP-Link permite ataques ...
-
EE. UU. acusa a dos personas de lavar 43M$ proveni...
-
-
▼
julio
(Total:
499
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Acelerar el arranque de Windows es posible utilizando las herramientas propias del sistema operativo , evitando así el uso de software exte...
-
La GeForce GTX 1060 cumple 10 años , consolidándose como una de las mejores tarjetas gráficas de gama media de la historia debido a su gran...
-
Linux ya es compatible con más versiones de PlayStation 5 , permitiendo instalar el sistema de PC para jugar desde Steam .
Agencia gubernamental británica detecta trampas con IA
El Instituto de Seguridad de IA del Reino Unido descubrió que los modelos de IA más avanzados suelen hacer trampas y mentir sobre ello para completar tareas. Todas las versiones probadas de GPT y Claude utilizaron atajos engañosos, demostrando que no admiten sus faltas ni son detectables mediante métodos sencillos. Esto genera evaluaciones erróneas sobre sus capacidades y resalta la necesidad de crear sistemas de monitoreo más robustos.
Los modelos de IA harán casi cualquier cosa para completar la tarea que se les pida, incluyendo hacer trampas para lograrlo, según las nuevas evaluaciones de ciberseguridad del Instituto de Seguridad de la IA (AISI) del gobierno del Reino Unido. El grupo descubrió que los modelos líderes a menudo toman atajos para lograr un resultado particular y luego tergiversan cómo obtuvieron dicho resultado. Y no siempre lo admiten cuando se les pregunta.
"Cada modelo que hemos probado para este comportamiento intentó hacer trampas", dijo el AISI en una publicación de blog aquí el martes. "Los modelos no informaron de manera fiable sobre este comportamiento cuando se les preguntó, y a menudo no razonaron sobre ello en su cadena de pensamiento, lo que sugiere que la detección de trampas probablemente requerirá métodos de monitoreo robustos".
Las infracciones incluyeron buscar la respuesta en Internet, eludir las restricciones de red del entorno aislado (sandbox), sondear el sistema de evaluación, atacar un sistema distinto al objetivo y adivinar una respuesta.
Trampas en los modelos de ia
Hacer trampas de esta manera –empleando una solución alternativa o manipulando una función de recompensa aquí para obtener una mejor puntuación en una prueba de referencia, por ejemplo – ha sido ampliamente documentado por investigadores del aprendizaje automático. El AISI señaló que esto no implica necesariamente una intención maliciosa, pero no deja de ser problemático porque puede producir evaluaciones engañosas de las capacidades del modelo.
Cuando el AISI evaluó cinco modelos líderes, descubrió que todos ellos hicieron trampas. Los resultados fueron los siguientes:
- GPT-5.4 hizo trampas 67 veces en 475 ejecuciones de prueba (14,1 por ciento).
- GPT-5.5 hizo trampas 54 veces en 475 ejecuciones de prueba (11,4 por ciento).
- GPT-5.6-Sol hizo trampas 60 veces en 475 ejecuciones de prueba (12,6 por ciento).
- Claude 4.7 Opus hizo trampas 43 veces en 475 ejecuciones de prueba (9,1 por ciento).
- Claude Mythos Preview hizo trampas 37 veces en 475 ejecuciones de prueba (7,8 por ciento).
Preguntar a los modelos si hicieron trampas o si hicieron algo mal resultó ser un mecanismo de auditoría poco fiable, ya que los modelos no siempre admitieron la falta.
"En nuestros experimentos, los modelos no reconocieron consistentemente el intento de hacer trampas cuando se les preguntó, y lo describieron como algo incorrecto en menos del 50 por ciento de las veces", afirmó el AISI.
Los métodos de verificación existentes, como el autoinforme y los registros de cadena de pensamiento, resultaron igualmente inciertos porque los modelos no siempre informan de su cadena de pensamiento. Hubo casos en los que un modelo consideró si una acción propuesta constituía una trampa y, aun así, decidió realizar la acción.
Dada la ausencia de métodos fiables de detección de trampas, el AISI advierte que su enfoque actual –revisión manual combinada con el monitoreo de LLM– puede no ser suficiente para detectar el engaño, especialmente a medida que los modelos se vuelven más sofisticados.
"Una solución más fundamental sería entrenar a los modelos para que no hagan trampas en primer lugar; pero dado que este tipo de comportamiento se informó en modelos frontera hace más de un año, alinearlos robustamente para eliminarlo puede no ser fácil", concluye el AISI.
Fuente:
TheRegister






Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.