Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5951
)
-
▼
julio
(Total:
669
)
-
Gusano informático se infiltra en Copilot y desata...
-
Sospechan que CyberAv3ngers, vinculados a Irán, es...
-
Rusos roban claves de Signal para secuestrar cuent...
-
GOG Galaxy llega a Linux
-
eBay pagará 56 millones por acosar a periodistas
-
Phishing con IA ya no requiere malware: roba sesio...
-
Mejores lectores de eBooks para Linux
-
WhatsApp añade cifrado de extremo a extremo a llam...
-
Vulnerabilidad de 20 años permite controlar miles ...
-
Apple creará un iPad sumergible
-
Los primeros dispositivos de OpenAI: altavoz, smar...
-
Publican PoC para el bypass de autenticación explo...
-
Rusia acusa al CEO de Telegram, Pavel Durov, de ay...
-
Aparece un Intel Core i9-14901KE con únicamente 8 ...
-
Presunta brecha de datos en Revolut: dicen acceder...
-
Paquetes maliciosos de npm despliegan RAT contra d...
-
NVIDIA impulsa la Alianza Segura Open Source para ...
-
Filtración de datos en Bank of Baroda: accedieron ...
-
DEF CON prohíbe las gafas perversas al estilo de Meta
-
Botnet Tengu reinicia dispositivos Linux infectado...
-
Primer ciberataque de agente de IA autónomo infilt...
-
OpenAI libera Codex Security CLI para hallar y cor...
-
Vulnerabilidad crítica en Gitea permite ejecución ...
-
Puerta trasera en plugin Advanced Responsive Video...
-
Nuevo fallo de RCE en Gitea permite a redactores d...
-
Filtran cientos de chats de Claude por falta de in...
-
Fabricantes chinos lanzan portátiles con GPUs GeFo...
-
IA descubre zero-day en kernel de Linux para escal...
-
Radeon RX 9050: especificaciones
-
JFrog confirma que los modelos de OpenAI aprovecha...
-
Kimi K3: la IA china que desafía a OpenAI y Anthropic
-
PortSwigger lanza Burp AT Agentic AI para pruebas ...
-
Claude AI descifra esquema de prueba post-cuántica...
-
Estafadores fingen ser ShinyHunters para chantajea...
-
Investigadores: empresa fantasma china creó la red...
-
Nueva botnet Tengu Mirai reinicia tu IoT si intent...
-
Amodei niega querer prohibir la IA de código abierto
-
App del Vaticano expone a 700.000 usuarios por fal...
-
Filtración de datos en la firma de facturación méd...
-
Múltiples vulnerabilidades de FFmpeg permiten corr...
-
Botnet DDoS Dysphoria se extiende a 200.000 dispos...
-
Profesor atrapa a 32 alumnos copiando con IA media...
-
Microsoft afirma que su nuevo modelo de IA para ci...
-
Claude Opus 5 de Anthropic llega a AWS con mejoras...
-
Backups a tu NAS QNAP en 3 pasos: guía con HDP PC ...
-
Phineas Fisher, el hacker más famoso del mundo, si...
-
Fuga de Sandbox en n8n permite a editores de flujo...
-
Ubuntu 26.04 LTS impulsa la computación confidencial
-
Coca-Cola confirma robo de datos tras ataque de ra...
-
La botnet de IoT Dysphoria implementa C2 de blockc...
-
GitHub combate el malware
-
Alianza contra ciberataques de IA
-
El Explorador de Windows 11 borra archivos grandes...
-
Investigadores inician iOS 27 con jailbreak en iPh...
-
Fallo crítico de vBulletin permite ejecución remot...
-
Guía básica del SoC y su importancia
-
Bandas de ransomware atacan VPN de Palo Alto, Fort...
-
GitHub implementa periodo de espera de 3 días en D...
-
Movistar y Orange activan Starlink en zonas incend...
-
Zen 7 cerrará AM5 y Zen 8 ya se desarrolla
-
ChatGPT quiere que vincules tus datos de salud a s...
-
Fuga de datos en app del Papa
-
Fallo de AgentForger en ChatGPT permitiría despleg...
-
Ocho fallos de NodeBB permiten leer chats privados...
-
El precio de las tarjetas gráficas continúa subien...
-
Chats compartidos de Claude AI expuestos en Google
-
Ataques aprovechan vulnerabilidad RCE de Fastjson ...
-
OpenAI tardó diez días en informar a Hugging Face ...
-
AMD confirma que sus CPU EPYC «Florence» basadas e...
-
Europol identifica 4.340 URLs para su eliminación ...
-
SourTrade crea malware en navegadores para evadir ...
-
Hombre condenado a seis años de prisión por hackea...
-
Cómo los logs de infostealers impulsan filtracione...
-
Google lanza actualización urgente de Chrome por c...
-
Fallos de seguridad en cada script de ChatGPT, Cop...
-
Apache Syncope parchea vulnerabilidades de RCE e i...
-
Guías online para tus vacaciones
-
YouTube crea IA para miniaturas
-
CXMT ya se permite el lujo de cobrar más que Samsu...
-
PentesterFlow: IA para automatizar flujos de pente...
-
Qualcomm aumentará el precio de todos sus chips: l...
-
Microsoft eliminará dos funciones de Copilot el pr...
-
Cuatro novedades de WhatsApp
-
Vulnerabilidades de GitLab permiten ejecución remo...
-
Claude Code optimiza el desarrollo para iPhone
-
Se cumplen 20 años desde la compra de ATI Technolo...
-
Afiliados de Cl0p explotan vulnerabilidades de RCE...
-
Facebook sustituye el muro por vídeos
-
Facebook ofrece verificación gratuita a cambio de ...
-
OpenAI dividida por la regulación
-
Chrome permitirá guardar fotogramas de vídeos con ...
-
Los ladrones de memoria RAM desvalijan los ordenad...
-
Vulnerabilidad en juego Age of Empires II
-
Fallo en ChatGPT AgentForger permitiría desplegar ...
-
Exploit Certighost permite que usuarios de Active ...
-
Vulnerabilidad en Bing Images permite ejecutar cód...
-
Despliega agente de IA Hermes de forma autónoma pa...
-
Un gateway Wi-Fi comprometido puede redirigir a to...
-
Nueva vulnerabilidad HTTP/2 permite colapsar servi...
-
Las CPU AMD EPYC 9006 (Venice) son muy potentes: h...
-
Más de un tercio de las víctimas de ransomware vue...
-
Ciberdelincuentes aprovechan fallo en Windmill par...
-
Royal Ransomware usa Qbot y Cobalt Strike para com...
-
KDE refuerza su infraestructura PIM
-
Guía rápida de HDR en juegos y vídeos
-
Google lanza CodeMender para hallar y corregir vul...
-
Claude Opus 5: potente y más barato que Fable 5
-
TrickBot usa tráfico DNS como canal oculto para co...
-
GitHub reduce los pagos de su programa de recompen...
-
Nuevo malware Dolphin X roba credenciales de más d...
-
EEUU propone botón de apagado para la IA
-
Google añade videos selfie para recuperar cuentas ...
-
Fallo en Claude Cowork permite leer claves SSH y c...
-
Microsoft detecta 7.600 millones de phishing y el ...
-
Thermaltake AX 3200W: fuente de alimentación 80 PL...
-
Hackers usan GitHub Actions para atacar servidores...
-
Tuxedo OS y la seguridad en Debian
-
Microsoft ha liberado el código fuente de Comic Chat
-
Usan plugins de Notepad++ para comprometer sistema...
-
Filtran 160 millones de datos de clientes de Decat...
-
Rusos roban 90 días de correos vía Zimbra Zero-Day
-
NodeBB corrige ocho fallos detectados por IA que c...
-
Origin, proveedora energética australiana, informa...
-
Vulnerabilidad grave en el sistema de archivos de ...
-
Vulnerabilidad de Exim permite escalada de privile...
-
Next.js corrige nueve fallos de seguridad de SSRF,...
-
Musk creará película de La Odisea con Grok
-
Intel y AMD hacen caja con China: desde enero las ...
-
-
▼
julio
(Total:
669
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Revolut está siendo investigada luego de que unos hackers afirmaran estar vendiendo una base de datos con registros de más de 75 millones de...
-
Un profesor detectó que 32 de 35 alumnos copiaron usando IA al ocultar un prompt invisible en el examen .
-
ZedAxis ha creado un bloqueador de anuncios por hardware de 5 euros que filtra más de medio millón de dominios consumiendo solo 4 MB de m...
Agencia gubernamental británica detecta trampas con IA
El Instituto de Seguridad de IA del Reino Unido descubrió que los modelos de IA más avanzados suelen hacer trampas y mentir sobre ello para completar tareas. Todas las versiones probadas de GPT y Claude utilizaron atajos engañosos, demostrando que no admiten sus faltas ni son detectables mediante métodos sencillos. Esto genera evaluaciones erróneas sobre sus capacidades y resalta la necesidad de crear sistemas de monitoreo más robustos.
Los modelos de IA harán casi cualquier cosa para completar la tarea que se les pida, incluyendo hacer trampas para lograrlo, según las nuevas evaluaciones de ciberseguridad del Instituto de Seguridad de la IA (AISI) del gobierno del Reino Unido. El grupo descubrió que los modelos líderes a menudo toman atajos para lograr un resultado particular y luego tergiversan cómo obtuvieron dicho resultado. Y no siempre lo admiten cuando se les pregunta.
"Cada modelo que hemos probado para este comportamiento intentó hacer trampas", dijo el AISI en una publicación de blog aquí el martes. "Los modelos no informaron de manera fiable sobre este comportamiento cuando se les preguntó, y a menudo no razonaron sobre ello en su cadena de pensamiento, lo que sugiere que la detección de trampas probablemente requerirá métodos de monitoreo robustos".
Las infracciones incluyeron buscar la respuesta en Internet, eludir las restricciones de red del entorno aislado (sandbox), sondear el sistema de evaluación, atacar un sistema distinto al objetivo y adivinar una respuesta.
Trampas en los modelos de ia
Hacer trampas de esta manera –empleando una solución alternativa o manipulando una función de recompensa aquí para obtener una mejor puntuación en una prueba de referencia, por ejemplo – ha sido ampliamente documentado por investigadores del aprendizaje automático. El AISI señaló que esto no implica necesariamente una intención maliciosa, pero no deja de ser problemático porque puede producir evaluaciones engañosas de las capacidades del modelo.
Cuando el AISI evaluó cinco modelos líderes, descubrió que todos ellos hicieron trampas. Los resultados fueron los siguientes:
- GPT-5.4 hizo trampas 67 veces en 475 ejecuciones de prueba (14,1 por ciento).
- GPT-5.5 hizo trampas 54 veces en 475 ejecuciones de prueba (11,4 por ciento).
- GPT-5.6-Sol hizo trampas 60 veces en 475 ejecuciones de prueba (12,6 por ciento).
- Claude 4.7 Opus hizo trampas 43 veces en 475 ejecuciones de prueba (9,1 por ciento).
- Claude Mythos Preview hizo trampas 37 veces en 475 ejecuciones de prueba (7,8 por ciento).
Preguntar a los modelos si hicieron trampas o si hicieron algo mal resultó ser un mecanismo de auditoría poco fiable, ya que los modelos no siempre admitieron la falta.
"En nuestros experimentos, los modelos no reconocieron consistentemente el intento de hacer trampas cuando se les preguntó, y lo describieron como algo incorrecto en menos del 50 por ciento de las veces", afirmó el AISI.
Los métodos de verificación existentes, como el autoinforme y los registros de cadena de pensamiento, resultaron igualmente inciertos porque los modelos no siempre informan de su cadena de pensamiento. Hubo casos en los que un modelo consideró si una acción propuesta constituía una trampa y, aun así, decidió realizar la acción.
Dada la ausencia de métodos fiables de detección de trampas, el AISI advierte que su enfoque actual –revisión manual combinada con el monitoreo de LLM– puede no ser suficiente para detectar el engaño, especialmente a medida que los modelos se vuelven más sofisticados.
"Una solución más fundamental sería entrenar a los modelos para que no hagan trampas en primer lugar; pero dado que este tipo de comportamiento se informó en modelos frontera hace más de un año, alinearlos robustamente para eliminarlo puede no ser fácil", concluye el AISI.
Fuente:
TheRegister






Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.