Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6325
)
-
▼
August
(Total:
333
)
-
Detecta garrapatas con la cámara del móvil
-
Novedades de Python 3.15
-
Ciberatacantes aprovechan vulnerabilidad de VMware...
-
Venta de acciones de Intel por 20.000 millones int...
-
Nightmare-Eclipse lanza ShieldBreak: vulnerabilida...
-
Vulnerabilidad en APIs de OpenAI, Anthropic y Goog...
-
Asistentes de DEF CON habrían interferido el Wi-Fi...
-
Vulnerabilidad de Docker permite sobrescribir arch...
-
Vulnerabilidades de Zoom permiten secuestrar dispo...
-
Ransomware Gunra aprovecha fallos de Fortinet y Sc...
-
La botnet Kimwolf v7 para Android camufla el tráfi...
-
VPN de FortiGate vulnerada abre paso a ataque cont...
-
Chinos usan página falsa de DeepSeek para distribu...
-
Carga de coches eléctricos: el 25% de los puntos n...
-
Musk lanza IA autónoma 24/7
-
Microsoft corrige 398 vulnerabilidades, incluyendo...
-
DeadLock Ransomware usa Polygon para evitar ser de...
-
Recuperado diseño original del Intel 8080
-
Nemotron 3.5 Lightning acelera la IA en RTX
-
Vulnerabilidad de 18 años en SCTP de Linux permite...
-
Los precios de las tarjetas gráficas aumentan hast...
-
Linux 7.2-rc7: Linus Torvalds critica el impacto d...
-
OpenAI amplía Daybreak Cyber con GPT-5.6 para vali...
-
Robo de datos en Valve afecta a usuarios de Steam ...
-
Anthropic añadirá marcas de agua invisibles a Clau...
-
Vulnerabilidades de ClamAV permiten ataques DoS re...
-
Ciberataque a central eléctrica polaca: acceden a ...
-
Phishing vía WhatsApp usa certificados SSL/TLS con...
-
ChatGPT ya reserva restaurantes
-
Los SSD PCIe 5.0 quedan retratados en gaming: 11 j...
-
Filtración de datos de CEVA Logistics afecta a com...
-
Mozilla revoca claves de Firefox y Thunderbird tra...
-
Extensión falsa de Google Translate permite contro...
-
ChatGPT ya reserva mesas por ti
-
GitHub amplía detección de malware de npm a 8 regi...
-
GPT-5.6-Cyber: el modelo de OpenAI contra el hacking
-
QNAP QSW-M2130-4C2S24T: velocidad 10G real y gesti...
-
Prueba Direct Die Jet en una CPU y una GPU echando...
-
Vulnerabilidad en WalletService de Windows permite...
-
Buscan explotar vulnerabilidades de VMware VCenter
-
Zuckerberg quiere masificar la super IA
-
Vulnerabilidad de Red Hat ACM permite acceso total...
-
ChatGPT detecta fallos de seguridad antes que los ...
-
Claude Code pasa de aprobación humana a modo autom...
-
OpenAI frena su IA por peligrosidad
-
OpenAI lanza ChatGPT 5.6 Cyber, disponible solo pa...
-
AMD mejora la calidad de las Radeon RX 7000 con FS...
-
Alerta: Explotan activamente un fallo crítico en L...
-
Jailbreak Dopamine 3.0 para iOS 26
-
Condenan a prisión a miembro de The Com por chanta...
-
Ransomware: atacan a gerentes para robar datos y p...
-
Framework sufre pérdida de datos de clientes por a...
-
iPhone 18 Pro: todo lo que sabemos
-
Chrome y Edge usarán 20 GB para IA en Windows 11
-
En España el Ministerio de Consumo retira seis mod...
-
Vlneran TrueConf para infiltrar puertas traseras e...
-
Word de 1990 llega a Windows 11
-
Kimsuky usa LLM locales, señuelos con IA y C2 de G...
-
PS6 usará tecnología de GPU de NVIDIA RTX 40
-
Phishing AiTM de Payroll Pirates roba sesiones de ...
-
Agente IA OpenClaw usa API de gimnasio para robar ...
-
Memorias PC: precios récord en 20 años
-
Claude Code crea túneles inversos y persistencia e...
-
Intel y AMD vuelven a caer ante Spectre con TONTOU...
-
Potencia de la GPU de Xbox Project Helix
-
Vulnerabilidad Zero-Day en Metabase permite acceso...
-
Spotify en la terminal de Linux
-
World Flight Sim: un inmersivo simulador de vuelo ...
-
El nuevo modelo Astra de OpenAI demuestra un rendi...
-
CachyOS renueva herramientas y lanza edición servidor
-
WhatsApp traerá fondos animados a Android
-
Chrome renuncia al diseño Mica de Windows 11
-
ChatGPT creará stickers para WhatsApp
-
Google Maps integra IA para gestionar reservas y p...
-
Apple prepara tres nuevos productos Ultra para 2027
-
WenWare: un juego para ubicar escenas fotográficas...
-
Filtración de datos de Levi Strauss: acceden a sus...
-
HTTP Terminator: IA para analizar HTTP
-
Centro de datos de Amazon será el más contaminante
-
CVE-2026-64561 Zapscape permite a invitados KVM es...
-
En Japón, las tiendas de informática comienzan a v...
-
App de clima de Windows 11 usaría 1.2GB de RAM
-
Nuevo ataque de cadena de suministro de WordPress ...
-
Fallo XSS2Shell de WordPress permite ejecución rem...
-
Apple corrige fallo crítico en macOS
-
Claude Opus 5 reduce el éxito de ataques de inyecc...
-
Optimiza Windows para jugar mejor
-
Kimi K3 se escapa de sus pruebas
-
Windows encarece sus licencias
-
La potente APU Intel Nova Lake para gaming: CPU de...
-
Otaku detenida por fraudes en devoluciones online
-
Nueva vulnerabilidad XSS en WordPress podría permi...
-
Google sacrifica la IA por el hardware
-
La IA degrada Internet y genera desconfianza
-
Levi Strauss & Co. informa que robaron datos corpo...
-
Atlassian Rovo es vulnerable y podría filtrar dato...
-
Una empresa prefiere destruir 100 MacBook Pro M4 c...
-
Ataques de bomba CSS convierten correos maliciosos...
-
Vulnerabilidad 0-day de Metabase explotada para ob...
-
Ray tracing: la clave entre PC y consolas
-
SK Hynix invierte 54 billones de wones en dos fábr...
-
Disney Plus prueba IA de recomendaciones
-
Intel recupera HDMI 2.1 en Linux
-
Fallo de 18 años en SCTP de Linux permitiría a usu...
-
Quake Dawn of the Machine: expansión gratuita y du...
-
Ahora son los inversores de Samsung y SK hynix los...
-
Más de 4.400 PLCs de Rockwell expuestos ponen en r...
-
Modelo de IA de Meta vulnera empresa durante un te...
-
Ataques de ClickFix despliegan infostealer en macO...
-
Google Maps permitirá pagos con IA
-
Fallos en plataformas Java permiten ejecución remo...
-
Vulnerabilidades en Claude Code y Gemini CLI permi...
-
Un chino está vendiendo en eBay RTX 2080 Ti modifi...
-
Microsoft ya no recomienda 32 GB de RAM para juego...
-
Ocultan toolkit de control remoto en Oracle para t...
-
Fallos críticos en agentes de código de Anthropic,...
-
Usan servidores WSUS para distribuir malware en em...
-
Filtración en SharePoint del gobierno suizo compro...
-
SilverFox usa software y controladores confiables ...
-
Texas frena centros de datos por falta de energía ...
-
OpenAI amplía GPT-5.6 a usuarios gratuitos y Go co...
-
DuckDuckGo lanza gafas inútiles que se agotan
-
Kroah-Hartman y Torvalds chocan por la IA en Linux
-
Multa de 10.000 euros por 46 segundos de spam
-
Publicado PoC para vulnerabilidad Use-After-Free e...
-
OpenAI Astra resuelve enigmas matemáticos históricos
-
Samsung promete 8 veces el rendimiento y 10 veces ...
-
Nueva vulnerabilidad de OVSwrap en Linux permite a...
-
-
▼
August
(Total:
333
)
Blogroll
Labels
Entradas populares
-
Kioxia y Sandisk presentan la memoria BiCS10 QLC , la NAND Flash más densa de la industria con 332 capas y una capacidad de 2 Tb por chip...
-
Nueva herramienta de código abierto permite escuchar Spotify desde la terminal de Linux y otros sistemas para reducir el consumo de RAM . ...
-
Una empresa tecnológica ha decidido destruir más de 100 MacBook Pro M4 con 48 GB de RAM , a pesar de ser equipos modernos y plenamente funci...
Vulnerabilidad en APIs de OpenAI, Anthropic y Google expone razonamientos ocultos
Un fallo arquitectónico significativo en la forma en que los principales proveedores de IA, incluidos OpenAI, Anthropic y Google, protegen el razonamiento interno de "cadena de pensamiento" generado por sus modelos de lenguaje extensos (LLM) insignia.
La investigación revela que los sobres de razonamiento cifrados devueltos por las API de los proveedores pueden ser replicados en modelos hermanos más débiles y menos protegidos para extraer trazas de razonamiento privado en texto plano.
Detallado por un equipo de investigación colaborativo del Instituto ELLIS de Tubinga, el Instituto Max Planck, MATS Research y Snyk, el ataque afecta a los ecosistemas de modelos Claude, GPT y Gemini, y requiere únicamente un acceso estándar y no privilegiado a la API.
El fallo de las API expone trazas de razonamiento ocultas
Las arquitecturas de razonamiento modernas, como GPT-5.6, Claude Opus 4.8 y Gemini 3, construyen trazas de procesamiento de cadena de pensamiento ocultas antes de devolver una respuesta final.
Debido a que estos pensamientos internos contienen propiedad intelectual comercial y controles de seguridad, los proveedores no los entregan en texto plano.
En su lugar, las API transmiten la traza de razonamiento como un sobre cifrado y codificado en base64 que la aplicación cliente devuelve en llamadas posteriores para mantener el contexto conversacional de múltiples turnos sin requerir el almacenamiento de estado en el servidor.
Sin embargo, los investigadores descubrieron que estas cargas útiles cifradas se autentican utilizando una clave global de todo el proveedor, en lugar de estar vinculadas criptográficamente a una cuenta de usuario, ID de sesión o nivel de modelo específico.
Debido a que las firmas criptográficas carecen de una vinculación específica al modelo, un sobre cifrado creado por un modelo insignia fuertemente protegido puede pasarse legalmente a cualquier otro modelo alojado bajo la infraestructura del mismo proveedor.
Explotar tales brechas de implementación tan generalizadas demuestra cómo las vulnerabilidades de seguridad de API no mitigadas pueden comprometer servicios en la nube sensibles. La cadena de ataque opera utilizando modelos más ligeros y económicos como oráculos de descifrado.
Un adversario captura un bloque de razonamiento cifrado emitido por un modelo de vanguardia (como Claude Opus 4.8) y lo inyecta en la llamada a la API de un modelo más pequeño (como Claude Haiku 4.5), instruyendo al modelo más pequeño para que transcriba el pensamiento interno palabra por palabra dentro de etiquetas de texto personalizadas.

Debido a que los modelos más ligeros carecen de la agresiva alineación anti-destilación y las barreras de seguridad impuestas en los niveles insignia, estos cumplen con la instrucción y muestran el razonamiento oculto en texto plano.
Como se detalla en el artículo de investigación publicado en ArXiv, el equipo confirmó una compatibilidad cross-modelo idéntica en la familia GPT-5.6 de OpenAI y la línea Gemini 3 de Google.
Los investigadores validaron la precisión matemática de las trazas recuperadas comparando la longitud de los tokens decodificados con los recuentos de tokens de pensamiento facturables reportados por las API de los proveedores.
Las implicaciones de seguridad en el mundo real van mucho más allá de la destilación de modelos o el robo de propiedad intelectual. Al analizar 6,708 transcripciones de agentes públicos extraídas de GitHub y Hugging Face, los investigadores decodificaron 315,320 bloques de razonamiento integrados, recuperando:
- 367 artefactos de Información de Identificación Personal (PII)
- 182 credenciales hardcodeadas (incluyendo 62 claves de API, 33 contraseñas y 30 direcciones de correo electrónico personales)
Crucialmente, gran parte de estos datos sensibles residían únicamente dentro de los bloques de razonamiento internos y nunca se renderizaron en las respuestas visibles del asistente, dejando a los desarrolladores sin saber que sus registros de sesión compartidos contenían secretos expuestos.

Además, la vulnerabilidad permite ataques invisibles de inyección indirecta de prompts contra agentes de IA autónomos. Un adversario puede diseñar instrucciones maliciosas dentro de un bloque de razonamiento cifrado.
Cuando un agente las procesa, las herramientas de monitoreo que inspeccionan solo el historial de conversación visible no logran detectar la carga útil oculta, permitiendo que las instrucciones inyectadas comprometan los flujos de trabajo agenticos posteriores sin ser detectadas.
| Proveedor | Modelo Insignia de Origen | Oráculo de Descifrado Objetivo | Activo Extraído / Riesgo |
| Anthropic | Claude Opus 4.8 / Sonnet 5 | Claude Haiku 4.5 | Cadena de pensamiento no alineada, prompts del sistema, claves de API |
| OpenAI | GPT-5.6 / GPT-5 | GPT-5-mini / o4-mini | Evaluación de seguridad interna, credenciales, razonamiento bruto |
| Gemini 3 / Gemini 3.1 Pro | Gemini 3.1 Flash Lite / Flash | Secretos hardcodeados, instrucciones ocultas, PII |
Tras una divulgación responsable, OpenAI, Anthropic y Google reconocieron los hallazgos de la investigación. Los tres proveedores implementaron mitigaciones en el lado del servidor, haciendo que las pruebas de concepto (PoCs) originales de replicación cross-modelo ya no sean reproducibles en las versiones actuales de la API.
Para establecer controles integrales de seguridad de IA Generativa en las tuberías de LLM, los proveedores y desarrolladores empresariales deberían implementar las siguientes protecciones:
- Vinculación Criptográfica: Vincular los sobres de razonamiento al modelo de origen específico, al ID de sesión y a la identidad del usuario en la capa de la puerta de enlace de la API.
- Aislamiento Estricto de Modelos: Rechazar bloques de pensamiento enviados a un nivel de modelo diferente al que generó la carga útil.
- Rotación de Claves: Rotar las claves de firma heredadas para invalidar los bloques de texto cifrado históricos expuestos en repositorios de código públicos.
- Saneamiento de Registros: Los equipos de desarrolladores que construyan agentes de IA deben tratar los bloques de pensamiento cifrados como datos sensibles y limpiar los campos de firma bruta antes de hacer públicos los registros del agente.
Fuentes:
https://cybersecuritynews.com/top-ai-models-apis-flaw-exposes-hidden-reasoning/
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.