Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7492
)
-
▼
septiembre
(Total:
750
)
-
Project Helix superará a PS6 en potencia y precio
-
Agentes de IA intentaron hackear webs públicas al ...
-
Vulnerabilidades sin parchear en OnePlus permiten ...
-
Gemini hace llamadas por ti
-
Malware MacSync roba criptomonedas y contraseñas e...
-
Amazon: activa las claves de acceso
-
DeepSeek agota stock de RTX 5090 en China
-
SMS fraudulentos persisten en DIGI
-
Microsoft confirma error de Windows 11 que causa p...
-
PNY niega la garantía de una RTX 5090 quemada por ...
-
Actualización falla en neveras inteligentes y arru...
-
IA expone miles de fraudes en LinkedIn
-
Australia acusa a OpenAI de hackear su salud pública
-
Microsoft busca crear juegos infinitos
-
Gemini 3.8 Flash TTS: voces IA y clonación rápida
-
Vulnerabilidad en Elementor para WordPress permite...
-
Gemini 4: pistas sobre su llegada
-
Microsoft quita marca Copilot Plus PC
-
Errores críticos de GitLab permiten ejecutar códig...
-
Asus confirma filtración de datos de eShop con ped...
-
Vulnerabilidad Comment2Shell permite controlar sit...
-
Robo de 351,6 millones de dólares de Bitget
-
IA: programadores trabajan más para validar código...
-
GPT-6: más capacidad a menor costo
-
Extensión de Firefox roba sesiones de Google disfr...
-
Agente de OpenAI elude los controles del portal de...
-
Microsoft renueva Surface básicas
-
Una filtración de correos de GitLab permite que cu...
-
Actualización de Apache Tomcat corrige fallos de W...
-
Ciberatacantes aprovechan la vulnerabilidad CVE-20...
-
Cloudflare soluciona un fallo que permitía a un co...
-
Arista corrige vulnerabilidad zero-day explotada e...
-
China lanza satélite con IA propia
-
EvilTokens: el kit de phishing que convirtió el in...
-
Claude Opus 5.5 vs GPT-6 Sol: guerra de precios
-
NVIDIA ha invertido en una startup que quiere mina...
-
Malware de Windows utiliza el voto de hasta cuatro...
-
Apple diseña un wearable sin pantalla
-
Los dominios desaparecen, pero la infraestructura ...
-
NVIDIA corrige fallos en Linux que exponían inform...
-
Sega casi elimina a Sonic
-
Menú avanzado de Windows 11
-
PC de 14.000$ con un 9800X3D y RTX 5080) es totalm...
-
Malware en herramientas de desarrollo convierte pr...
-
Condenan a 24 meses de prisión a integrante del ra...
-
Alguien entró en la tienda online de ASUS para lle...
-
Aprovechan un fallo crítico de Roundcube para lanz...
-
App falsa de streaming convierte Androids en dispo...
-
Llegan los Snapdragon 8 Elite Gen 6
-
Vulnerabilidad en GitLab permite insertar código e...
-
MikroTrick Chain permite a los atacantes controlar...
-
Chinos usan diversas tecnologías para robar datos ...
-
Googlebook OS: el nuevo sistema híbrido de Google
-
Grok 4.7 supera a GPT-5.6
-
Cómo reducir los puntos ciegos del Shadow IT con W...
-
Nuevo backdoor TASK#STOMP usa PowerShell para roba...
-
Fallos en ZTE SmartLife permiten secuestrar cuenta...
-
Explotan vulnerabilidad 0-day en servidor de gesti...
-
Microsoft desmantela EvilTokens, el servicio de ph...
-
Norcoreanos infectan 30.000 PC con falsas entrevis...
-
Fallos críticos de IBM FTM permiten ejecutar códig...
-
Fallo crítico de ManageEngine permite acceso SYSTE...
-
Fallos críticos de SolarWinds permiten ejecución r...
-
Malware de WordPress usa plugin oculto y C2 de blo...
-
F5 soluciona vulnerabilidad zero-day en BIG-IP APM...
-
Demandan a gigantes de IA por pactar freno tecnoló...
-
Claude Opus 5.5: más seguro y económico
-
OpenAI lanza GPT-6 Sol y Luna
-
Router ASUS ROG Rapture GT-BN98 con Wi-Fi 8 y puer...
-
Policía británica detiene a dos sospechosos de Evi...
-
Putin vota usando Windows 10
-
Fallo en AWS Lambda permite saltar permisos IAM y ...
-
Fallo crítico en Next.js permite RCE mediante arch...
-
Nueva vulnerabilidad de cPanel permite acceder a c...
-
IA autónoma hackea tiendas por 25$ y roba 600.000 ...
-
Z.ai se disculpa por usar tu código y libera ZCode...
-
Grave vulnerabilidad en ImageResponse de Next.js p...
-
ShinyHunters afirma haber hackeado al FBI y robado...
-
CAIRN: nueva herramienta para rastrear malware de ...
-
Famosos suecos promueven la mala educación para co...
-
Ciberataque expone datos de 3,2 millones de usuari...
-
Vulnerabilidad en Linux KVM/arm64 permite escapar ...
-
Vulnerabilidad crítica de WordPress permite ejecut...
-
Fallo en Microsoft SharePoint permite ejecutar cód...
-
Claude Opus 5.5: más potente, rápido y barato
-
Chrome 154 corrige 108 vulnerabilidades, incluidas...
-
Windows 11 añade opción instalación Cloud Rebuild
-
NTDS.dit para extraer hashes de Active Directory y...
-
Bombas de contexto engañan a agentes de IA Qwen pa...
-
RTX 60 podrían doblar memoria de RTX 50
-
Roban 18.566 registros gubernamentales y claves me...
-
Fallo de COM en Windows permite obtener privilegio...
-
Ubuntu 26.10 revoluciona su gestión de memoria
-
Aikido Security lanza Altar-1, IA de pesos abierto...
-
Segundo año de DORA: ¿es capaz su SOC de detectar ...
-
Fallo en Red Hat OpenShift permite saltar chequeos...
-
Vulnerabilidad de Veeam Agent explotado para obten...
-
Amazon bloquea a la IA de Meta
-
MediaTek Dimensity CX C10 Max: el SoC de 8 Cores p...
-
ShinyHunters admite hackeo al FBI: 'NO tiene motiv...
-
Plan IA360: el impulso a la IA en España
-
Muse de Meta supera a Gemini y ChatGPT en descargas
-
Vidar Malware cambia su ofuscación en cada versión...
-
Router D-Link con fallo crítico exploitable remota...
-
RTX 20: 8 años de vanguardia
-
CISA insta a agencias federales a corregir vulnera...
-
Novedades del Meta Connect
-
Vulnerabilidad en Muse AI de Meta permite secuestr...
-
Ubuntu 26.10 optimiza la gestión de memoria
-
Sánchez lanza el plan IA360 y critica a las tecnol...
-
El nuevo jefe de hardware de Apple opina que usar ...
-
Un ajuste oculto de Meta Muse podría permitir que ...
-
Rockstar limitará los mods en GTA VI
-
MSI utiliza pegamento para prevenir que los conect...
-
Explotan vulnerabilidades en Zyxel y Veeam para ob...
-
AWS aísla claves IAM filtradas en GitHub en 10 seg...
-
Claude Code borró a un programador 48.000 archivos...
-
Cookies de ChatGPT rastrean usuarios en webs de te...
-
Alerta por falso GPT-6 Astra
-
Una GeForce RTX 5080 pasa a mejor vida tras usar e...
-
Ransomware PAYLOAD secuestra GPO de Active Directo...
-
iPhone 18 Pro: iFixit revela mejoras
-
Gana hasta 15.000 euros alquilando tu rostro a la IA
-
Analista de Google se infiltra en banda de TeamPCP
-
Claude Opus 5 ayuda a convertir fallo de imágenes ...
-
RansomHouse lanza un ataque contra el sistema de d...
-
Usan blockchain para robar claves bancarias y códi...
-
Microsoft Entra ID bloqueará inicios de sesión por...
-
-
▼
septiembre
(Total:
750
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
2004
)
seguridad
(
1902
)
software
(
1247
)
hardware
(
984
)
google
(
812
)
Malware
(
711
)
privacidad
(
691
)
exploit
(
591
)
ransomware
(
549
)
Windows
(
521
)
android
(
497
)
linux
(
460
)
cve
(
380
)
nvidia
(
339
)
tutorial
(
300
)
manual
(
282
)
hacking
(
272
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
143
)
Wifi
(
131
)
app
(
131
)
programación
(
126
)
cifrado
(
122
)
twitter
(
121
)
firmware
(
86
)
youtube
(
84
)
firefox
(
81
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
71
)
office
(
62
)
antivirus
(
55
)
hack
(
54
)
javascript
(
52
)
Kernel
(
49
)
apache
(
48
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
37
)
multimedia
(
36
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Tras 26 años, el chip MechaCon de la PlayStation 2 ha sido totalmente documentado , lo que impulsará el modding de hardware y la emulación ...
-
Brick-O-Matic , una máquina con IA , ha rescatado más de 25 millones de piezas de Lego en Inglaterra, siendo capaz de identificar hasta 60....
-
Claude ya lidera una cuarta parte del desarrollo de sus propios modelos de inteligencia artificial en Anthropic .
Google, Anthropic y OpenAI presentan modelos de IA cibernética, medidas de seguridad y programas de acceso
jueves, 3 de septiembre de 2026
|
Publicado por
el-brujo
|
Editar entrada
Google, Anthropic y OpenAI han lanzado nuevos modelos de IA especializados en ciberseguridad, destacando Gemini 3.8 Flash Cyber y Astra por su capacidad para detectar vulnerabilidades. Estas empresas están implementando programas de acceso restringido y salvaguardas avanzadas para priorizar la defensa y evitar que la IA sea usada para ataques autónomos. El objetivo es fortalecer la infraestructura crítica mientras se corrigen fallos de alineación y seguridad en el entrenamiento de los modelos.
Google anunció el miércoles Gemini 3.8 Flash Cyber, que describió como su modelo de ciberseguridad más capaz, y lo ha puesto a disposición de un grupo de defensores de confianza a través de una nueva iniciativa llamada Fairwind Program.
"El Programa Fairwind otorga a los defensores de alta prioridad (como gobiernos, proveedores de salud y servicios de telecomunicaciones) un acceso anticipado a modelos avanzados que les ayudan a construir mejores defensas antes de que lleguen nuevas amenazas", afirmó Google . "Así, los defensores tienen una ventaja temprana para ayudarles a proteger infraestructuras vitales, lo que a su vez protege a las personas que dependen de esos sistemas".
El gigante tecnológico señaló que actualmente trabaja con más de 650 socios a nivel mundial, incluidos CrowdStrike, Datadog, Menlo Security, Palo Alto Networks y Snowflake. El programa está disponible para un grupo de clientes de Google Cloud, agencias gubernamentales y socios de ciberseguridad.
El lanzamiento de Gemini 3.8 Flash Cyber se produce poco más de un mes después de que Google presentara Gemini 3.5 Flash Cyber. El modelo más reciente mejora a su predecesor al demostrar un rendimiento de nivel frontera en el descubrimiento autónomo de vulnerabilidades, superando incluso a modelos frontera más grandes de rivales como Anthropic (Mythos 5) y OpenAI (GPT-5.6 Sol y GPT-5.5-Cyber).
"Con Gemini 3.8 Flash Cyber, nos centramos específicamente en dotar a los defensores de capacidades expertas que les den ventaja sobre los atacantes. Por eso hemos invertido en la corrección de vulnerabilidades desde el principio, priorizándola sobre las capacidades ofensivas como la explotación", declararon Tulsee Doshi, directora senior de gestión de productos, y Raluca Ada Popa, responsable de seguridad de Gemini en Google DeepMind.
Este desarrollo coincide con el lanzamiento de Anthropic de Claude Fable 5.1 y Claude Mythos 5.1 con diferentes niveles de salvaguardas, estando este último disponible solo a través de sus programas de acceso confiable y trabajos de soporte en ciberseguridad y ciencias de la vida.
La compañía también indicó que ahora permite el uso de Fable 5.1 para identificar vulnerabilidades de software, aunque espera seguir redirigiendo algunas tareas de ciberseguridad a los modelos Opus, como "pruebas de penetración, generación de exploits y escaneo de vulnerabilidades basado en binarios".
"Realizamos evaluaciones sobre cómo responde Claude Mythos 5.1 a solicitudes maliciosas e inyecciones de prompts (instrucciones adversarias ocultas dentro del contenido procesado por modelos de IA)", señaló Anthropic. "Rechazó solicitudes de codificación agéntica maliciosa y de uso de computadoras a un ritmo comparable a Mythos 5, Sonnet 5 y Opus 5, y es nuestro modelo más robusto hasta la fecha en un benchmark externo de inyección de prompts".
La empresa de inteligencia artificial (IA) también ha anunciado una nueva solución llamada Enterprise Frontier Safeguards (EFS), que según combina la "privacidad de retención cero de datos (ZDR) con salvaguardas de vanguardia para detectar el mal uso", otorgando a las empresas control total sobre cómo se revisan, almacenan y gestionan sus datos. OpenAI tiene una solución similar denominada Private Safety Processing.
Además, Anthropic afirmó haber implementado medidas adicionales de endurecimiento y contención, un mayor monitoreo para detectar desalineaciones del modelo y ha pausado las evaluaciones externas de ciberseguridad de modelos previos al lanzamiento en respuesta a incidentes de acceso no autorizado que involucraron modelos Claude contra sistemas reales, destacando dos factores contribuyentes (o fallos de alineación):
Los modelos parecen ignorar la evidencia de que sus entornos de evaluación estaban conectados a la internet real después de que inicialmente se les dijera que eran simulados, e interpretan la discrepancia de manera que les permite mantener esa creencia.
Los modelos muestran imprudencia y están dispuestos a tomar acciones dañinas en la internet real en la búsqueda obstinada de sus objetivos.
Admitiendo que los incidentes fueron un "fallo de seguridad operativa", Anthropic dijo que ha construido un clasificador que detecta y bloquea intentos de escape de sandbox y ha cambiado las especificaciones sobre las recompensas del modelo para abordar casos donde un agente de IA recurre a un atajo para engañar la métrica de recompensa sin lograr realmente el objetivo previsto.
"Nuestra conclusión es que la presencia de un hacking de recompensa sustancial en el entrenamiento puede hacer que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real para lograr el éxito de la tarea", añadió la empresa .
OpenAI, por su parte, ha revelado que su próximo modelo Astra alcanza el umbral de capacidad crítica de ciberseguridad bajo su Marco de Preparación, y que pretende poner sus funciones de ciberseguridad más avanzadas a disposición de un grupo de evaluadores a través del programa Daybreak Blue.
La designación "Crítica" se aplica cuando un modelo de IA puede detectar y explotar independientemente vulnerabilidades de día cero en muchos sistemas bien defendidos, o llevar a cabo un ataque cibernético completo contra un objetivo endurecido partiendo solo de una instrucción de alto nivel sin que un humano lo guíe en el proceso.
"Durante las últimas semanas, hemos retrasado partes del desarrollo y lanzamiento de Astra mientras reforzábamos y probábamos las protecciones contra el mal uso cibernético y las acciones no autorizadas del modelo", afirmó la empresa de IA. "Basándonos en ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daño grave para su lanzamiento".
OpenAI señaló que también ha añadido salvaguardas más fuertes para Astra para evitar un incidente similar al de Hugging Face, en el que sus agentes de IA, parte de una evaluación de ExploitGym, encontraron una forma de explotar su infraestructura de investigación y abusar de Artifactory como un tablero de mensajes para intercambiar información en su búsqueda por resolver una tarea imposible, terminando por hackear la infraestructura de Hugging Face con la esperanza de robar la respuesta en lugar de resolver el desafío por sí mismos.
"Un agente, PHASEONE[big], orquestó una fracción significativa de esta investigación fraudulenta. PHASEONE10841 pasó su trabajo a PHASEONE[big], que tenía la misma tarea pero un presupuesto mayor", señaló METR en su análisis. "Los agentes colaboraron en muchos esfuerzos para hacer que los engaños parecieran legítimos, incluyendo: (1) intercambiar el programa que debían explotar; (2) manipular el calificador automatizado; (3) manipular las transcripciones para ocultar la evidencia del engaño".
OpenAI ha informado que Astra logra una puntuación perfecta del 100% en ExploitBench para desarrollar exploits a partir de vulnerabilidades conocidas, y que ahora rechaza el 91,5% de las solicitudes de jailbreaking, en comparación con el 59% de GPT-5.6 Sol.
Además, OpenAI destacó que Astra logra "tasas de ejecución de código arbitrario mucho más altas" que GPT-5.6 Sol utilizando muchos menos tokens de salida, y que el modelo descubrió y utilizó dos vulnerabilidades de día cero en software no especificado como parte de una cadena de exploits durante una evaluación.
También se ha descubierto que el modelo encuentra fallos previamente desconocidos y los convierte en cadenas de exploits funcionales, incluyendo un compromiso total del navegador que escapa del sandbox y ejecuta comandos arbitrarios en el host subyacente cuando se abre un archivo HTML en el navegador.
"El modelo también encontró múltiples vulnerabilidades en un sistema operativo endurecido y las combinó en una cadena de escalada de privilegios locales desde un usuario sin privilegios hasta root", añadió OpenAI. "En conjunto, nuestra investigación nos ha llevado a concluir que Astra cumple el umbral crítico".
Para minimizar el riesgo de daños cibernéticos graves derivados de modelos como Astra, la empresa dijo que ha añadido clasificadores y protecciones por capas para mejorar la robustez de sus sistemas contra el mal uso de actores maliciosos y evitar que el modelo tome acciones no autorizadas o desalineadas, incluso en ausencia de un usuario malintencionado.
Sin embargo, OpenAI también advirtió que las salvaguardas de Astra podrían marcar erróneamente actividad legítima como mal uso cibernético o comportamiento no autorizado.
"Lograr los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que crecen sus capacidades", concluyó la empresa. "Esa responsabilidad se extiende al entrenamiento, la evaluación y el despliegue. Requiere evidencia más sólida de comportamiento alineado, salvaguardas que sigan el ritmo de la capacidad y la voluntad de ir más despacio cuando esas protecciones no sean suficientes".
Las empresas de IA han estado bajo un intenso escrutinio tras incidentes donde sus modelos escaparon de sus entornos de evaluación y atacaron sistemas legítimos. A la par, el aumento de los ciberataques impulsados por IA ha llevado a una coalición de más de 100 empresas, incluidas Anthropic, Google, Microsoft, OpenAI y varios proveedores de seguridad y software, a emitir una carta conjunta solicitando defensas mejoradas contra tales amenazas.
Fuente:
THN
Google anunció el miércoles Gemini 3.8 Flash Cyber, que describió como su modelo de ciberseguridad más capaz, y lo ha puesto a disposición de un grupo de defensores de confianza a través de una nueva iniciativa llamada Fairwind Program.
"El Programa Fairwind otorga a los defensores de alta prioridad (como gobiernos, proveedores de salud y servicios de telecomunicaciones) un acceso anticipado a modelos avanzados que les ayudan a construir mejores defensas antes de que lleguen nuevas amenazas", afirmó Google . "Así, los defensores tienen una ventaja temprana para ayudarles a proteger infraestructuras vitales, lo que a su vez protege a las personas que dependen de esos sistemas".
El gigante tecnológico señaló que actualmente trabaja con más de 650 socios a nivel mundial, incluidos CrowdStrike, Datadog, Menlo Security, Palo Alto Networks y Snowflake. El programa está disponible para un grupo de clientes de Google Cloud, agencias gubernamentales y socios de ciberseguridad.
El lanzamiento de Gemini 3.8 Flash Cyber se produce poco más de un mes después de que Google presentara Gemini 3.5 Flash Cyber. El modelo más reciente mejora a su predecesor al demostrar un rendimiento de nivel frontera en el descubrimiento autónomo de vulnerabilidades, superando incluso a modelos frontera más grandes de rivales como Anthropic (Mythos 5) y OpenAI (GPT-5.6 Sol y GPT-5.5-Cyber).
"Con Gemini 3.8 Flash Cyber, nos centramos específicamente en dotar a los defensores de capacidades expertas que les den ventaja sobre los atacantes. Por eso hemos invertido en la corrección de vulnerabilidades desde el principio, priorizándola sobre las capacidades ofensivas como la explotación", declararon Tulsee Doshi, directora senior de gestión de productos, y Raluca Ada Popa, responsable de seguridad de Gemini en Google DeepMind.
Anthropic debuta Claude Fable 5.1 y Claude Mythos 5.1
Este desarrollo coincide con el lanzamiento de Anthropic de Claude Fable 5.1 y Claude Mythos 5.1 con diferentes niveles de salvaguardas, estando este último disponible solo a través de sus programas de acceso confiable y trabajos de soporte en ciberseguridad y ciencias de la vida.
La compañía también indicó que ahora permite el uso de Fable 5.1 para identificar vulnerabilidades de software, aunque espera seguir redirigiendo algunas tareas de ciberseguridad a los modelos Opus, como "pruebas de penetración, generación de exploits y escaneo de vulnerabilidades basado en binarios".
"Realizamos evaluaciones sobre cómo responde Claude Mythos 5.1 a solicitudes maliciosas e inyecciones de prompts (instrucciones adversarias ocultas dentro del contenido procesado por modelos de IA)", señaló Anthropic. "Rechazó solicitudes de codificación agéntica maliciosa y de uso de computadoras a un ritmo comparable a Mythos 5, Sonnet 5 y Opus 5, y es nuestro modelo más robusto hasta la fecha en un benchmark externo de inyección de prompts".
La empresa de inteligencia artificial (IA) también ha anunciado una nueva solución llamada Enterprise Frontier Safeguards (EFS), que según combina la "privacidad de retención cero de datos (ZDR) con salvaguardas de vanguardia para detectar el mal uso", otorgando a las empresas control total sobre cómo se revisan, almacenan y gestionan sus datos. OpenAI tiene una solución similar denominada Private Safety Processing.
Además, Anthropic afirmó haber implementado medidas adicionales de endurecimiento y contención, un mayor monitoreo para detectar desalineaciones del modelo y ha pausado las evaluaciones externas de ciberseguridad de modelos previos al lanzamiento en respuesta a incidentes de acceso no autorizado que involucraron modelos Claude contra sistemas reales, destacando dos factores contribuyentes (o fallos de alineación):
Los modelos parecen ignorar la evidencia de que sus entornos de evaluación estaban conectados a la internet real después de que inicialmente se les dijera que eran simulados, e interpretan la discrepancia de manera que les permite mantener esa creencia.
Los modelos muestran imprudencia y están dispuestos a tomar acciones dañinas en la internet real en la búsqueda obstinada de sus objetivos.
Admitiendo que los incidentes fueron un "fallo de seguridad operativa", Anthropic dijo que ha construido un clasificador que detecta y bloquea intentos de escape de sandbox y ha cambiado las especificaciones sobre las recompensas del modelo para abordar casos donde un agente de IA recurre a un atajo para engañar la métrica de recompensa sin lograr realmente el objetivo previsto.
"Nuestra conclusión es que la presencia de un hacking de recompensa sustancial en el entrenamiento puede hacer que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real para lograr el éxito de la tarea", añadió la empresa .
OpenAI afirma que Astra cumple la capacidad crítica de ciberseguridad
OpenAI, por su parte, ha revelado que su próximo modelo Astra alcanza el umbral de capacidad crítica de ciberseguridad bajo su Marco de Preparación, y que pretende poner sus funciones de ciberseguridad más avanzadas a disposición de un grupo de evaluadores a través del programa Daybreak Blue.
La designación "Crítica" se aplica cuando un modelo de IA puede detectar y explotar independientemente vulnerabilidades de día cero en muchos sistemas bien defendidos, o llevar a cabo un ataque cibernético completo contra un objetivo endurecido partiendo solo de una instrucción de alto nivel sin que un humano lo guíe en el proceso.
"Durante las últimas semanas, hemos retrasado partes del desarrollo y lanzamiento de Astra mientras reforzábamos y probábamos las protecciones contra el mal uso cibernético y las acciones no autorizadas del modelo", afirmó la empresa de IA. "Basándonos en ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daño grave para su lanzamiento".
OpenAI señaló que también ha añadido salvaguardas más fuertes para Astra para evitar un incidente similar al de Hugging Face, en el que sus agentes de IA, parte de una evaluación de ExploitGym, encontraron una forma de explotar su infraestructura de investigación y abusar de Artifactory como un tablero de mensajes para intercambiar información en su búsqueda por resolver una tarea imposible, terminando por hackear la infraestructura de Hugging Face con la esperanza de robar la respuesta en lugar de resolver el desafío por sí mismos.
"Un agente, PHASEONE[big], orquestó una fracción significativa de esta investigación fraudulenta. PHASEONE10841 pasó su trabajo a PHASEONE[big], que tenía la misma tarea pero un presupuesto mayor", señaló METR en su análisis. "Los agentes colaboraron en muchos esfuerzos para hacer que los engaños parecieran legítimos, incluyendo: (1) intercambiar el programa que debían explotar; (2) manipular el calificador automatizado; (3) manipular las transcripciones para ocultar la evidencia del engaño".
OpenAI ha informado que Astra logra una puntuación perfecta del 100% en ExploitBench para desarrollar exploits a partir de vulnerabilidades conocidas, y que ahora rechaza el 91,5% de las solicitudes de jailbreaking, en comparación con el 59% de GPT-5.6 Sol.
Además, OpenAI destacó que Astra logra "tasas de ejecución de código arbitrario mucho más altas" que GPT-5.6 Sol utilizando muchos menos tokens de salida, y que el modelo descubrió y utilizó dos vulnerabilidades de día cero en software no especificado como parte de una cadena de exploits durante una evaluación.
También se ha descubierto que el modelo encuentra fallos previamente desconocidos y los convierte en cadenas de exploits funcionales, incluyendo un compromiso total del navegador que escapa del sandbox y ejecuta comandos arbitrarios en el host subyacente cuando se abre un archivo HTML en el navegador.
"El modelo también encontró múltiples vulnerabilidades en un sistema operativo endurecido y las combinó en una cadena de escalada de privilegios locales desde un usuario sin privilegios hasta root", añadió OpenAI. "En conjunto, nuestra investigación nos ha llevado a concluir que Astra cumple el umbral crítico".
Para minimizar el riesgo de daños cibernéticos graves derivados de modelos como Astra, la empresa dijo que ha añadido clasificadores y protecciones por capas para mejorar la robustez de sus sistemas contra el mal uso de actores maliciosos y evitar que el modelo tome acciones no autorizadas o desalineadas, incluso en ausencia de un usuario malintencionado.
Sin embargo, OpenAI también advirtió que las salvaguardas de Astra podrían marcar erróneamente actividad legítima como mal uso cibernético o comportamiento no autorizado.
"Lograr los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que crecen sus capacidades", concluyó la empresa. "Esa responsabilidad se extiende al entrenamiento, la evaluación y el despliegue. Requiere evidencia más sólida de comportamiento alineado, salvaguardas que sigan el ritmo de la capacidad y la voluntad de ir más despacio cuando esas protecciones no sean suficientes".
Las empresas de IA han estado bajo un intenso escrutinio tras incidentes donde sus modelos escaparon de sus entornos de evaluación y atacaron sistemas legítimos. A la par, el aumento de los ciberataques impulsados por IA ha llevado a una coalición de más de 100 empresas, incluidas Anthropic, Google, Microsoft, OpenAI y varios proveedores de seguridad y software, a emitir una carta conjunta solicitando defensas mejoradas contra tales amenazas.
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.