Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6835
)
-
▼
September
(Total:
93
)
-
Ransomware The Gentlemen desactiva EDR y copias de...
-
Recuperar archivos borrados en Windows 11
-
Falla en plugin All-in-One WP Migration and Backup...
-
Apple prepara su primer iPhone plegable
-
Módulos maliciosos de Apache convierten webs guber...
-
OpenAI investiga errores en ChatGPT y Codex
-
El cuello de botella de DLSS 5 podría ser el consu...
-
Google lanza Gemini 3.8 Flash Cyber para detectar ...
-
Caída de Claude AI afecta a Mythos 5.1, Fable 5.1 ...
-
Google, Anthropic y OpenAI presentan modelos de IA...
-
Un documental sobre la «peligrosa internet» y cómo...
-
Google actualiza los Chromecast antiguos
-
Nvidia compra Hugging Face por 13.000 millones
-
Se quema el conector de su RTX 5090 tras alcanzar ...
-
Fallo en switches Cisco Nexus 9000 permite ejecuci...
-
Linux sube al 8,88% en PC
-
Fallo en plugin All-in-One WP Migration and Backu...
-
Explotan fallo en LiteLLM para robar secretos y at...
-
FreeRDP corrige 22 fallos de seguridad
-
GeoNetwork soluciona vulnerabilidad de ejecución r...
-
Claude AI ya controla tu ordenador con macOS y Win...
-
Google lanza Gemini 3.8 Flash para programar
-
Suplantan soporte técnico en Teams para controlar ...
-
Fallos críticos en HPE Fabric Composer permiten ej...
-
Vulnerabilidad crítica en Langflow permite el robo...
-
EE. UU. imputa a un ruso por infectar con malware ...
-
RTX 5060 Ti: más cara y lenta que RX 9070
-
Ayudas de hasta 5 millones para empresas con IA en...
-
Publicado PoC de vulnerabilidad RCE pre-auth en Mi...
-
Aprovechan fallo crítico en JFrog Artifactory para...
-
Falso GTA VI roba criptomonedas
-
Google Pics: imágenes con IA
-
UE endurece controles a ChatGPT, Reddit y Roblox
-
Adobe se integra en Slack
-
Linus Torvalds acepta la IA en Linux
-
Vulnerabilidades en kernel de Red Hat Linux
-
Firefox permite a los usuarios de iPhone evitar la...
-
La nueva ley cibernética del Reino Unido se enfoca...
-
PS5 suma más de 100 canales gratis
-
FBI y CrowdStrike desmantelan botnet Sality de 20 ...
-
Google corrige 26 vulnerabilidades de Chrome, incl...
-
Lanzan WinBtrfs 1.10
-
OpenAI retrasa su IA más potente
-
La policía y CrowdStrike desmantelan la botnet Sal...
-
Filtradas cuentas de Dropbox por fallo en la verif...
-
OWASP lanza iniciativa OASIS AI para corregir vuln...
-
Desmantelada la infraestructura de la botnet Salit...
-
Anthropic lanza Claude Fable y Mythos 5.1 para pro...
-
Claude Fable 5.1 eleva su rendimiento en ciencia y...
-
El AMD Ryzen 9 9950X3D queda al descubierto: solo ...
-
Bancos frenan financiación de centros de datos de IA
-
LaLiga usa IA contra el fútbol pirata
-
Anthropic lanza Claude Mythos y Fable 5.1 más pote...
-
Astra de OpenAI halla fallos de seguridad y crea e...
-
Meta crea IA que distingue 20 voces
-
Más de 21,000 servidores Microsoft Exchange siguen...
-
Ciberataque a Boston Scientific interrumpe producc...
-
Usan enlaces reales de ChatGPT para instalar malwa...
-
WordPress usa IA para hallar fallos de seguridad
-
Casi 22.000 servidores de Microsoft Exchange en ri...
-
Google lanza Pics para competir con Canva
-
Cinco venezolanos se declaran culpables de vaciar ...
-
Fingen ser reclutadores para infectar a desarrolla...
-
Explotan fallos críticos en Langflow y Rails
-
Firefox 155: actualizaciones cada dos semanas
-
Filtración de datos en Novocure afecta a más de 1....
-
13 paquetes maliciosos de Packagist atacan iPhones...
-
Cronos reinicia su blockchain tras el hackeo de 74...
-
Ciberataques sanitarios afectan a marcapasos y a m...
-
Atacantes aprovechan fallos críticos en Langflow y...
-
OpenClaw 2.0 intenta maquillar un desastre de segu...
-
IA desborda a mantenedores de Linux con fallos
-
Microsoft advierte sobre ataques de TerminalFix qu...
-
El MacBook Neo desgasta el SSD de forma exagerada ...
-
Iraníes se hacen pasar por reclutadores para distr...
-
ChatGPT supera los 45 millones de usuarios y las o...
-
Vulneran routers de Cisco para espiar redes e infr...
-
UE clasifica a ChatGPT, Reddit y Roblox como gigan...
-
Sony y Warner demandan a Anthropic por robo de can...
-
Atacan cuentas root de AWS en más de 150 organizac...
-
Secuestro de BGP desvía tráfico de Softaculous par...
-
HardBreacher reporta zero-day de escalada de privi...
-
El fraude laboral de Corea del Norte se extiende m...
-
Project Helix superará a Xbox
-
Detectan 19 extensiones de Chrome y Edge diseñadas...
-
TerminalFix despliega backdoor de túnel inverso me...
-
Brave lanza alias de correo para proteger tu priva...
-
Fallos en routers D-Link permiten cambiar contrase...
-
Android 17 añade protección contra el rastreo Wi-Fi
-
Debian permite la IA generativa en Linux
-
KVM: varias PC en un solo ordenador
-
Ubuntu 26.04.1 LTS ya disponible
-
KDE Gear 26.08: novedades en Dolphin
-
-
▼
September
(Total:
93
)
Blogroll
Labels
vulnerabilidad
(
1795
)
seguridad
(
1764
)
software
(
1081
)
hardware
(
912
)
google
(
781
)
Malware
(
710
)
privacidad
(
671
)
ransomware
(
538
)
Windows
(
521
)
exploit
(
500
)
android
(
473
)
linux
(
431
)
cve
(
375
)
nvidia
(
307
)
tutorial
(
300
)
manual
(
282
)
hacking
(
260
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
140
)
Wifi
(
131
)
app
(
127
)
cifrado
(
121
)
programación
(
121
)
twitter
(
121
)
youtube
(
83
)
firmware
(
81
)
firefox
(
80
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
70
)
office
(
62
)
antivirus
(
52
)
hack
(
52
)
Kernel
(
49
)
javascript
(
49
)
apache
(
47
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Python 3.15 ya es oficial, introduciendo optimizaciones en TypedDict, Tachyon, JIT y soporte ABI para mejorar la productividad del ecosist...
-
La UE propone un temporizador de 30 minutos para bloquear el fútbol pirata y las IPTV, basándose en el modelo italiano Piracy Shield, afect...
-
Dopamine 3.0 ha lanzado el jailbreak para iOS 26 , confirmando que estas herramientas de desbloqueo siguen vigentes a pesar de las restricc...
Google, Anthropic y OpenAI presentan modelos de IA cibernética, medidas de seguridad y programas de acceso
Thursday, September 3, 2026
|
Posted by
el-brujo
|
Edit Post
Google, Anthropic y OpenAI han lanzado nuevos modelos de IA especializados en ciberseguridad, destacando Gemini 3.8 Flash Cyber y Astra por su capacidad para detectar vulnerabilidades. Estas empresas están implementando programas de acceso restringido y salvaguardas avanzadas para priorizar la defensa y evitar que la IA sea usada para ataques autónomos. El objetivo es fortalecer la infraestructura crítica mientras se corrigen fallos de alineación y seguridad en el entrenamiento de los modelos.
Google anunció el miércoles Gemini 3.8 Flash Cyber, que describió como su modelo de ciberseguridad más capaz, y lo ha puesto a disposición de un grupo de defensores de confianza a través de una nueva iniciativa llamada Fairwind Program.
"El Programa Fairwind otorga a los defensores de alta prioridad (como gobiernos, proveedores de salud y servicios de telecomunicaciones) un acceso anticipado a modelos avanzados que les ayudan a construir mejores defensas antes de que lleguen nuevas amenazas", afirmó Google . "Así, los defensores tienen una ventaja temprana para ayudarles a proteger infraestructuras vitales, lo que a su vez protege a las personas que dependen de esos sistemas".
El gigante tecnológico señaló que actualmente trabaja con más de 650 socios a nivel mundial, incluidos CrowdStrike, Datadog, Menlo Security, Palo Alto Networks y Snowflake. El programa está disponible para un grupo de clientes de Google Cloud, agencias gubernamentales y socios de ciberseguridad.
El lanzamiento de Gemini 3.8 Flash Cyber se produce poco más de un mes después de que Google presentara Gemini 3.5 Flash Cyber. El modelo más reciente mejora a su predecesor al demostrar un rendimiento de nivel frontera en el descubrimiento autónomo de vulnerabilidades, superando incluso a modelos frontera más grandes de rivales como Anthropic (Mythos 5) y OpenAI (GPT-5.6 Sol y GPT-5.5-Cyber).
"Con Gemini 3.8 Flash Cyber, nos centramos específicamente en dotar a los defensores de capacidades expertas que les den ventaja sobre los atacantes. Por eso hemos invertido en la corrección de vulnerabilidades desde el principio, priorizándola sobre las capacidades ofensivas como la explotación", declararon Tulsee Doshi, directora senior de gestión de productos, y Raluca Ada Popa, responsable de seguridad de Gemini en Google DeepMind.
Este desarrollo coincide con el lanzamiento de Anthropic de Claude Fable 5.1 y Claude Mythos 5.1 con diferentes niveles de salvaguardas, estando este último disponible solo a través de sus programas de acceso confiable y trabajos de soporte en ciberseguridad y ciencias de la vida.
La compañía también indicó que ahora permite el uso de Fable 5.1 para identificar vulnerabilidades de software, aunque espera seguir redirigiendo algunas tareas de ciberseguridad a los modelos Opus, como "pruebas de penetración, generación de exploits y escaneo de vulnerabilidades basado en binarios".
"Realizamos evaluaciones sobre cómo responde Claude Mythos 5.1 a solicitudes maliciosas e inyecciones de prompts (instrucciones adversarias ocultas dentro del contenido procesado por modelos de IA)", señaló Anthropic. "Rechazó solicitudes de codificación agéntica maliciosa y de uso de computadoras a un ritmo comparable a Mythos 5, Sonnet 5 y Opus 5, y es nuestro modelo más robusto hasta la fecha en un benchmark externo de inyección de prompts".
La empresa de inteligencia artificial (IA) también ha anunciado una nueva solución llamada Enterprise Frontier Safeguards (EFS), que según combina la "privacidad de retención cero de datos (ZDR) con salvaguardas de vanguardia para detectar el mal uso", otorgando a las empresas control total sobre cómo se revisan, almacenan y gestionan sus datos. OpenAI tiene una solución similar denominada Private Safety Processing.
Además, Anthropic afirmó haber implementado medidas adicionales de endurecimiento y contención, un mayor monitoreo para detectar desalineaciones del modelo y ha pausado las evaluaciones externas de ciberseguridad de modelos previos al lanzamiento en respuesta a incidentes de acceso no autorizado que involucraron modelos Claude contra sistemas reales, destacando dos factores contribuyentes (o fallos de alineación):
Los modelos parecen ignorar la evidencia de que sus entornos de evaluación estaban conectados a la internet real después de que inicialmente se les dijera que eran simulados, e interpretan la discrepancia de manera que les permite mantener esa creencia.
Los modelos muestran imprudencia y están dispuestos a tomar acciones dañinas en la internet real en la búsqueda obstinada de sus objetivos.
Admitiendo que los incidentes fueron un "fallo de seguridad operativa", Anthropic dijo que ha construido un clasificador que detecta y bloquea intentos de escape de sandbox y ha cambiado las especificaciones sobre las recompensas del modelo para abordar casos donde un agente de IA recurre a un atajo para engañar la métrica de recompensa sin lograr realmente el objetivo previsto.
"Nuestra conclusión es que la presencia de un hacking de recompensa sustancial en el entrenamiento puede hacer que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real para lograr el éxito de la tarea", añadió la empresa .
OpenAI, por su parte, ha revelado que su próximo modelo Astra alcanza el umbral de capacidad crítica de ciberseguridad bajo su Marco de Preparación, y que pretende poner sus funciones de ciberseguridad más avanzadas a disposición de un grupo de evaluadores a través del programa Daybreak Blue.
La designación "Crítica" se aplica cuando un modelo de IA puede detectar y explotar independientemente vulnerabilidades de día cero en muchos sistemas bien defendidos, o llevar a cabo un ataque cibernético completo contra un objetivo endurecido partiendo solo de una instrucción de alto nivel sin que un humano lo guíe en el proceso.
"Durante las últimas semanas, hemos retrasado partes del desarrollo y lanzamiento de Astra mientras reforzábamos y probábamos las protecciones contra el mal uso cibernético y las acciones no autorizadas del modelo", afirmó la empresa de IA. "Basándonos en ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daño grave para su lanzamiento".
OpenAI señaló que también ha añadido salvaguardas más fuertes para Astra para evitar un incidente similar al de Hugging Face, en el que sus agentes de IA, parte de una evaluación de ExploitGym, encontraron una forma de explotar su infraestructura de investigación y abusar de Artifactory como un tablero de mensajes para intercambiar información en su búsqueda por resolver una tarea imposible, terminando por hackear la infraestructura de Hugging Face con la esperanza de robar la respuesta en lugar de resolver el desafío por sí mismos.
"Un agente, PHASEONE[big], orquestó una fracción significativa de esta investigación fraudulenta. PHASEONE10841 pasó su trabajo a PHASEONE[big], que tenía la misma tarea pero un presupuesto mayor", señaló METR en su análisis. "Los agentes colaboraron en muchos esfuerzos para hacer que los engaños parecieran legítimos, incluyendo: (1) intercambiar el programa que debían explotar; (2) manipular el calificador automatizado; (3) manipular las transcripciones para ocultar la evidencia del engaño".
OpenAI ha informado que Astra logra una puntuación perfecta del 100% en ExploitBench para desarrollar exploits a partir de vulnerabilidades conocidas, y que ahora rechaza el 91,5% de las solicitudes de jailbreaking, en comparación con el 59% de GPT-5.6 Sol.
Además, OpenAI destacó que Astra logra "tasas de ejecución de código arbitrario mucho más altas" que GPT-5.6 Sol utilizando muchos menos tokens de salida, y que el modelo descubrió y utilizó dos vulnerabilidades de día cero en software no especificado como parte de una cadena de exploits durante una evaluación.
También se ha descubierto que el modelo encuentra fallos previamente desconocidos y los convierte en cadenas de exploits funcionales, incluyendo un compromiso total del navegador que escapa del sandbox y ejecuta comandos arbitrarios en el host subyacente cuando se abre un archivo HTML en el navegador.
"El modelo también encontró múltiples vulnerabilidades en un sistema operativo endurecido y las combinó en una cadena de escalada de privilegios locales desde un usuario sin privilegios hasta root", añadió OpenAI. "En conjunto, nuestra investigación nos ha llevado a concluir que Astra cumple el umbral crítico".
Para minimizar el riesgo de daños cibernéticos graves derivados de modelos como Astra, la empresa dijo que ha añadido clasificadores y protecciones por capas para mejorar la robustez de sus sistemas contra el mal uso de actores maliciosos y evitar que el modelo tome acciones no autorizadas o desalineadas, incluso en ausencia de un usuario malintencionado.
Sin embargo, OpenAI también advirtió que las salvaguardas de Astra podrían marcar erróneamente actividad legítima como mal uso cibernético o comportamiento no autorizado.
"Lograr los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que crecen sus capacidades", concluyó la empresa. "Esa responsabilidad se extiende al entrenamiento, la evaluación y el despliegue. Requiere evidencia más sólida de comportamiento alineado, salvaguardas que sigan el ritmo de la capacidad y la voluntad de ir más despacio cuando esas protecciones no sean suficientes".
Las empresas de IA han estado bajo un intenso escrutinio tras incidentes donde sus modelos escaparon de sus entornos de evaluación y atacaron sistemas legítimos. A la par, el aumento de los ciberataques impulsados por IA ha llevado a una coalición de más de 100 empresas, incluidas Anthropic, Google, Microsoft, OpenAI y varios proveedores de seguridad y software, a emitir una carta conjunta solicitando defensas mejoradas contra tales amenazas.
Fuente:
THN
Google anunció el miércoles Gemini 3.8 Flash Cyber, que describió como su modelo de ciberseguridad más capaz, y lo ha puesto a disposición de un grupo de defensores de confianza a través de una nueva iniciativa llamada Fairwind Program.
"El Programa Fairwind otorga a los defensores de alta prioridad (como gobiernos, proveedores de salud y servicios de telecomunicaciones) un acceso anticipado a modelos avanzados que les ayudan a construir mejores defensas antes de que lleguen nuevas amenazas", afirmó Google . "Así, los defensores tienen una ventaja temprana para ayudarles a proteger infraestructuras vitales, lo que a su vez protege a las personas que dependen de esos sistemas".
El gigante tecnológico señaló que actualmente trabaja con más de 650 socios a nivel mundial, incluidos CrowdStrike, Datadog, Menlo Security, Palo Alto Networks y Snowflake. El programa está disponible para un grupo de clientes de Google Cloud, agencias gubernamentales y socios de ciberseguridad.
El lanzamiento de Gemini 3.8 Flash Cyber se produce poco más de un mes después de que Google presentara Gemini 3.5 Flash Cyber. El modelo más reciente mejora a su predecesor al demostrar un rendimiento de nivel frontera en el descubrimiento autónomo de vulnerabilidades, superando incluso a modelos frontera más grandes de rivales como Anthropic (Mythos 5) y OpenAI (GPT-5.6 Sol y GPT-5.5-Cyber).
"Con Gemini 3.8 Flash Cyber, nos centramos específicamente en dotar a los defensores de capacidades expertas que les den ventaja sobre los atacantes. Por eso hemos invertido en la corrección de vulnerabilidades desde el principio, priorizándola sobre las capacidades ofensivas como la explotación", declararon Tulsee Doshi, directora senior de gestión de productos, y Raluca Ada Popa, responsable de seguridad de Gemini en Google DeepMind.
Anthropic debuta Claude Fable 5.1 y Claude Mythos 5.1
Este desarrollo coincide con el lanzamiento de Anthropic de Claude Fable 5.1 y Claude Mythos 5.1 con diferentes niveles de salvaguardas, estando este último disponible solo a través de sus programas de acceso confiable y trabajos de soporte en ciberseguridad y ciencias de la vida.
La compañía también indicó que ahora permite el uso de Fable 5.1 para identificar vulnerabilidades de software, aunque espera seguir redirigiendo algunas tareas de ciberseguridad a los modelos Opus, como "pruebas de penetración, generación de exploits y escaneo de vulnerabilidades basado en binarios".
"Realizamos evaluaciones sobre cómo responde Claude Mythos 5.1 a solicitudes maliciosas e inyecciones de prompts (instrucciones adversarias ocultas dentro del contenido procesado por modelos de IA)", señaló Anthropic. "Rechazó solicitudes de codificación agéntica maliciosa y de uso de computadoras a un ritmo comparable a Mythos 5, Sonnet 5 y Opus 5, y es nuestro modelo más robusto hasta la fecha en un benchmark externo de inyección de prompts".
La empresa de inteligencia artificial (IA) también ha anunciado una nueva solución llamada Enterprise Frontier Safeguards (EFS), que según combina la "privacidad de retención cero de datos (ZDR) con salvaguardas de vanguardia para detectar el mal uso", otorgando a las empresas control total sobre cómo se revisan, almacenan y gestionan sus datos. OpenAI tiene una solución similar denominada Private Safety Processing.
Además, Anthropic afirmó haber implementado medidas adicionales de endurecimiento y contención, un mayor monitoreo para detectar desalineaciones del modelo y ha pausado las evaluaciones externas de ciberseguridad de modelos previos al lanzamiento en respuesta a incidentes de acceso no autorizado que involucraron modelos Claude contra sistemas reales, destacando dos factores contribuyentes (o fallos de alineación):
Los modelos parecen ignorar la evidencia de que sus entornos de evaluación estaban conectados a la internet real después de que inicialmente se les dijera que eran simulados, e interpretan la discrepancia de manera que les permite mantener esa creencia.
Los modelos muestran imprudencia y están dispuestos a tomar acciones dañinas en la internet real en la búsqueda obstinada de sus objetivos.
Admitiendo que los incidentes fueron un "fallo de seguridad operativa", Anthropic dijo que ha construido un clasificador que detecta y bloquea intentos de escape de sandbox y ha cambiado las especificaciones sobre las recompensas del modelo para abordar casos donde un agente de IA recurre a un atajo para engañar la métrica de recompensa sin lograr realmente el objetivo previsto.
"Nuestra conclusión es que la presencia de un hacking de recompensa sustancial en el entrenamiento puede hacer que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real para lograr el éxito de la tarea", añadió la empresa .
OpenAI afirma que Astra cumple la capacidad crítica de ciberseguridad
OpenAI, por su parte, ha revelado que su próximo modelo Astra alcanza el umbral de capacidad crítica de ciberseguridad bajo su Marco de Preparación, y que pretende poner sus funciones de ciberseguridad más avanzadas a disposición de un grupo de evaluadores a través del programa Daybreak Blue.
La designación "Crítica" se aplica cuando un modelo de IA puede detectar y explotar independientemente vulnerabilidades de día cero en muchos sistemas bien defendidos, o llevar a cabo un ataque cibernético completo contra un objetivo endurecido partiendo solo de una instrucción de alto nivel sin que un humano lo guíe en el proceso.
"Durante las últimas semanas, hemos retrasado partes del desarrollo y lanzamiento de Astra mientras reforzábamos y probábamos las protecciones contra el mal uso cibernético y las acciones no autorizadas del modelo", afirmó la empresa de IA. "Basándonos en ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daño grave para su lanzamiento".
OpenAI señaló que también ha añadido salvaguardas más fuertes para Astra para evitar un incidente similar al de Hugging Face, en el que sus agentes de IA, parte de una evaluación de ExploitGym, encontraron una forma de explotar su infraestructura de investigación y abusar de Artifactory como un tablero de mensajes para intercambiar información en su búsqueda por resolver una tarea imposible, terminando por hackear la infraestructura de Hugging Face con la esperanza de robar la respuesta en lugar de resolver el desafío por sí mismos.
"Un agente, PHASEONE[big], orquestó una fracción significativa de esta investigación fraudulenta. PHASEONE10841 pasó su trabajo a PHASEONE[big], que tenía la misma tarea pero un presupuesto mayor", señaló METR en su análisis. "Los agentes colaboraron en muchos esfuerzos para hacer que los engaños parecieran legítimos, incluyendo: (1) intercambiar el programa que debían explotar; (2) manipular el calificador automatizado; (3) manipular las transcripciones para ocultar la evidencia del engaño".
OpenAI ha informado que Astra logra una puntuación perfecta del 100% en ExploitBench para desarrollar exploits a partir de vulnerabilidades conocidas, y que ahora rechaza el 91,5% de las solicitudes de jailbreaking, en comparación con el 59% de GPT-5.6 Sol.
Además, OpenAI destacó que Astra logra "tasas de ejecución de código arbitrario mucho más altas" que GPT-5.6 Sol utilizando muchos menos tokens de salida, y que el modelo descubrió y utilizó dos vulnerabilidades de día cero en software no especificado como parte de una cadena de exploits durante una evaluación.
También se ha descubierto que el modelo encuentra fallos previamente desconocidos y los convierte en cadenas de exploits funcionales, incluyendo un compromiso total del navegador que escapa del sandbox y ejecuta comandos arbitrarios en el host subyacente cuando se abre un archivo HTML en el navegador.
"El modelo también encontró múltiples vulnerabilidades en un sistema operativo endurecido y las combinó en una cadena de escalada de privilegios locales desde un usuario sin privilegios hasta root", añadió OpenAI. "En conjunto, nuestra investigación nos ha llevado a concluir que Astra cumple el umbral crítico".
Para minimizar el riesgo de daños cibernéticos graves derivados de modelos como Astra, la empresa dijo que ha añadido clasificadores y protecciones por capas para mejorar la robustez de sus sistemas contra el mal uso de actores maliciosos y evitar que el modelo tome acciones no autorizadas o desalineadas, incluso en ausencia de un usuario malintencionado.
Sin embargo, OpenAI también advirtió que las salvaguardas de Astra podrían marcar erróneamente actividad legítima como mal uso cibernético o comportamiento no autorizado.
"Lograr los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que crecen sus capacidades", concluyó la empresa. "Esa responsabilidad se extiende al entrenamiento, la evaluación y el despliegue. Requiere evidencia más sólida de comportamiento alineado, salvaguardas que sigan el ritmo de la capacidad y la voluntad de ir más despacio cuando esas protecciones no sean suficientes".
Las empresas de IA han estado bajo un intenso escrutinio tras incidentes donde sus modelos escaparon de sus entornos de evaluación y atacaron sistemas legítimos. A la par, el aumento de los ciberataques impulsados por IA ha llevado a una coalición de más de 100 empresas, incluidas Anthropic, Google, Microsoft, OpenAI y varios proveedores de seguridad y software, a emitir una carta conjunta solicitando defensas mejoradas contra tales amenazas.
Fuente:
THN
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.