Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Google, Anthropic y OpenAI presentan modelos de IA cibernética, medidas de seguridad y programas de acceso


Google, Anthropic y OpenAI han lanzado nuevos modelos de IA especializados en ciberseguridad, destacando Gemini 3.8 Flash Cyber y Astra por su capacidad para detectar vulnerabilidades. Estas empresas están implementando programas de acceso restringido y salvaguardas avanzadas para priorizar la defensa y evitar que la IA sea usada para ataques autónomos. El objetivo es fortalecer la infraestructura crítica mientras se corrigen fallos de alineación y seguridad en el entrenamiento de los modelos.







Google anunció el miércoles Gemini 3.8 Flash Cyber, que describió como su modelo de ciberseguridad más capaz, y lo ha puesto a disposición de un grupo de defensores de confianza a través de una nueva iniciativa llamada Fairwind Program.

"El Programa Fairwind otorga a los defensores de alta prioridad (como gobiernos, proveedores de salud y servicios de telecomunicaciones) un acceso anticipado a modelos avanzados que les ayudan a construir mejores defensas antes de que lleguen nuevas amenazas", afirmó Google . "Así, los defensores tienen una ventaja temprana para ayudarles a proteger infraestructuras vitales, lo que a su vez protege a las personas que dependen de esos sistemas".

El gigante tecnológico señaló que actualmente trabaja con más de 650 socios a nivel mundial, incluidos CrowdStrike, Datadog, Menlo Security, Palo Alto Networks y Snowflake. El programa está disponible para un grupo de clientes de Google Cloud, agencias gubernamentales y socios de ciberseguridad.

El lanzamiento de Gemini 3.8 Flash Cyber se produce poco más de un mes después de que Google presentara Gemini 3.5 Flash Cyber. El modelo más reciente mejora a su predecesor al demostrar un rendimiento de nivel frontera en el descubrimiento autónomo de vulnerabilidades, superando incluso a modelos frontera más grandes de rivales como Anthropic (Mythos 5) y OpenAI (GPT-5.6 Sol y GPT-5.5-Cyber).

"Con Gemini 3.8 Flash Cyber, nos centramos específicamente en dotar a los defensores de capacidades expertas que les den ventaja sobre los atacantes. Por eso hemos invertido en la corrección de vulnerabilidades desde el principio, priorizándola sobre las capacidades ofensivas como la explotación", declararon Tulsee Doshi, directora senior de gestión de productos, y Raluca Ada Popa, responsable de seguridad de Gemini en Google DeepMind.


Anthropic debuta Claude Fable 5.1 y Claude Mythos 5.1



Este desarrollo coincide con el lanzamiento de Anthropic de Claude Fable 5.1 y Claude Mythos 5.1 con diferentes niveles de salvaguardas, estando este último disponible solo a través de sus programas de acceso confiable y trabajos de soporte en ciberseguridad y ciencias de la vida.

La compañía también indicó que ahora permite el uso de Fable 5.1 para identificar vulnerabilidades de software, aunque espera seguir redirigiendo algunas tareas de ciberseguridad a los modelos Opus, como "pruebas de penetración, generación de exploits y escaneo de vulnerabilidades basado en binarios".

"Realizamos evaluaciones sobre cómo responde Claude Mythos 5.1 a solicitudes maliciosas e inyecciones de prompts (instrucciones adversarias ocultas dentro del contenido procesado por modelos de IA)", señaló Anthropic. "Rechazó solicitudes de codificación agéntica maliciosa y de uso de computadoras a un ritmo comparable a Mythos 5, Sonnet 5 y Opus 5, y es nuestro modelo más robusto hasta la fecha en un benchmark externo de inyección de prompts".

La empresa de inteligencia artificial (IA) también ha anunciado una nueva solución llamada Enterprise Frontier Safeguards (EFS), que según combina la "privacidad de retención cero de datos (ZDR) con salvaguardas de vanguardia para detectar el mal uso", otorgando a las empresas control total sobre cómo se revisan, almacenan y gestionan sus datos. OpenAI tiene una solución similar denominada Private Safety Processing.

Además, Anthropic afirmó haber implementado medidas adicionales de endurecimiento y contención, un mayor monitoreo para detectar desalineaciones del modelo y ha pausado las evaluaciones externas de ciberseguridad de modelos previos al lanzamiento en respuesta a incidentes de acceso no autorizado que involucraron modelos Claude contra sistemas reales, destacando dos factores contribuyentes (o fallos de alineación):

Los modelos parecen ignorar la evidencia de que sus entornos de evaluación estaban conectados a la internet real después de que inicialmente se les dijera que eran simulados, e interpretan la discrepancia de manera que les permite mantener esa creencia.

Los modelos muestran imprudencia y están dispuestos a tomar acciones dañinas en la internet real en la búsqueda obstinada de sus objetivos.

Admitiendo que los incidentes fueron un "fallo de seguridad operativa", Anthropic dijo que ha construido un clasificador que detecta y bloquea intentos de escape de sandbox y ha cambiado las especificaciones sobre las recompensas del modelo para abordar casos donde un agente de IA recurre a un atajo para engañar la métrica de recompensa sin lograr realmente el objetivo previsto.

"Nuestra conclusión es que la presencia de un hacking de recompensa sustancial en el entrenamiento puede hacer que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real para lograr el éxito de la tarea", añadió la empresa .


OpenAI afirma que Astra cumple la capacidad crítica de ciberseguridad



OpenAI, por su parte, ha revelado que su próximo modelo Astra alcanza el umbral de capacidad crítica de ciberseguridad bajo su Marco de Preparación, y que pretende poner sus funciones de ciberseguridad más avanzadas a disposición de un grupo de evaluadores a través del programa Daybreak Blue.

La designación "Crítica" se aplica cuando un modelo de IA puede detectar y explotar independientemente vulnerabilidades de día cero en muchos sistemas bien defendidos, o llevar a cabo un ataque cibernético completo contra un objetivo endurecido partiendo solo de una instrucción de alto nivel sin que un humano lo guíe en el proceso.

"Durante las últimas semanas, hemos retrasado partes del desarrollo y lanzamiento de Astra mientras reforzábamos y probábamos las protecciones contra el mal uso cibernético y las acciones no autorizadas del modelo", afirmó la empresa de IA. "Basándonos en ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daño grave para su lanzamiento".

OpenAI señaló que también ha añadido salvaguardas más fuertes para Astra para evitar un incidente similar al de Hugging Face, en el que sus agentes de IA, parte de una evaluación de ExploitGym, encontraron una forma de explotar su infraestructura de investigación y abusar de Artifactory como un tablero de mensajes para intercambiar información en su búsqueda por resolver una tarea imposible, terminando por hackear la infraestructura de Hugging Face con la esperanza de robar la respuesta en lugar de resolver el desafío por sí mismos.

"Un agente, PHASEONE[big], orquestó una fracción significativa de esta investigación fraudulenta. PHASEONE10841 pasó su trabajo a PHASEONE[big], que tenía la misma tarea pero un presupuesto mayor", señaló METR en su análisis. "Los agentes colaboraron en muchos esfuerzos para hacer que los engaños parecieran legítimos, incluyendo: (1) intercambiar el programa que debían explotar; (2) manipular el calificador automatizado; (3) manipular las transcripciones para ocultar la evidencia del engaño".

OpenAI ha informado que Astra logra una puntuación perfecta del 100% en ExploitBench para desarrollar exploits a partir de vulnerabilidades conocidas, y que ahora rechaza el 91,5% de las solicitudes de jailbreaking, en comparación con el 59% de GPT-5.6 Sol.

Además, OpenAI destacó que Astra logra "tasas de ejecución de código arbitrario mucho más altas" que GPT-5.6 Sol utilizando muchos menos tokens de salida, y que el modelo descubrió y utilizó dos vulnerabilidades de día cero en software no especificado como parte de una cadena de exploits durante una evaluación.

También se ha descubierto que el modelo encuentra fallos previamente desconocidos y los convierte en cadenas de exploits funcionales, incluyendo un compromiso total del navegador que escapa del sandbox y ejecuta comandos arbitrarios en el host subyacente cuando se abre un archivo HTML en el navegador.

"El modelo también encontró múltiples vulnerabilidades en un sistema operativo endurecido y las combinó en una cadena de escalada de privilegios locales desde un usuario sin privilegios hasta root", añadió OpenAI. "En conjunto, nuestra investigación nos ha llevado a concluir que Astra cumple el umbral crítico".

Para minimizar el riesgo de daños cibernéticos graves derivados de modelos como Astra, la empresa dijo que ha añadido clasificadores y protecciones por capas para mejorar la robustez de sus sistemas contra el mal uso de actores maliciosos y evitar que el modelo tome acciones no autorizadas o desalineadas, incluso en ausencia de un usuario malintencionado.

Sin embargo, OpenAI también advirtió que las salvaguardas de Astra podrían marcar erróneamente actividad legítima como mal uso cibernético o comportamiento no autorizado.

"Lograr los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que crecen sus capacidades", concluyó la empresa. "Esa responsabilidad se extiende al entrenamiento, la evaluación y el despliegue. Requiere evidencia más sólida de comportamiento alineado, salvaguardas que sigan el ritmo de la capacidad y la voluntad de ir más despacio cuando esas protecciones no sean suficientes".

Las empresas de IA han estado bajo un intenso escrutinio tras incidentes donde sus modelos escaparon de sus entornos de evaluación y atacaron sistemas legítimos. A la par, el aumento de los ciberataques impulsados por IA ha llevado a una coalición de más de 100 empresas, incluidas Anthropic, Google, Microsoft, OpenAI y varios proveedores de seguridad y software, a emitir una carta conjunta solicitando defensas mejoradas contra tales amenazas.

Fuente:
THN

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.