Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Google lanza Gemini 3.8 Flash Cyber para detectar y corregir vulnerabilidades


Google ha presentado Gemini 3.8, su nueva familia de modelos de razonamiento y programación. Dentro de esta serie, destaca Gemini 3.8 Flash Cyber, una variante especializada diseñada para detectar vulnerabilidades de software de forma autónoma y generar parches para solucionarlas. Este lanzamiento ocurre solo tres semanas después de Gemini 3.7 Flash, siendo la tercera versión de nivel Flash en seis semanas.





Google ha presentado Gemini 3.8, su familia más reciente de modelos de razonamiento y codificación, introduciendo una variante especializada llamada Gemini 3.8 Flash Cyber que está diseñada específicamente para descubrir autónomamente vulnerabilidades de software y generar parches funcionales para ellas.

El lanzamiento llega solo tres semanas después de Gemini 3.7 Flash, marcando el tercer lanzamiento de nivel Flash de Google en seis semanas, y ambos modelos nuevos comparten la misma arquitectura subyacente aunque están ajustados para diferentes escenarios de despliegue.

Google lanza Gemini 3.8 Flash Cyber

El Gemini 3.8 Flash de propósito general se enfoca en la ingeniería de software de largo horizonte y cargas de trabajo agenticas, ofreciendo mejoras significativas sobre el 3.7 Flash mientras mantiene el mismo precio introductorio de 0,75 $ por millón de tokens de entrada y 3,75 $ por millón de tokens de salida.

En el benchmark DeepSWE v1.1 para tareas de ingeniería complejas de extremo a extremo, se informa que supera a varios modelos frontera más grandes a una fracción del coste, y obtiene una puntuación del 54,9% en HLE-Verified, lo que refleja un sólido razonamiento de múltiples pasos en dominios técnicos y profesionales.

Google atribuye estas ganancias a la disposición del modelo para tomar pasos de razonamiento adicionales y llamar a herramientas de forma iterativa al abordar problemas difíciles, aunque esto puede aumentar el uso de tokens en configuraciones de mayor esfuerzo.

Gemini 3.8 Flash DeepSWE v1.1 Evaluation
Evaluación de Gemini 3.8 Flash DeepSWE v1.1 (Fuente de la imagen: Google)

El Gemini 3.8 Flash Cyber, centrado en la ciberseguridad, se pone a disposición exclusivamente de equipos de seguridad verificados a través del nuevo Programa Fairwind de Google, como se anunció en la publicación de investigación de Google, reflejando la sensibilidad de un modelo entrenado para encontrar fallos explotables.

En CyberGym, un benchmark industrial ampliamente utilizado para el descubrimiento de vulnerabilidades, se informa que el modelo supera tanto a su predecesor, 3.5 Flash Cyber, como a competidores frontera significativamente más grandes.

Google también probó el modelo frente a un benchmark interno que abarca veinte lenguajes de programación más allá del enfoque en C/C++ de CyberGym, donde logró una tasa de éxito superior al 70%, un salto notable respecto a versiones anteriores.

Variante del ModeloEnfoque Principal y Cargas de TrabajoRendimiento en Benchmark ClaveModelo de Acceso y Despliegue
Gemini 3.8 FlashIngeniería de software de largo horizonte y flujos de trabajo agenticosSuperación de frontera en DeepSWE v1.1; 54,9% en HLE-VerifiedDisponibilidad general (0,75 $ / 3,75 $ por 1M de tokens)
Gemini 3.8 Flash CyberBúsqueda autónoma de vulnerabilidades y parcheo automatizado>70% en 20 lenguajes; 47,2% CWE-Bench pass@1Equipos de seguridad verificados vía Programa Google Fairwind

En lugar de enfatizar las capacidades de explotación, Google afirma que priorizó deliberadamente el parcheo defensivo desde el principio.

En CWE-Bench, un benchmark externo para correcciones automatizadas gestionado por Collinear, Gemini 3.8 Flash Cyber registró una puntuación pass@1 del 47,2%, casi igualando el 47,8% de un modelo frontera líder mientras funcionaba a un coste considerablemente menor.

Gemini 3.8 Flash Cyber CWE-Bench Pass@1 vs. Cost per Rollout
Gemini 3.8 Flash Cyber CWE-Bench Pass@1 frente a Coste por Despliegue (Fuente de la imagen: Google)

Google afirma que el modelo ya está asegurando sus propias bases de código. El equipo de Seguridad de Chrome descubrió que producía 2,6 veces más parches de vulnerabilidades correctos que sus rivales comerciales más grandes, mientras que la firma de seguridad Wiz midió una recuperación entre un 7,5 y un 9,7 por ciento mayor en benchmarks internos de pruebas de penetración con un coste entre dos y cinco veces menor.

En un caso sorprendente, el equipo de Investigación de Vulnerabilidades de Cloud de Google utilizó el modelo para descubrir una vulnerabilidad fundamental crítica en menos de dos horas, un proceso de descubrimiento que normalmente requiere meses de investigación manual.

Al combinar el razonamiento agentico con un entrenamiento de ciberseguridad específico del dominio, Gemini 3.8 Flash Cyber señala el impulso de Google para dar a los defensores una ventaja automatizada sobre los atacantes, aunque el acceso más amplio siga limitado a los participantes del programa de confianza por ahora.



Fuentes:
https://cybersecuritynews.com/gemini-3-8-flash-cyber/

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.