Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Z.ai presenta GLM-5.3 con mejoras en programación y ciberseguridad


Z.ai ha lanzado GLM-5.3, un nuevo modelo de IA diseñado para gestionar análisis de ciberseguridad, tareas de agentes de larga duración y programación compleja. A diferencia de versiones anteriores, este modelo se ha optimizado mediante un post-entrenamiento a gran escala, enfocándose en el entrenamiento de agentes de IA en entornos de tareas realistas en lugar de simples ejercicios de código.



Z.ai ha lanzado GLM-5.3, un nuevo modelo de IA diseñado para manejar codificación compleja, tareas de agentes de larga duración y análisis de ciberseguridad. La empresa afirma que el modelo utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de un post-entrenamiento a mayor escala.

El lanzamiento se centra en entrenar agentes de IA en entornos de tareas realistas en lugar de ejercicios cortos de programación. Estos entornos pueden incluir bases de código, documentación, sistemas de almacenamiento, resultados de experimentos, herramientas de prueba y flujos de trabajo de varios pasos.

En un ejemplo, un agente podría necesitar identificar un cuello de botella en un stack de entrenamiento de aprendizaje automático, implementar una optimización, ejecutar pruebas y demostrar una mejora en el rendimiento sin romper la funcionalidad.

LLM Performance Evaluation (source : z.ai )
Evaluación del rendimiento del LLM (fuente: z.ai)

Z.ai señaló que GLM-5.3 logró avances significativos en codificación en varios puntos de referencia. Obtuvo una puntuación de 28.3 en Terminal-Bench 3.0, frente a los 4.6 de GLM-5.2. En DeepSWE v1.1, el nuevo modelo alcanzó 66.9, frente a los 46.2 anteriores.

La empresa también informó de una mejora del 50% en su Z.ai Code Bench interno, que mide a los agentes de codificación en entornos de desarrollo local más realistas. El modelo incluye tres configuraciones de razonamiento: baja, alta y máxima.

Mejoras principales de GLM-5.3

Z.ai te recomienda la configuración máxima para tareas de codificación porque permite que el modelo dedique más esfuerzo a planificar, implementar, probar y verificar el trabajo. A diferencia de las versiones anteriores, GLM-5.3 no permite desactivar completamente el razonamiento.

La ciberseguridad es una de las áreas de mejora más notables. Z.ai afirmó que añadió datos de descubrimiento de vulnerabilidades y entornos de tareas centrados en la seguridad durante el post-entrenamiento.

La empresa esperaba una mejor detección de errores, pero señaló que el modelo también ha mejorado al conectar varias etapas de una ruta de ataque, incluyendo el análisis de vulnerabilidades y el razonamiento de explotación.

Agent coding performance by effort level (source : z.ai )
Rendimiento de codificación del agente por nivel de esfuerzo (fuente: z.ai)

En CyberGym, un benchmark que prueba el descubrimiento de vulnerabilidades de caja blanca en código fuente, GLM-5.3 obtuvo un 84.5%, frente al 77.2% de GLM-5.2.

En ExploitBench, su puntuación subió del 24.4% al 54.4%. En ExploitGym, GLM-5.3 completó 105 tareas de explotación en dos horas y 130 en seis horas, mientras que GLM-5.2 completó 29 y 39 tareas bajo los mismos plazos de tiempo.

Z.ai enfatizó que las ganancias más fuertes aparecieron más adelante en la cadena de explotación. Esto podría ayudarte a identificar debilidades complejas que involucren múltiples componentes, suposiciones inseguras y fallos encadenados.

Evaluación de ciberseguridad (fuente: z.ai)

Sin embargo, la empresa también reconoció que los modelos cerrados líderes siguen obteniendo puntuaciones más altas en algunos benchmarks de explotación. La empresa señaló que GLM-5.3 ya ha sido probado con equipos de seguridad contra bases de código del mundo real.

Tras la revisión de expertos y la eliminación de duplicados, el modelo identificó presuntamente 2,436 vulnerabilidades en 269 proyectos. De estos hallazgos, 1,097 fueron calificados con severidad de media a alta.

El software afectado incluyó presuntamente kernels, sistemas operativos, motores de navegador, aplicaciones web, protocolos de red e infraestructura de código abierto.

Z.ai ha creado un Registro de Divulgación de Seguridad público para rastrear los hallazgos a través de la divulgación coordinada. En el lanzamiento, 53 hallazgos habían sido divulgados públicamente, mientras que 2,383 permanecían bajo embargo.

El fallo más antiguo reportado fue introducido en 1981, lo que muestra cuánto tiempo pueden permanecer ocultas las vulnerabilidades en código ampliamente utilizado. Se espera que los pesos del modelo se publiquen dos semanas después del lanzamiento, tras la evaluación de seguridad y el endurecimiento.



Fuentes:
https://cybersecuritynews.com/glm-5-3-major-enhancements/

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.