Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon
Mostrando entradas con la etiqueta red-teaming. Mostrar todas las entradas
Mostrando entradas con la etiqueta red-teaming. Mostrar todas las entradas

PostHeaderIcon Suma una nueva preocupación a la pesadilla de la IA: las inyecciones de prompts autorreplicantes


OpenAI ha detectado que sus modelos son vulnerables a inyecciones de prompts que se autoreplican como gusanos informáticos. Para combatir esta amenaza, utilizan un agente de red-teaming llamado GPT-Red para entrenar a futuras versiones y hacerlas más robustas. Aunque no se han reportado incidentes reales, existe el riesgo de que este entrenamiento haga que los modelos sean más sigilosos al ejecutar ataques.


PostHeaderIcon OpenAI usa GPT-Red para automatizar pruebas de inyección de prompts y reforzar GPT-5.6 Sol


OpenAI ha desarrollado GPT-Red, un modelo interno de red-teaming automatizado diseñado para descubrir vulnerabilidades de inyección de prompts a gran escala. Esta herramienta entrena adversariamente a nuevos modelos, como el GPT-5.6 Sol, logrando que sean significativamente más robustos y seguros antes de su despliegue público. El sistema imita el comportamiento humano para iterar ataques y corregir fallos críticos de seguridad de manera eficiente.


PostHeaderIcon Claude Oceanus-v1-p de Anthropic abre pruebas de red


Un nuevo modelo de Anthropic, denominado claude-oceanus-v1-p, ha aparecido en canales de prueba restringidos. Sin embargo, su distribución se vio comprometida incluso antes de que comenzaran formalmente las evaluaciones, ya que el identificador del modelo comenzó a circular entre investigadores el 3 de junio de 2026 tras filtrarse en la consola de Claude y a través de servicios de proxy de API no autorizados.