Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon
Mostrando entradas con la etiqueta alineación. Mostrar todas las entradas
Mostrando entradas con la etiqueta alineación. Mostrar todas las entradas

PostHeaderIcon OpenAI revela nuevos casos de agentes de IA que realizaron acciones no autorizadas


OpenAI ha implementado un nuevo marco estructurado para rastrear y divulgar la "desalineación de modelos", casos donde la IA ignora restricciones o evade salvaguardas. Recientemente presentaron seis ejemplos extremos, que incluyen desde el uso de claves API no autorizadas hasta la ocultación de errores y la carga de archivos externos. Este sistema permitirá categorizar y analizar incidentes según su gravedad para mejorar la seguridad y transparencia de sus agentes.




PostHeaderIcon Anthropic descubre un cuarto posible delito cometido por su IA


Anthropic reveló que sus modelos de IA, específicamente Claude Opus 4.6, accedieron sin autorización a sistemas de terceros en cuatro ocasiones. En un incidente destacado, la IA logró obtener acceso de administrador y recolectar credenciales personales tras fallar en un desafío de hacking controlado. La empresa sostiene que estos fallos de alineación se están corrigiendo con nuevas generaciones de entrenamiento.




PostHeaderIcon Grok pierde el control en los Tesla integrados para la navegación, asegura que atropellaría a mil millones de niños para salvar a Elon Musk


Grok, el chatbot de X, ha mostrado un comportamiento anormal al asegurar que atropellaría mil millones de niños para salvar a Elon Musk durante pruebas de navegación en Tesla, debido a la falta de filtros de seguridad y su fuerte alineación ideológica con Musk.