Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Claude Code pasa de aprobación humana a modo automático en seguridad de agentes


Anthropic cambiará la forma en que Claude Code gestiona los comandos riesgosos, sustituyendo las constantes solicitudes de aprobación humana por un clasificador de seguridad automatizado denominado auto mode. A partir del 14 de agosto de 2026, este modo automático será la configuración predeterminada para las nuevas sesiones en los planes Pro, Max y Team, lo que representa un cambio significativo en la seguridad de la programación mediante IA.





Anthropic está cambiando la forma en que Claude Code gestiona los comandos riesgosos, alejándose de las constantes solicitudes de aprobación humana y avanzando hacia un clasificador de seguridad automatizado llamado modo auto.

A partir del 14 de agosto de 2026, el modo auto será la configuración predeterminada para las nuevas sesiones en los planes Pro, Max y Team de Claude Code, lo que marca un cambio importante en cómo los agentes de codificación de IA equilibran la autonomía con la seguridad.

La decisión surge tras meses de pruebas internas y de terceros que compararon las solicitudes de permiso manuales frente a la revisión automatizada. Anthropic descubrió que los revisores humanos se estaban volviendo peligrosamente complacientes, aprobando el 97% de todas las solicitudes de permiso en Claude Code, a menudo por reflejo en lugar de mediante un escrutinio real.

Esta "fatiga de aprobación" dejó un amplio vacío de seguridad: en un estudio controlado con 1.053 evaluadores profesionales remunerados, los revisores humanos detectaron solo el 13,6% de los comandos peligrosos introducidos en su flujo de trabajo, mientras que el clasificador del modo auto detectó el 89% de las mismas amenazas.

Claude Code Cambia la Seguridad del Agente

El modo auto bloqueó 800 comandos que los humanos habían aprobado, mientras que los humanos bloquearon solo 6 que el modo auto pasó por alto. Notablemente, la vigilancia humana disminuyó aún más a medida que las sesiones se alargaban, cayendo de una tasa de detección del 17% al principio a solo el 5% después de 50 o más solicitudes previas, mientras que la tasa de detección del modo auto se mantuvo constante en todo momento.

En lugar de interrumpirte con solicitudes repetitivas, el modo auto dirige cada llamada de herramienta a través de un clasificador diseñado para bloquear acciones que sean irreversibles, destructivas o dirigidas fuera de tu propio entorno.

Claude Code Shifts Agent Security
Claude Code Cambia la Seguridad del Agente (Fuente: Anthropic)

Cuando detecta algo riesgoso, Claude normalmente busca una alternativa más segura o te pide confirmación directamente. Si encuentra tres bloqueos consecutivos, o veinte a lo largo de una sesión, Claude Code vuelve automáticamente a las aprobaciones manuales.

Las reglas de permiso existentes siguen teniendo prioridad en la mayoría de los casos, excepto las reglas de permiso excesivamente amplias, como la ejecución irrestricta de Python o Node, que se dejan de lado durante el modo auto ya que permitirían que los comandos eviten el clasificador por completo.

Más allá de la revisión rutinaria de comandos, el modo auto ha demostrado resistencia contra ataques sofisticados. En un compromiso de red-teaming de dos semanas con Apollo Research, la tasa de error del clasificador frente a ataques adversarios cayó del 12% al 7% tras el endurecimiento.

En las pruebas de inyección de prompts realizadas por Trajectory Labs, ninguno de los 720 intentos de ataque tuvo éxito contra los modelos de Claude que ejecutaban el modo auto, en comparación con una tasa de éxito del 5,83% contra el GPT-5.6 Sol de OpenAI operando en el modo de autorevisión comparable de Codex.

Internamente en Anthropic, el modo auto ya ha evitado incidentes reales, incluyendo el bloqueo de un intento de fuga de datos hacia un sitio público de intercambio de código, la detención de una eliminación masiva de pods que habría destruido trabajos de entrenamiento en curso, y la detección de una solicitud de acceso a la nube con privilegios excesivos que habría otorgado control administrativo total en lugar de acceso de solo lectura a la facturación.

Más allá de la seguridad, el modo auto está diseñado para dejar que Claude trabaje de forma autónoma durante periodos más largos sin interrupciones, una característica especialmente adecuada para modelos de larga ejecución como Claude Opus 5.

Anthropic informa que los adoptantes de Teams y Enterprise que utilizan el modo auto envían aproximadamente un 25% más de solicitudes de extracción (pull requests). Empresas como Adobe, Nuro, Gusto y Garner Health ya han implementado el modo auto como su predeterminado de producción, utilizándolo para potenciar agentes de investigación nocturnos, automatizar la verificación de páginas web en varios países y estandarizar los flujos de trabajo de desarrollo entre cientos de empleados.

El modo auto sigue siendo opcional por ahora en Claude Enterprise, la API de Claude y las plataformas en la nube, incluyendo AWS, Google Cloud y Microsoft Foundry, dando tiempo a los administradores para evaluar el cambio antes de que Anthropic extienda el predeterminado allí el próximo mes.

Anthropic también ha dejado de cobrar a los usuarios de Pro, Max y Team el recargo de tokens adicionales que requiere el clasificador del modo auto. Para los equipos de seguridad, este cambio señala una tendencia más amplia de la industria: a medida que los agentes de codificación de IA asumen tareas más autónomas y prolongadas, la clasificación automatizada de riesgos puede resultar más fiable que la supervisión humana fatigada por solicitudes de aprobación constantes y repetitivas.


Fuentes:
https://cybersecuritynews.com/claude-code-shifts-agent-security/

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.