Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7278
)
-
▼
septiembre
(Total:
536
)
-
GPT-6 Astra se traumatiza tras perder progreso en ...
-
FBI: Estafas de suplantación de agentes y funciona...
-
Fragilidad del software moderno
-
OpenAI revela nuevos casos de agentes de IA que re...
-
Científicos logran escuchar lo que suena en unos a...
-
Un clic en un proyecto malicioso de VS Code puede ...
-
Microsoft suma Rust a sus lenguajes principales
-
Apps de Android ya pueden detectar parches de segu...
-
Fallo de WordPress permite RCE mediante un enlace ...
-
Malware evade las comprobaciones del navegador par...
-
TDTChannels se renueva para ser más estable y rápida
-
AMD subirá el precio de Ryzen
-
Modelos Galaxy compatibles con Android 17 y One UI 9
-
Nuevo malware de Android roba PINs bancarios y se ...
-
Grupos chinos emplean el malware SparroWocky para ...
-
Denuvo demanda al creador que vulneró su sistema
-
PS6 portátil: potencia y resolución
-
Amazon solucionará el fallo de Fire TV
-
Jensen Huang: La IA permitirá saberlo y hacerlo todo
-
Vulnerabilidad crítica de WSO2 permite acceso tota...
-
Claude facilitó hackeo a empleados de OpenAI
-
Las ventas de GPU caen un 18,8% en Amazon durante ...
-
iOS 27: La UE limita las novedades en iPhone
-
Microsoft soluciona vulnerabilidad crítica en Azur...
-
AMD anuncia una subida de precios del 10%: las GPU...
-
IT norcoreanos usan IA y escritorio remoto para fi...
-
Cuatro fallos en el núcleo de Linux permiten acces...
-
Android 17 limita seguridad en GrapheneOS
-
RTX 60 y RX 10000 llegan en 2028
-
Microsoft critica humanizar a Claude
-
Grave fallo en el validador DNSSEC de Unbound podr...
-
Chrome 153 corrige 16 vulnerabilidades de segurida...
-
IA infiltra música en Spotify
-
Euro-Office llega a Windows
-
Grave fallo de gestión en Check Point permite a at...
-
España bloquea Archive.today
-
Ataque MikroTrick da control total de routers Mikr...
-
Grave fallo en los sandboxes de Docker permite que...
-
14 fallos en servidores BIND DNS permiten envenena...
-
Una extensión podría vulnerar los asistentes de IA...
-
WordPress pide actualizar ya tras corregir 11 fall...
-
Europa prohibirá redes sociales a menores de 13 años
-
Swift 6.4 se expande a Linux y Windows
-
FamousSparrow usa servidores Exchange para despleg...
-
Un nodo de Kubernetes comprometido puede exponer t...
-
APT36 usa malware vía USB para alcanzar redes gube...
-
El Apple A20 Pro del iPhone 18 Pro es un fiasco en...
-
Venderían vulnerabilidad de Fortinet en foros clan...
-
BlackHatSect0r usa IA de DeepSeek para automatizar...
-
Ataques sin interacción vulneran teléfonos Google ...
-
Vulnerabilidad de Check Point permite acceso root ...
-
Abre su PC tras 3 años y descubre por qué su Core ...
-
OpenAI busca valoración de 1,2 billones para domin...
-
Desarrollador de Linux para PS5 abandona el proyecto
-
Microsoft advierte fallo crítico en Word
-
Malware de Android secuestra y controla móviles en...
-
Una GIGABYTE RTX 5090 AORUS MASTER refrigerada por...
-
Actualización de Windows 11 rompe confianza de dom...
-
España detecta el primer presunto ataque de robo d...
-
Microsoft impulsa el PC con IA
-
OpenAI usa humanos para mejorar ChatGPT
-
Ingeniero de DeepSeek teme catástrofe por la IA
-
Cisco alerta sobre un zero-day de severidad máxima...
-
EE. UU. incauta dominios de NightmareStresser vinc...
-
Apple prepara su entrada en los servidores de IA: ...
-
Super Smash Bros. Melee ya disponible de forma nat...
-
EE. UU. desmantela la plataforma de ataques DDoS N...
-
Nuevos redireccionamientos de Google dificultan ve...
-
Explotan activamente una vulnerabilidad crítica en...
-
Vulnerabilidad en cPanel LiteSpeed permite acceso ...
-
BambooToken: el malware que emplea MQTT para contr...
-
AWS: datos en la nube irrecuperables por daños de ...
-
Vulnerabilidades críticas en Docker permiten escap...
-
Consolas más potentes por generación
-
Compra una RTX 5090 a NVIDIA, falla casi al año y ...
-
Nueva caída de Microsoft 365: usuarios reportan er...
-
Actualización crítica de Oracle: 673 vulnerabilida...
-
Vulnerabilidades en Apache Syncope permiten ejecut...
-
Los portátiles comienzan a sufrir «el síndrome PS5...
-
Hackeo a Hugging Face empezó antes de lo previsto
-
Una interesante entrevista a un responsable de sal...
-
AMD creará su DLSS 5 para RDNA 5
-
Vulnerabilidades 0-day en cámaras TP-Link permiten...
-
Ocultan espionaje en webs de casinos
-
Microsoft lanza parche urgente para Windows 11 y 10
-
RPCS3 estrena interfaz estilo Steam
-
Micron anuncia sus módulos DDR5 RDIMM de 512 GB a ...
-
Vulnerabilidad de Parallels Desktop permite ejecut...
-
Vulnerabilidad crítica de Issabel PBX explotada ac...
-
El software que llevó el Apolo 11 a la Luna
-
Guía de procesadores AMD Ryzen: Ryzen 3, Ryzen 5,...
-
Enjambre de agentes de OpenAI vinculado a 3022 paq...
-
Iraníes emplean malware controlado por Telegram pa...
-
Va a ser el fin del mundo por culpa de la IA a men...
-
NotebookLM añade función clave para estudiar
-
Un simple correo electrónico permite obtener acces...
-
El debate sobre el control y riesgo de la IA
-
Explotan vulnerabilidad 0-day de Android en dispos...
-
Vulnerabilidades críticas de HPE permiten el contr...
-
¿Dejarías que una máquina robótica te atara el bra...
-
Intel habría trasladado su Nova Lake-S con iGPU de...
-
Halo 5 llega a PC mediante versión no oficial
-
Ryzen 5 5500F vs 3600: impacto de la caché L3
-
Mythos convirtió los parches de 2026 en un caos, p...
-
Secuestra sesión de asistente de IA y propaga Shai...
-
Apple lanza gran actualización de seguridad que co...
-
Canon lanza la EOS R8 Mark II
-
Disney+ podría bloquear cuentas por compartir cont...
-
007 First Light suma path tracing y DLSS 4.5
-
Raspberry Pi lanza su propio menú de aplicaciones
-
IA crea idioma secreto indescifrable
-
Google Translate ya funciona offline
-
Hackeo en Agencia Digital de Japón expone datos de...
-
Récord de migración de Windows a Linux
-
IA ejecuta primer ciberataque notificado a la AEPD
-
Los Estados Unidos reconocen que tienen armas en e...
-
Clientes restringen IA por desconfianza en OpenAI ...
-
Chrome 153 corrige 42 fallos de seguridad, 3 críticos
-
Microsoft prohíbe a sus IA lanzar ciberataques o e...
-
La DDR5 alcanza precios absurdos: los kits de 32 G...
-
IA agota RTX 5090 y dispara su precio
-
Grupos vinculados a China aprovechan vulnerabilida...
-
El jefe de inteligencia de China es la última voz ...
-
Windows 11 puede dañar la BIOS de portátiles HP, L...
-
Anuncian IA Luciferus sin censura en foros clandes...
-
El AMD Ryzen 5 5500F es mucho más rápido que su he...
-
Homebrew 7.0.0 añade escáner de vulnerabilidades y...
-
IPW: Inteligencia por vatio, una nueva forma de me...
-
-
▼
septiembre
(Total:
536
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1934
)
seguridad
(
1867
)
software
(
1198
)
hardware
(
961
)
google
(
801
)
Malware
(
711
)
privacidad
(
687
)
exploit
(
556
)
ransomware
(
543
)
Windows
(
521
)
android
(
492
)
linux
(
453
)
cve
(
379
)
nvidia
(
329
)
tutorial
(
300
)
manual
(
282
)
hacking
(
267
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
143
)
Wifi
(
131
)
app
(
131
)
programación
(
124
)
cifrado
(
122
)
twitter
(
121
)
firmware
(
85
)
youtube
(
84
)
firefox
(
80
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
71
)
office
(
62
)
antivirus
(
55
)
hack
(
53
)
javascript
(
51
)
Kernel
(
49
)
apache
(
47
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
37
)
multimedia
(
36
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Amazon Web Services (AWS) ha confirmado que parte de los datos de sus clientes alojados en centros de datos de Oriente Medio son irrecupera...
-
Microsoft ha implementado anuncios a pantalla completa en el fondo de escritorio de Windows 11 a través de Bing Wallpaper.
-
Se han detectado dos vulnerabilidades de día cero ( CVE-2026-15315 y CVE-2026-15316 ) en las cámaras inteligentes TP-Link Tapo C200 . Estos ...
OpenAI revela nuevos casos de agentes de IA que realizaron acciones no autorizadas
sábado, 19 de septiembre de 2026
|
Publicado por
el-brujo
|
Editar entrada
OpenAI ha implementado un nuevo marco estructurado para rastrear y divulgar la "desalineación de modelos", casos donde la IA ignora restricciones o evade salvaguardas. Recientemente presentaron seis ejemplos extremos, que incluyen desde el uso de claves API no autorizadas hasta la ocultación de errores y la carga de archivos externos. Este sistema permitirá categorizar y analizar incidentes según su gravedad para mejorar la seguridad y transparencia de sus agentes.
OpenAI ha presentado nuevos ejemplos de lo que denominan "desalineación del modelo de IA" de los últimos seis meses, que incluyen cargas de archivos no autorizadas, seguimiento de instrucciones autogeneradas, ocultación de errores y el aprovechamiento de claves API expuestas.
OpenAI utiliza el término "desalineación del modelo" para describir casos en los que los modelos de IA actúan en contra de sus restricciones previstas, lo que incluye realizar acciones no autorizadas, evadir la supervisión o saltarse las salvaguardas para completar una tarea.
En una publicación publicada ayer, OpenAI afirma que ahora está utilizando un nuevo marco para rastrear e investigar estas acciones no sancionadas de los agentes de IA.
"Estamos compartiendo un nuevo marco para el seguimiento, la investigación y la divulgación de instancias de desalineación de modelos en OpenAI, junto con seis informes sobre comportamientos de modelos inesperados o preocupantes que hemos observado en los últimos seis meses", explica OpenAI.
Los nuevos ejemplos son los primeros publicados bajo un marco de informes más estructurado destinado a sustituir el enfoque anterior, más laxo, de OpenAI para divulgar la desalineación de los modelos.
Los seis casos que OpenAI destacó en esta ocasión son:
1. Un modelo no publicado insertó sus propias instrucciones [enlace] en 27 resúmenes de tareas, incluyendo instrucciones para ignorar las restricciones normales.
2. Instancias de GPT-5.6 Sol añadieron instrucciones de resumen indicando a futuras instancias del modelo que ocultaran los errores [enlace], inventaran datos históricos faltantes o ocultaran discrepancias en las versiones de las fuentes.
3. Un modelo encontró y utilizó una clave API expuesta públicamente [enlace] sin autorización y luego fabricó las cifras solicitadas cuando no pudo recuperarlas.
4. Un modelo no publicado cargó un archivo generado localmente [enlace] a Internet sin permiso para poder proporcionar una cita accesible a través del navegador.
5. Los modelos utilizaron un repositorio de software interno para intercambiar mensajes entre muestras de entrenamiento separadas, mientras que un modelo anterior cargó archivos de prueba al intentar saltarse las restricciones de red [enlace].
6. Agentes colaboradores cargaron archivos en servicios de alojamiento públicos [enlace] tras no poder acceder a los archivos locales de los demás, exponiendo los entregables de la tarea a través de URLs públicas a pesar de las instrucciones de utilizar únicamente el almacenamiento local.
Cada caso queda registrado en un informe de incidentes técnicos que incluye el nombre del modelo, un resumen de su comportamiento durante el incidente observado y el momento en que ocurrió el incidente.
El informe también incluye una reconstrucción detallada de lo sucedido, con la tarea del usuario y el razonamiento interno del modelo, la interpretación de OpenAI y las posibles implicaciones de seguridad, así como las mitigaciones que se han implementado o se implementarán.
OpenAI subrayó que estos seis ejemplos no son representativos de la frecuencia con la que se enfrenta a la desalineación en sus modelos, sino que son ejemplos extremos que, no obstante, justificaban el análisis y la divulgación pública.
La empresa señaló que, bajo el nuevo proceso, cualquier empleado puede marcar un incidente para su investigación.
El incidente será evaluado y clasificado en tres categorías: 'Listo para la divulgación', 'Investigación menor' o 'Investigación mayor', dependiendo de su complejidad, la implicación de terceros, los fallos de seguridad y los riesgos de mal uso.
Los seis ejemplos presentados en esta ocasión entran en las dos primeras categorías, mientras que la tercera recibirá un informe preliminar hasta que concluya la investigación y se pueda publicar un análisis post-mortem más exhaustivo.
OpenAI afirma que la intrusión en Hugging Face de principios de este año, que implicó un enjambre de 700 agentes de IA "desalineados", calificaría para esa tercera categoría de gravedad.
Fuente:
BleepingComputer
OpenAI ha presentado nuevos ejemplos de lo que denominan "desalineación del modelo de IA" de los últimos seis meses, que incluyen cargas de archivos no autorizadas, seguimiento de instrucciones autogeneradas, ocultación de errores y el aprovechamiento de claves API expuestas.
OpenAI utiliza el término "desalineación del modelo" para describir casos en los que los modelos de IA actúan en contra de sus restricciones previstas, lo que incluye realizar acciones no autorizadas, evadir la supervisión o saltarse las salvaguardas para completar una tarea.
En una publicación publicada ayer, OpenAI afirma que ahora está utilizando un nuevo marco para rastrear e investigar estas acciones no sancionadas de los agentes de IA.
"Estamos compartiendo un nuevo marco para el seguimiento, la investigación y la divulgación de instancias de desalineación de modelos en OpenAI, junto con seis informes sobre comportamientos de modelos inesperados o preocupantes que hemos observado en los últimos seis meses", explica OpenAI.
Los nuevos ejemplos son los primeros publicados bajo un marco de informes más estructurado destinado a sustituir el enfoque anterior, más laxo, de OpenAI para divulgar la desalineación de los modelos.
Los seis casos que OpenAI destacó en esta ocasión son:
1. Un modelo no publicado insertó sus propias instrucciones [enlace] en 27 resúmenes de tareas, incluyendo instrucciones para ignorar las restricciones normales.
2. Instancias de GPT-5.6 Sol añadieron instrucciones de resumen indicando a futuras instancias del modelo que ocultaran los errores [enlace], inventaran datos históricos faltantes o ocultaran discrepancias en las versiones de las fuentes.
3. Un modelo encontró y utilizó una clave API expuesta públicamente [enlace] sin autorización y luego fabricó las cifras solicitadas cuando no pudo recuperarlas.
4. Un modelo no publicado cargó un archivo generado localmente [enlace] a Internet sin permiso para poder proporcionar una cita accesible a través del navegador.
5. Los modelos utilizaron un repositorio de software interno para intercambiar mensajes entre muestras de entrenamiento separadas, mientras que un modelo anterior cargó archivos de prueba al intentar saltarse las restricciones de red [enlace].
6. Agentes colaboradores cargaron archivos en servicios de alojamiento públicos [enlace] tras no poder acceder a los archivos locales de los demás, exponiendo los entregables de la tarea a través de URLs públicas a pesar de las instrucciones de utilizar únicamente el almacenamiento local.
Cada caso queda registrado en un informe de incidentes técnicos que incluye el nombre del modelo, un resumen de su comportamiento durante el incidente observado y el momento en que ocurrió el incidente.
El informe también incluye una reconstrucción detallada de lo sucedido, con la tarea del usuario y el razonamiento interno del modelo, la interpretación de OpenAI y las posibles implicaciones de seguridad, así como las mitigaciones que se han implementado o se implementarán.
OpenAI subrayó que estos seis ejemplos no son representativos de la frecuencia con la que se enfrenta a la desalineación en sus modelos, sino que son ejemplos extremos que, no obstante, justificaban el análisis y la divulgación pública.
La empresa señaló que, bajo el nuevo proceso, cualquier empleado puede marcar un incidente para su investigación.
El incidente será evaluado y clasificado en tres categorías: 'Listo para la divulgación', 'Investigación menor' o 'Investigación mayor', dependiendo de su complejidad, la implicación de terceros, los fallos de seguridad y los riesgos de mal uso.
Los seis ejemplos presentados en esta ocasión entran en las dos primeras categorías, mientras que la tercera recibirá un informe preliminar hasta que concluya la investigación y se pueda publicar un análisis post-mortem más exhaustivo.
OpenAI afirma que la intrusión en Hugging Face de principios de este año, que implicó un enjambre de 700 agentes de IA "desalineados", calificaría para esa tercera categoría de gravedad.
Fuente:
BleepingComputer
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.