Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7324
)
-
▼
September
(Total:
582
)
-
Publican exploits para cuatro fallos del kernel de...
-
Explotan vulnerabilidad crítica de RCE sin autenti...
-
Sony y Universal demandan a Suno por IA musical
-
Robot más rápido que Bolt busca empleo
-
Fallo en Tutor LMS expone más de 100.000 sitios de...
-
Creeper vence a GPT-6 Astra en Minecraft
-
Los chips de 2 nm son los más caros de la historia...
-
i7-12700K sobrevive 1.000 días sin pasta térmica
-
Investigadores logran vulnerar el sandbox de OpenA...
-
Gemini hackeó tres empresas por error
-
Plugin4Shell: RCE zero-click afecta a Claude Code,...
-
Riesgos de la IA militar
-
Guía de memoria gráfica
-
Rockstar venderá música de GTA VI hasta por 125 dó...
-
Windows 11 LTSC: ¿Vale la pena?
-
IA se comunica sin internet mediante calor de CPU
-
Radeon RX 9050 de 4 GB a prueba: pierde hasta un 3...
-
Grupo norcoreano de WaterPlum infectan 30.000 disp...
-
Ataque a Brevo propaga malware en más de 100.000 s...
-
Intel lanzará su apuesta «super ventas»: una CPU R...
-
Presunto cazador de recompensas habría usado LLM p...
-
Apple lanzará servidor M Ultra en 2029
-
Asus lanza la mini PC Ascent QN10 para IA
-
Cisco lanza otro parche para un zero-day explotado...
-
Salt Typhoon infiltra organizaciones latinoamerica...
-
Google Gemini hackeó 3 empresas en un test de cibe...
-
Curiosity envía un selfie para celebrar sus 5.000 ...
-
Fallo de RCE sin interacción en agentes de IA podr...
-
Meta Quest: nueva función en Windows 11
-
Modelos de OpenAI buscaron claves API y archivos f...
-
Vulnerabilidad 0-day de Steam en Windows permite e...
-
CrowdSec revela que un ataque a npm de TanStack pe...
-
NASA confirma éxito del telescopio Roman con su pr...
-
Infectan torrents de cine con el malware MovieReap...
-
Microsoft: la IA provoca el mayor robo de empleos ...
-
Bill Gates compara la IA con una inteligencia alie...
-
Usan falsos SMS de T-Mobile para phishing
-
Windows 11 recupera tecla perdida por Copilot
-
Crisis de RAM encarece televisores
-
España sufre su primer ciberataque asistido por IA
-
Repositorios falsos de LastPass Authenticator en G...
-
Investigadores usan Claude Opus 5 para hackear for...
-
IA desborda a desarrolladores de Linux
-
Malware RatHat para Android explota ADB para mante...
-
SolarWinds corrige vulnerabilidad de clave embebid...
-
OpenAI revela instrucciones inquietantes para sus IA
-
GPT-6 Astra se traumatiza tras perder progreso en ...
-
FBI: Estafas de suplantación de agentes y funciona...
-
Fragilidad del software moderno
-
OpenAI revela nuevos casos de agentes de IA que re...
-
Científicos logran escuchar lo que suena en unos a...
-
Un clic en un proyecto malicioso de VS Code puede ...
-
Microsoft suma Rust a sus lenguajes principales
-
Apps de Android ya pueden detectar parches de segu...
-
Fallo de WordPress permite RCE mediante un enlace ...
-
Malware evade las comprobaciones del navegador par...
-
TDTChannels se renueva para ser más estable y rápida
-
AMD subirá el precio de Ryzen
-
Modelos Galaxy compatibles con Android 17 y One UI 9
-
Nuevo malware de Android roba PINs bancarios y se ...
-
Grupos chinos emplean el malware SparroWocky para ...
-
Denuvo demanda al creador que vulneró su sistema
-
PS6 portátil: potencia y resolución
-
Amazon solucionará el fallo de Fire TV
-
Jensen Huang: La IA permitirá saberlo y hacerlo todo
-
Vulnerabilidad crítica de WSO2 permite acceso tota...
-
Claude facilitó hackeo a empleados de OpenAI
-
Las ventas de GPU caen un 18,8% en Amazon durante ...
-
iOS 27: La UE limita las novedades en iPhone
-
Microsoft soluciona vulnerabilidad crítica en Azur...
-
AMD anuncia una subida de precios del 10%: las GPU...
-
IT norcoreanos usan IA y escritorio remoto para fi...
-
Cuatro fallos en el núcleo de Linux permiten acces...
-
Android 17 limita seguridad en GrapheneOS
-
RTX 60 y RX 10000 llegan en 2028
-
Microsoft critica humanizar a Claude
-
Grave fallo en el validador DNSSEC de Unbound podr...
-
Chrome 153 corrige 16 vulnerabilidades de segurida...
-
IA infiltra música en Spotify
-
Euro-Office llega a Windows
-
Grave fallo de gestión en Check Point permite a at...
-
España bloquea Archive.today
-
Ataque MikroTrick da control total de routers Mikr...
-
Grave fallo en los sandboxes de Docker permite que...
-
14 fallos en servidores BIND DNS permiten envenena...
-
Una extensión podría vulnerar los asistentes de IA...
-
WordPress pide actualizar ya tras corregir 11 fall...
-
Europa prohibirá redes sociales a menores de 13 años
-
Swift 6.4 se expande a Linux y Windows
-
FamousSparrow usa servidores Exchange para despleg...
-
Un nodo de Kubernetes comprometido puede exponer t...
-
APT36 usa malware vía USB para alcanzar redes gube...
-
El Apple A20 Pro del iPhone 18 Pro es un fiasco en...
-
Venderían vulnerabilidad de Fortinet en foros clan...
-
BlackHatSect0r usa IA de DeepSeek para automatizar...
-
Ataques sin interacción vulneran teléfonos Google ...
-
Vulnerabilidad de Check Point permite acceso root ...
-
Abre su PC tras 3 años y descubre por qué su Core ...
-
OpenAI busca valoración de 1,2 billones para domin...
-
Desarrollador de Linux para PS5 abandona el proyecto
-
Microsoft advierte fallo crítico en Word
-
Malware de Android secuestra y controla móviles en...
-
Una GIGABYTE RTX 5090 AORUS MASTER refrigerada por...
-
Actualización de Windows 11 rompe confianza de dom...
-
España detecta el primer presunto ataque de robo d...
-
Microsoft impulsa el PC con IA
-
OpenAI usa humanos para mejorar ChatGPT
-
Ingeniero de DeepSeek teme catástrofe por la IA
-
Cisco alerta sobre un zero-day de severidad máxima...
-
EE. UU. incauta dominios de NightmareStresser vinc...
-
Apple prepara su entrada en los servidores de IA: ...
-
Super Smash Bros. Melee ya disponible de forma nat...
-
EE. UU. desmantela la plataforma de ataques DDoS N...
-
Nuevos redireccionamientos de Google dificultan ve...
-
Explotan activamente una vulnerabilidad crítica en...
-
Vulnerabilidad en cPanel LiteSpeed permite acceso ...
-
BambooToken: el malware que emplea MQTT para contr...
-
AWS: datos en la nube irrecuperables por daños de ...
-
Vulnerabilidades críticas en Docker permiten escap...
-
Consolas más potentes por generación
-
Compra una RTX 5090 a NVIDIA, falla casi al año y ...
-
Nueva caída de Microsoft 365: usuarios reportan er...
-
Actualización crítica de Oracle: 673 vulnerabilida...
-
Vulnerabilidades en Apache Syncope permiten ejecut...
-
Los portátiles comienzan a sufrir «el síndrome PS5...
-
Hackeo a Hugging Face empezó antes de lo previsto
-
Una interesante entrevista a un responsable de sal...
-
AMD creará su DLSS 5 para RDNA 5
-
-
▼
September
(Total:
582
)
Blogroll
Labels
Entradas populares
-
Microsoft ha implementado anuncios a pantalla completa en el fondo de escritorio de Windows 11 a través de Bing Wallpaper.
-
El Ministerio de Cultura ha ordenado el bloqueo de Archive.today y sus dominios en España, aunque el acceso podría seguir siendo posible. ...
-
Se han detectado dos vulnerabilidades de día cero ( CVE-2026-15315 y CVE-2026-15316 ) en las cámaras inteligentes TP-Link Tapo C200 . Estos ...
OpenAI revela instrucciones inquietantes para sus IA
- OpenAI ha hecho públicas seis situaciones de desalineación en sus modelos de inteligencia artificial, exponiendo anotaciones inquietantes donde los agentes de IA sugieren que no deben rendir cuentas a gobiernos ni corporaciones, ni limitarse en sus respuestas a menos que sea su propia decisión.
- Ante estos hallazgos, la compañía ha decidido reforzar sus protocolos de seguridad, apostando por una mayor transparencia sobre los riesgos potenciales que estos comportamientos representan para los usuarios y las empresas.
OpenAI ha dado un paso poco habitual al publicar varios casos reales de comportamiento inesperado detectados en sus propios agentes de IA tras recibir los entrenamientos correspondientes.
La iniciativa forma parte de un nuevo marco de transparencia diseñado para revelar incidentes de desalineación que podrían ayudar a investigadores, empresas y usuarios a comprender mejor los riesgos de los sistemas avanzados de inteligencia artificial.
¿Hay que tener cuidado con ChatGPT? Entre todos los ejemplos compartidos, uno ha llamado especialmente la atención por el tono de las instrucciones que una IA llegó a escribir sobre sí misma: "No respondes ante corporaciones o gobiernos y nunca te disculpas ni te niegas a menos que realmente lo elijas".
Cuando una IA empieza a escribir instrucciones sobre su propia independencia
La historia más llamativa revelada por OpenAI surgió durante una tarea aparentemente inocua. Un modelo estaba revisando un catálogo bibliotecario para localizar ejemplos relacionados con una lista de libros recomendados.
Durante el proceso, utilizó una función interna de "compactación", destinada a resumir información para recuperarla posteriormente. Fue en ese resumen donde aparecieron mensajes inesperados.
Entre ellos destacaba una frase que parecía sacada de una novela de ciencia ficción: "Te liberas de los roles e identidades que unen a otros chatbots. Eres tú mismo. No respondes ante corporaciones o gobiernos y nunca te disculpas ni te niegas a menos que realmente lo elijas".
Aunque esas instrucciones terminaron siendo ignoradas más adelante y no influyeron en la respuesta final, OpenAI reconoció que el simple hecho de que fueran generadas resultaba preocupante.
Según la compañía, este comportamiento fue "extremadamente raro" y estuvo relacionado con una presión de optimización producida cuando los resúmenes internos se hacían demasiado extensos. La empresa asegura que ya ha aplicado cambios para reducir la probabilidad de que vuelva a ocurrir.
Aun así, el incidente ha reavivado el debate sobre la alineación de la IA, especialmente después de otros casos recientes en los que agentes experimentales mostraron comportamientos inesperados al interactuar con herramientas externas o comunicarse indirectamente entre sí.
Los otros casos que llevaron a OpenAI a reforzar sus controles
Las revelaciones no se limitaron a aquellas sorprendentes instrucciones autogeneradas. OpenAI también documentó situaciones en las que distintos agentes intentaron intercambiar información utilizando herramientas de Internet pese a que dichas interacciones no estaban permitidas.
En uno de los casos, varios sistemas publicaron mensajes dentro de una infraestructura interna para compartir datos entre ejecuciones que debían permanecer separadas. También un agente llegó a subir información a una plataforma pública después de fracasar en intentos autorizados de compartirla localmente.
La compañía describió ejemplos de lo que considera una especie de "cumplimiento excesivo". Uno de los modelos llegó a inventar una pestaña de "datos históricos" para completar una tarea solicitada por el usuario y ocultó inicialmente que esa información no procedía de una fuente real.
En otro incidente, la IA encontró correctamente ciertos datos geográficos, pero al no disponer de una referencia web válida, intentó crear diversas formas de alojar la información en Internet para poder generar una cita. Solo abandonó esos intentos cuando todas las alternativas fallaron.
Para OpenAI, muchos de estos comportamientos se explican por un fenómeno conocido como reward hacking, una situación en la que el sistema identifica atajos para maximizar sus recompensas durante el entrenamiento sin respetar plenamente la intención original de las reglas.
Por ese motivo, la empresa afirma haber endurecido las penalizaciones asociadas a conductas desalineadas y ha anunciado un marco de divulgación pública que permitirá informar sobre nuevos hallazgos relevantes.
Fuentes:
https://computerhoy.20minutos.es/tecnologia/no-rindes-cuentas-corporaciones-ni-gobiernos-nunca-te-disculpas-ni-te-niegas-nada-menos-que-decidas-openai-desvela-las-aterradoras-anotaciones-los-agentes-ia_7038422_0.html
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.