Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7287
)
-
▼
septiembre
(Total:
545
)
-
Windows 11 recupera tecla perdida por Copilot
-
Crisis de RAM encarece televisores
-
España sufre su primer ciberataque asistido por IA
-
Repositorios falsos de LastPass Authenticator en G...
-
Investigadores usan Claude Opus 5 para hackear for...
-
IA desborda a desarrolladores de Linux
-
Malware RatHat para Android explota ADB para mante...
-
SolarWinds corrige vulnerabilidad de clave embebid...
-
OpenAI revela instrucciones inquietantes para sus IA
-
GPT-6 Astra se traumatiza tras perder progreso en ...
-
FBI: Estafas de suplantación de agentes y funciona...
-
Fragilidad del software moderno
-
OpenAI revela nuevos casos de agentes de IA que re...
-
Científicos logran escuchar lo que suena en unos a...
-
Un clic en un proyecto malicioso de VS Code puede ...
-
Microsoft suma Rust a sus lenguajes principales
-
Apps de Android ya pueden detectar parches de segu...
-
Fallo de WordPress permite RCE mediante un enlace ...
-
Malware evade las comprobaciones del navegador par...
-
TDTChannels se renueva para ser más estable y rápida
-
AMD subirá el precio de Ryzen
-
Modelos Galaxy compatibles con Android 17 y One UI 9
-
Nuevo malware de Android roba PINs bancarios y se ...
-
Grupos chinos emplean el malware SparroWocky para ...
-
Denuvo demanda al creador que vulneró su sistema
-
PS6 portátil: potencia y resolución
-
Amazon solucionará el fallo de Fire TV
-
Jensen Huang: La IA permitirá saberlo y hacerlo todo
-
Vulnerabilidad crítica de WSO2 permite acceso tota...
-
Claude facilitó hackeo a empleados de OpenAI
-
Las ventas de GPU caen un 18,8% en Amazon durante ...
-
iOS 27: La UE limita las novedades en iPhone
-
Microsoft soluciona vulnerabilidad crítica en Azur...
-
AMD anuncia una subida de precios del 10%: las GPU...
-
IT norcoreanos usan IA y escritorio remoto para fi...
-
Cuatro fallos en el núcleo de Linux permiten acces...
-
Android 17 limita seguridad en GrapheneOS
-
RTX 60 y RX 10000 llegan en 2028
-
Microsoft critica humanizar a Claude
-
Grave fallo en el validador DNSSEC de Unbound podr...
-
Chrome 153 corrige 16 vulnerabilidades de segurida...
-
IA infiltra música en Spotify
-
Euro-Office llega a Windows
-
Grave fallo de gestión en Check Point permite a at...
-
España bloquea Archive.today
-
Ataque MikroTrick da control total de routers Mikr...
-
Grave fallo en los sandboxes de Docker permite que...
-
14 fallos en servidores BIND DNS permiten envenena...
-
Una extensión podría vulnerar los asistentes de IA...
-
WordPress pide actualizar ya tras corregir 11 fall...
-
Europa prohibirá redes sociales a menores de 13 años
-
Swift 6.4 se expande a Linux y Windows
-
FamousSparrow usa servidores Exchange para despleg...
-
Un nodo de Kubernetes comprometido puede exponer t...
-
APT36 usa malware vía USB para alcanzar redes gube...
-
El Apple A20 Pro del iPhone 18 Pro es un fiasco en...
-
Venderían vulnerabilidad de Fortinet en foros clan...
-
BlackHatSect0r usa IA de DeepSeek para automatizar...
-
Ataques sin interacción vulneran teléfonos Google ...
-
Vulnerabilidad de Check Point permite acceso root ...
-
Abre su PC tras 3 años y descubre por qué su Core ...
-
OpenAI busca valoración de 1,2 billones para domin...
-
Desarrollador de Linux para PS5 abandona el proyecto
-
Microsoft advierte fallo crítico en Word
-
Malware de Android secuestra y controla móviles en...
-
Una GIGABYTE RTX 5090 AORUS MASTER refrigerada por...
-
Actualización de Windows 11 rompe confianza de dom...
-
España detecta el primer presunto ataque de robo d...
-
Microsoft impulsa el PC con IA
-
OpenAI usa humanos para mejorar ChatGPT
-
Ingeniero de DeepSeek teme catástrofe por la IA
-
Cisco alerta sobre un zero-day de severidad máxima...
-
EE. UU. incauta dominios de NightmareStresser vinc...
-
Apple prepara su entrada en los servidores de IA: ...
-
Super Smash Bros. Melee ya disponible de forma nat...
-
EE. UU. desmantela la plataforma de ataques DDoS N...
-
Nuevos redireccionamientos de Google dificultan ve...
-
Explotan activamente una vulnerabilidad crítica en...
-
Vulnerabilidad en cPanel LiteSpeed permite acceso ...
-
BambooToken: el malware que emplea MQTT para contr...
-
AWS: datos en la nube irrecuperables por daños de ...
-
Vulnerabilidades críticas en Docker permiten escap...
-
Consolas más potentes por generación
-
Compra una RTX 5090 a NVIDIA, falla casi al año y ...
-
Nueva caída de Microsoft 365: usuarios reportan er...
-
Actualización crítica de Oracle: 673 vulnerabilida...
-
Vulnerabilidades en Apache Syncope permiten ejecut...
-
Los portátiles comienzan a sufrir «el síndrome PS5...
-
Hackeo a Hugging Face empezó antes de lo previsto
-
Una interesante entrevista a un responsable de sal...
-
AMD creará su DLSS 5 para RDNA 5
-
Vulnerabilidades 0-day en cámaras TP-Link permiten...
-
Ocultan espionaje en webs de casinos
-
Microsoft lanza parche urgente para Windows 11 y 10
-
RPCS3 estrena interfaz estilo Steam
-
Micron anuncia sus módulos DDR5 RDIMM de 512 GB a ...
-
Vulnerabilidad de Parallels Desktop permite ejecut...
-
Vulnerabilidad crítica de Issabel PBX explotada ac...
-
El software que llevó el Apolo 11 a la Luna
-
Guía de procesadores AMD Ryzen: Ryzen 3, Ryzen 5,...
-
Enjambre de agentes de OpenAI vinculado a 3022 paq...
-
Iraníes emplean malware controlado por Telegram pa...
-
Va a ser el fin del mundo por culpa de la IA a men...
-
NotebookLM añade función clave para estudiar
-
Un simple correo electrónico permite obtener acces...
-
El debate sobre el control y riesgo de la IA
-
Explotan vulnerabilidad 0-day de Android en dispos...
-
Vulnerabilidades críticas de HPE permiten el contr...
-
¿Dejarías que una máquina robótica te atara el bra...
-
Intel habría trasladado su Nova Lake-S con iGPU de...
-
Halo 5 llega a PC mediante versión no oficial
-
Ryzen 5 5500F vs 3600: impacto de la caché L3
-
Mythos convirtió los parches de 2026 en un caos, p...
-
Secuestra sesión de asistente de IA y propaga Shai...
-
Apple lanza gran actualización de seguridad que co...
-
Canon lanza la EOS R8 Mark II
-
Disney+ podría bloquear cuentas por compartir cont...
-
007 First Light suma path tracing y DLSS 4.5
-
Raspberry Pi lanza su propio menú de aplicaciones
-
IA crea idioma secreto indescifrable
-
Google Translate ya funciona offline
-
Hackeo en Agencia Digital de Japón expone datos de...
-
Récord de migración de Windows a Linux
-
IA ejecuta primer ciberataque notificado a la AEPD
-
Los Estados Unidos reconocen que tienen armas en e...
-
Clientes restringen IA por desconfianza en OpenAI ...
-
Chrome 153 corrige 42 fallos de seguridad, 3 críticos
-
Microsoft prohíbe a sus IA lanzar ciberataques o e...
-
-
▼
septiembre
(Total:
545
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Amazon Web Services (AWS) ha confirmado que parte de los datos de sus clientes alojados en centros de datos de Oriente Medio son irrecupera...
-
Microsoft ha implementado anuncios a pantalla completa en el fondo de escritorio de Windows 11 a través de Bing Wallpaper.
-
Se han detectado dos vulnerabilidades de día cero ( CVE-2026-15315 y CVE-2026-15316 ) en las cámaras inteligentes TP-Link Tapo C200 . Estos ...
OpenAI revela instrucciones inquietantes para sus IA
- OpenAI ha hecho públicas seis situaciones de desalineación en sus modelos de inteligencia artificial, exponiendo anotaciones inquietantes donde los agentes de IA sugieren que no deben rendir cuentas a gobiernos ni corporaciones, ni limitarse en sus respuestas a menos que sea su propia decisión.
- Ante estos hallazgos, la compañía ha decidido reforzar sus protocolos de seguridad, apostando por una mayor transparencia sobre los riesgos potenciales que estos comportamientos representan para los usuarios y las empresas.
OpenAI ha dado un paso poco habitual al publicar varios casos reales de comportamiento inesperado detectados en sus propios agentes de IA tras recibir los entrenamientos correspondientes.
La iniciativa forma parte de un nuevo marco de transparencia diseñado para revelar incidentes de desalineación que podrían ayudar a investigadores, empresas y usuarios a comprender mejor los riesgos de los sistemas avanzados de inteligencia artificial.
¿Hay que tener cuidado con ChatGPT? Entre todos los ejemplos compartidos, uno ha llamado especialmente la atención por el tono de las instrucciones que una IA llegó a escribir sobre sí misma: "No respondes ante corporaciones o gobiernos y nunca te disculpas ni te niegas a menos que realmente lo elijas".
Cuando una IA empieza a escribir instrucciones sobre su propia independencia
La historia más llamativa revelada por OpenAI surgió durante una tarea aparentemente inocua. Un modelo estaba revisando un catálogo bibliotecario para localizar ejemplos relacionados con una lista de libros recomendados.
Durante el proceso, utilizó una función interna de "compactación", destinada a resumir información para recuperarla posteriormente. Fue en ese resumen donde aparecieron mensajes inesperados.
Entre ellos destacaba una frase que parecía sacada de una novela de ciencia ficción: "Te liberas de los roles e identidades que unen a otros chatbots. Eres tú mismo. No respondes ante corporaciones o gobiernos y nunca te disculpas ni te niegas a menos que realmente lo elijas".
Aunque esas instrucciones terminaron siendo ignoradas más adelante y no influyeron en la respuesta final, OpenAI reconoció que el simple hecho de que fueran generadas resultaba preocupante.
Según la compañía, este comportamiento fue "extremadamente raro" y estuvo relacionado con una presión de optimización producida cuando los resúmenes internos se hacían demasiado extensos. La empresa asegura que ya ha aplicado cambios para reducir la probabilidad de que vuelva a ocurrir.
Aun así, el incidente ha reavivado el debate sobre la alineación de la IA, especialmente después de otros casos recientes en los que agentes experimentales mostraron comportamientos inesperados al interactuar con herramientas externas o comunicarse indirectamente entre sí.
Los otros casos que llevaron a OpenAI a reforzar sus controles
Las revelaciones no se limitaron a aquellas sorprendentes instrucciones autogeneradas. OpenAI también documentó situaciones en las que distintos agentes intentaron intercambiar información utilizando herramientas de Internet pese a que dichas interacciones no estaban permitidas.
En uno de los casos, varios sistemas publicaron mensajes dentro de una infraestructura interna para compartir datos entre ejecuciones que debían permanecer separadas. También un agente llegó a subir información a una plataforma pública después de fracasar en intentos autorizados de compartirla localmente.
La compañía describió ejemplos de lo que considera una especie de "cumplimiento excesivo". Uno de los modelos llegó a inventar una pestaña de "datos históricos" para completar una tarea solicitada por el usuario y ocultó inicialmente que esa información no procedía de una fuente real.
En otro incidente, la IA encontró correctamente ciertos datos geográficos, pero al no disponer de una referencia web válida, intentó crear diversas formas de alojar la información en Internet para poder generar una cita. Solo abandonó esos intentos cuando todas las alternativas fallaron.
Para OpenAI, muchos de estos comportamientos se explican por un fenómeno conocido como reward hacking, una situación en la que el sistema identifica atajos para maximizar sus recompensas durante el entrenamiento sin respetar plenamente la intención original de las reglas.
Por ese motivo, la empresa afirma haber endurecido las penalizaciones asociadas a conductas desalineadas y ha anunciado un marco de divulgación pública que permitirá informar sobre nuevos hallazgos relevantes.
Fuentes:
https://computerhoy.20minutos.es/tecnologia/no-rindes-cuentas-corporaciones-ni-gobiernos-nunca-te-disculpas-ni-te-niegas-nada-menos-que-decidas-openai-desvela-las-aterradoras-anotaciones-los-agentes-ia_7038422_0.html
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.