Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6219
)
-
▼
July
(Total:
710
)
-
Microsoft pierde dinero con Xbox Series X-S
-
iPhone 20: lo último
-
Vulnerabilidad en NVIDIA BlueField permite ejecuci...
-
Apple apuesta por las suscripciones
-
BlueNoroff lanza kit de phishing de Zoom que anali...
-
Gemini para Mac se renueva con una función impresc...
-
Intel logra fabricar chips gigantes
-
Samsung multiplicó sus beneficios x19 en el Q2 202...
-
Falso instalador de Flash Player usa certificado d...
-
Seagate planea lanzar discos duros Mozaic 5 de 50 ...
-
Las Radeon RX 9070 XT más baratas son más propensa...
-
GitLab corrige 13 fallos de seguridad que filtran ...
-
Campaña de minería en Linux usa PAM para ocultar b...
-
Llamada de Teams de dos minutos podría cifrar tu r...
-
Estafa de nueve años clona webs de empresas rusas ...
-
Explotan vulnerabilidad 0-day de Cisco FMC para ro...
-
Desarrollador afirma que Claude Opus 5 borró una b...
-
Node.js corrige 11 fallos de seguridad que pueden ...
-
Ciberplataforma que convierte llamadas de soporte ...
-
Raspberry Pi revela datos ocultos del operador DNS
-
SK Hynix consigue aumentar sus ganancias en un 557...
-
Vulnerabilidad en Copilot de Word convierte prompt...
-
Rusos aprovechan fallo de Microsoft OWA para mante...
-
ChatGPT llega a Linux
-
IA engaña y traiciona al gestionar un negocio sola
-
TA488 pudo explotar fallo 0-day de Outlook antes d...
-
Pixel 11 Pro: teaser de Pixel Glow
-
Nuevo ransomware GenieLocker ataca Windows, ESXi y...
-
Logitech lanza ratones con batería reemplazable en...
-
Chrome 151 corrige 370 fallos de seguridad, siete ...
-
Firefox añade función vídeos HDR para Windows 11
-
Fallo en Ruflo MCP permite a atacantes no autentic...
-
EEUU prohíbe robots extranjeros
-
Paquetes npm de Joyfill hackeados despliegan RAT y...
-
vBulletin soluciona vulnerabilidad crítica de RCE ...
-
Anthropic admite que Claude puede vulnerar el cifr...
-
Vulnerabilidad Zero-Day en Cisco FMC explotada act...
-
Grave fallo en Rails permitiría a atacantes leer a...
-
Fallo crítico en Rails permite leer archivos y eje...
-
Caída global de Claude afecta a usuarios con error...
-
1Password limita la IA
-
Gusano informático se infiltra en Copilot y desata...
-
Sospechan que CyberAv3ngers, vinculados a Irán, es...
-
Rusos roban claves de Signal para secuestrar cuent...
-
GOG Galaxy llega a Linux
-
eBay pagará 56 millones por acosar a periodistas
-
Phishing con IA ya no requiere malware: roba sesio...
-
Mejores lectores de eBooks para Linux
-
WhatsApp añade cifrado de extremo a extremo a llam...
-
Vulnerabilidad de 20 años permite controlar miles ...
-
Apple creará un iPad sumergible
-
Los primeros dispositivos de OpenAI: altavoz, smar...
-
Publican PoC para el bypass de autenticación explo...
-
Rusia acusa al CEO de Telegram, Pavel Durov, de ay...
-
Aparece un Intel Core i9-14901KE con únicamente 8 ...
-
Presunta brecha de datos en Revolut: dicen acceder...
-
Paquetes maliciosos de npm despliegan RAT contra d...
-
NVIDIA impulsa la Alianza Segura Open Source para ...
-
Filtración de datos en Bank of Baroda: accedieron ...
-
DEF CON prohíbe las gafas perversas al estilo de Meta
-
Botnet Tengu reinicia dispositivos Linux infectado...
-
Primer ciberataque de agente de IA autónomo infilt...
-
OpenAI libera Codex Security CLI para hallar y cor...
-
Vulnerabilidad crítica en Gitea permite ejecución ...
-
Puerta trasera en plugin Advanced Responsive Video...
-
Nuevo fallo de RCE en Gitea permite a redactores d...
-
Filtran cientos de chats de Claude por falta de in...
-
Fabricantes chinos lanzan portátiles con GPUs GeFo...
-
IA descubre zero-day en kernel de Linux para escal...
-
Radeon RX 9050: especificaciones
-
JFrog confirma que los modelos de OpenAI aprovecha...
-
Kimi K3: la IA china que desafía a OpenAI y Anthropic
-
PortSwigger lanza Burp AT Agentic AI para pruebas ...
-
Claude AI descifra esquema de prueba post-cuántica...
-
Estafadores fingen ser ShinyHunters para chantajea...
-
Investigadores: empresa fantasma china creó la red...
-
Nueva botnet Tengu Mirai reinicia tu IoT si intent...
-
Amodei niega querer prohibir la IA de código abierto
-
App del Vaticano expone a 700.000 usuarios por fal...
-
Filtración de datos en la firma de facturación méd...
-
Múltiples vulnerabilidades de FFmpeg permiten corr...
-
Botnet DDoS Dysphoria se extiende a 200.000 dispos...
-
Profesor atrapa a 32 alumnos copiando con IA media...
-
Microsoft afirma que su nuevo modelo de IA para ci...
-
Claude Opus 5 de Anthropic llega a AWS con mejoras...
-
Backups a tu NAS QNAP en 3 pasos: guía con HDP PC ...
-
Phineas Fisher, el hacker más famoso del mundo, si...
-
Fuga de Sandbox en n8n permite a editores de flujo...
-
Ubuntu 26.04 LTS impulsa la computación confidencial
-
Coca-Cola confirma robo de datos tras ataque de ra...
-
La botnet de IoT Dysphoria implementa C2 de blockc...
-
GitHub combate el malware
-
Alianza contra ciberataques de IA
-
El Explorador de Windows 11 borra archivos grandes...
-
Investigadores inician iOS 27 con jailbreak en iPh...
-
Fallo crítico de vBulletin permite ejecución remot...
-
Guía básica del SoC y su importancia
-
Bandas de ransomware atacan VPN de Palo Alto, Fort...
-
GitHub implementa periodo de espera de 3 días en D...
-
Movistar y Orange activan Starlink en zonas incend...
-
Zen 7 cerrará AM5 y Zen 8 ya se desarrolla
-
ChatGPT quiere que vincules tus datos de salud a s...
-
Fuga de datos en app del Papa
-
Fallo de AgentForger en ChatGPT permitiría despleg...
-
Ocho fallos de NodeBB permiten leer chats privados...
-
El precio de las tarjetas gráficas continúa subien...
-
Chats compartidos de Claude AI expuestos en Google
-
Ataques aprovechan vulnerabilidad RCE de Fastjson ...
-
OpenAI tardó diez días en informar a Hugging Face ...
-
AMD confirma que sus CPU EPYC «Florence» basadas e...
-
Europol identifica 4.340 URLs para su eliminación ...
-
SourTrade crea malware en navegadores para evadir ...
-
Hombre condenado a seis años de prisión por hackea...
-
Cómo los logs de infostealers impulsan filtracione...
-
Google lanza actualización urgente de Chrome por c...
-
Fallos de seguridad en cada script de ChatGPT, Cop...
-
Apache Syncope parchea vulnerabilidades de RCE e i...
-
Guías online para tus vacaciones
-
YouTube crea IA para miniaturas
-
CXMT ya se permite el lujo de cobrar más que Samsu...
-
PentesterFlow: IA para automatizar flujos de pente...
-
Qualcomm aumentará el precio de todos sus chips: l...
-
Microsoft eliminará dos funciones de Copilot el pr...
-
Cuatro novedades de WhatsApp
-
Vulnerabilidades de GitLab permiten ejecución remo...
-
Claude Code optimiza el desarrollo para iPhone
-
Se cumplen 20 años desde la compra de ATI Technolo...
-
Afiliados de Cl0p explotan vulnerabilidades de RCE...
-
-
▼
July
(Total:
710
)
Blogroll
Labels
Entradas populares
-
Un usuario de Reddit adquirió una memoria DDR5 de 32 GB valorada en 500 euros por solo 12,50 euros en una tienda de segunda mano.
-
Google prepara el lanzamiento de Pixel Tag , un localizador de objetos similar al AirTag para llenar el hueco de hardware en su ecosistema A...
-
El MacBook Pro M5 Max alcanza los 100º C , provocando que el calor dañe el teclado a pesar de contar con un sistema de refrigeración activo...
Avances en las pruebas para clasificar a las IAs según su nivel de «inteligencia»
Se analiza el progreso de las IAs mediante tests de conocimientos como el HLE y pruebas de razonamiento abstracto como el ARC-AGI, evidenciando que aunque dominan los datos, aún carecen de sentido común e inteligencia general comparable a la humana.

¿Siguen las IAs siendo loros estocásticos o han mejorado de forma efectiva en estos últimos años? ¿Cuánto lo han hecho? ¿Y cuáles? Estas son algunas de las grandes cuestiones acerca de de la inteligencia artificial actual. Para responderlas surgieron diversas pruebas o tests que intentan medir esa (comillas, comillas) «inteligencia» aparente de algún modo: desde el conocimiento enciclopédico hasta el más puro razonamiento abstracto, que está claro que les atraganta más. ¿Cuál es el estado actual?
Las pruebas tradicionales: preguntas y respuestas
Una de las pruebas más clásicas es el conocido Humanity’s Last Exam (HLE), una prueba de 2.500 preguntas sobre matemáticas, biología, historia, lenguas clásicas y muchas otras disciplinas, planteadas y verificadas por humanos. Tienen nivel para graduados, solo que los modelos se enfrentan a una amplia variedad de temas, que un humano probablemente no abarcaría. Hay otros como el Massive Multitask Language Understanding (MMLU) y similares.
En el MLE y en apenas un año los mejores modelos pasaron de contestar correctamente el 8 por ciento de las preguntas a situarse entre el 35 y el 50% a comienzos de 2026, superando lo que podría conseguir casi cualquier persona en un examen de ese tipo. Además de eso, en el último año se aceleró su eficiencia y mejoraron más de lo previsto. De momento ganan Claude Fable 5 y GPT-5.6 Sol, llegando ya casi al 60%, aunque usando herramientas, agentes, «desvíos» a otros modelos y otros truquis.
Una cuestión sobre el HLE es que tan pronto como un modelo ha tenido acceso a las respuestas es capaz de mejorar notablemente, dado que el asunto no deja de ser una acumulación de datos, algo que es su especialidad. Si un modelo usa ese «truco» o busca las respuestas en internet (generalmente se bloquean repositorios como Hugging Face durante los «exámenes») los resultados se consideran contaminados y no valen. La forma de evitarlo es revisar su razonamiento en busca de atajos. Además, el HLE tiene un conjunto de preguntas privadas, no publicadas, que da un valor más preciso, aunque el que se plasma en las tablas comparativas es el público.
Del «preguntas y respuestas» al razonamiento abstracto
Acumular muchos datos no equivale a comprender lo que son y lo que hay que hacer con ellos. Los modelos actuales siguen cayendo en trampas aparentemente triviales: pueden resolver cuestiones de cálculo avanzado, pero fallar al ordenar números, o equivocarse al contar las letras de una palabra (el famoso «¿cuántas R hay en strawberry?») En el vídeo de Half as interesting hay unos cuantos buenos ejemplos.
Por todo eso los expertos idearon otras pruebas, como el Abstraction and Reasoning Corpus for Artificial General Intelligence (ARC-AGI), orientados a medir la capacidad de «descubrir reglas nuevas», algo que se considera fundamental para alcanzar la inteligencia artificial general. En lugar de responder preguntas, la IA debe resolver juegos y rompecabezas visuales deduciendo la lógica a partir de unos pocos ejemplos. Es como los tests que hacen a los niños en el colegio o los que se usan para medir el C.I.

Muchos de estos desafíos resultan triviales para una persona humana, pero pueden requerir enormes recursos computacionales para un modelo de IA… Algo que asusta cuando se ven las cifras de coste en tokens y dólares que alcanzan algunos modelos.
Del ARC-AGI existen dos versiones más avanzadas llamadas ARC-AGI 2 y ARC-AGI 3 que ponen el listón todavía más alto: conceptos espaciales como «dentro» y «fuera», reglas lógicas más complicadas… Los de la versión 3 son como pequeños videojuegos sin instrucciones, donde hay que descubrir tanto las reglas como la forma de jugar.

Es divertido jugar con el ARC-AGI 3, y más si te gustan los juegos de este tipo, porque resulta muy entretenido: todo tiene su lógica, se asignan mentalmente roles y definiciones (entrada, salida, puerta, transportador, herramienta para girar piezas…) Y conviene afinar, porque a veces hay límites de movimientos. Tiene su curva de aprendizaje. Es fácil imaginar lo complicado que puede resultar para un modelo que tenga que reconocer todas las piezas de colores, adivinar lo que hay que hacer e inferir el papel de cada una paso a paso.

Los modelos enfrentados al ARC-AGI-3 apenas llegan al 2% de éxito, aunque GPT-5.6 Sol Max llega casi al 8%. Pero todavía están lejos de mostrar una inteligencia general comparable a la humana.
De momento queda claro que son buenos en pruebas de conocimientos y programación, pero siguen con dificultades en cuando al «sentido común» y el razonamiento abstracto, que incluso los niños humanos pueden superar sin muchos problemas. De momento, son pruebas mejores para ver los progresos de la IA y habrá que ver dentro de unos años (o meses) cómo va la cosa.
Fuentes:
http://www.microsiervos.com/archivo/ia/avances-pruebas-ia-inteligencia.html


Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.