Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5806
)
-
▼
julio
(Total:
524
)
-
Vulnerabilidad crítica de ejecución remota de códi...
-
Un empleado del Ayuntamiento se libra de la cárcel...
-
xMEMS XMC-1200, el micro ventilador más pequeño de...
-
China evalúa restringir exportaciones de IA y el u...
-
El equipo del kernel de Linux lanza 432 CVE en sol...
-
OpenAI afirma que sus modelos de IA evadieron el e...
-
Datos de Cloudflare revelan qué selecciones del Mu...
-
Roban sesiones de Microsoft 365 tras el MFA
-
Atacantes de Qilin Ransomware aprovechan vulnerabi...
-
Usan GitHub Actions para insertar RAT Miasma en pa...
-
El gigante ferroviario suizo Stadler rechaza pagar...
-
Usan juegos falsos para robar contraseñas y cripto...
-
Ransomware Qilin: récord de 1.358 víctimas globales
-
FluentCleaner Classic: Windows ligero y open source
-
Actualización de Chrome corrige 12 vulnerabilidades
-
Instagram permitirá cambiar el audio de las public...
-
ASUS corrige vulnerabilidad crítica en routers que...
-
Nueva herramienta NULLZEREPTOOL usa Telegram para ...
-
Vulnerabilidad en Microsoft Azure DevOps permite q...
-
Francia prohíbe redes sociales a menores de 15 años
-
LaLiga pierde el juicio: el TJUE dice que el uso d...
-
EE. UU. clausura más de 1.000 webs en ofensiva con...
-
OpenAI reconoce haber originado el ataque de agent...
-
Fallo en Azure DevOps permite que comentarios ocul...
-
Vulnerabilidad de Meta expuso correos, chats y arc...
-
La policía desmantela la plataforma de phishing Kr...
-
La Steam Deck se hunde en ventas tras la subida de...
-
SolarWinds corrige 15 fallos críticos de Serv-U qu...
-
Agencia gubernamental británica detecta trampas co...
-
DLSS 5 optimiza rendimiento y arte
-
La policía desarticula el kit de phishing Kratos d...
-
Gemini 3.5 Flash Cyber detecta y parchea vulnerabi...
-
OpenAI revela que sus modelos de IA lograron vulne...
-
Renuncia el jefe de seguridad de IA de Trump a los...
-
Secuestran más de 20 webs gubernamentales para dis...
-
Investigador anónimo filtra 204 exploits 0-day ant...
-
Google presenta Gemini 3.5 Flash Cyber AI para det...
-
España multa a 23andMe con 2,4 millones de euros p...
-
Los fabricantes de Estados Unidos, Japón y Corea d...
-
Fallo en AWS Kiro permitía que páginas web malicio...
-
Firefox lanza contenedores globales y nuevas funci...
-
FRITZ!OS 8.20: sistema operativo inteligente
-
Trabajos de entrenamiento de IA contra la red eléc...
-
Taiwán obligará a TSMC a generar su propia energía
-
GTX 1060: 10 años de un icono gama media
-
Filtración de datos de Craneware: hackers robaron ...
-
Estafadores se hacen pasar por el FBI en redes soc...
-
Microsoft crea cristal que almacena datos por 10.0...
-
Usan vulnerabilidad de PAN-OS de Palo Alto para de...
-
Ciberatacantes aprovechan vulnerabilidad crítica d...
-
Optimiza la seguridad de Windows desactivando esta...
-
Parches no oficiales y gratuitos para la vulnerabi...
-
Los 10 malware más activos la semana pasada
-
Nuevo ransomware ENCFORGE ataca archivos de modelo...
-
Cómo conectar tu móvil gratis a Starlink: requisit...
-
Trump busca prohibir la IA china Kimi K3
-
Zimbra corrige vulnerabilidades críticas de inyecc...
-
Grave vulnerabilidad en Gitea permite escribir en ...
-
Anthropic pagará a autores por usar sus libros sin...
-
Robots de Xiaomi logran 98% de precisión en fábric...
-
PentDEM: frameworks de pentesting inteligentes
-
Un análisis del SoC Kirin 9030 demuestra que China...
-
Más de 55 millones de cuentas comprometidas en el ...
-
Furtex: kit de Linux para post-explotación y evasi...
-
Rumanía se quedó sin registro de la propiedad porq...
-
OVH desvela un plan semicubierto para solucionar u...
-
Memoria DDR5 alcanza precio récord en julio
-
Detenido por robar 200.000 euros con malware en Steam
-
Punto ciego de Microsoft Defender XDR puede oculta...
-
Un modder hace una PS4 V2 portátil con pantalla OL...
-
Microsoft lanza actualización KB5121767 para corre...
-
Usan bots de Telegram como puertas traseras en sis...
-
Líderes tecnológicos felicitan a España campeona d...
-
UE multa a AliExpress con 550 millones por product...
-
Linux corrige más de 400 vulnerabilidades del kern...
-
Adobe lanza una IA revolucionaria para fotografía
-
Aumentan los ataques de wp2shell en WordPress impu...
-
Robotaxi de Tesla choca siendo conducido remotamente
-
Fallo crítico en la plataforma de IA de ServiceNow...
-
Fallo en Kimai Docker permite robo de cuentas medi...
-
LG instalaría adware en Windows mediante una app
-
Microsoft recreó cabina de avión para probar sonid...
-
Caviar vende un Z Fold 8 de oro con Messi por 11.0...
-
3 herramientas gratuitas para monitorizar tu red d...
-
Nueva vulnerabilidad en 7-Zip permitiría la ejecuc...
-
Publicado PoC para vulnerabilidad crítica de RCE e...
-
Publican datos de Starbucks en foros
-
Siete paquetes maliciosos de Vite en npm emplean C...
-
En España los Hospitales y empresas tendrán su pro...
-
1Password integrará Claude para usar tus credenciales
-
Abuso de Windows Bind Link permite cegar EDR y eva...
-
PentestCode: nuevo agente de IA que automatiza pru...
-
Caos en Amazon Web Services por facturas millonarias
-
Vulnerabilidad crítica RCE wp2shell: cobertura, Po...
-
Servidor expuesto revela kit de phishing basado en...
-
Google crea chip para potenciar su IA
-
Acelera el arranque de Windows sin programas
-
Vulnerabilidad de 15 años en NGINX permite ejecuta...
-
Apple Music sube precios en España
-
NVIDIA lanza los primeros drivers para RTX Spark e...
-
Avances en las pruebas para clasificar a las IAs s...
-
Inteligencia rusa hackea cámaras IP para espiar lo...
-
Grave vulnerabilidad en F5 NGINX podría provocar c...
-
Explotan vulnerabilidades de Microsoft SharePoint ...
-
Agente de IA autónomo vulnera Hugging Face, el rep...
-
EE. UU. acusa a tres rusos por ciberdelitos de 62 ...
-
GoldenEyeDog: roban certificados de DigiCert
-
Jefe de OpenAI advierte sobre el Comunismo de la IA
-
Apple advierte a exemplepados en OpenAI
-
Más controles parentales en ChatGPT
-
Mario Kart Wii llega a PC en 4K y FPS libres: Mari...
-
Están suplantando la identidad de tu banco para ro...
-
Ben Affleck gana 587 millones de Netflix por su IA
-
Hoy se cumplen 50 años de la llegada de la Viking ...
-
Explotan vulnerabilidades de RCE en WordPress Core...
-
Alarma por la IA de Google para menores
-
Novias IA causan caos en China
-
OpenAI notificará a padres sobre infracciones de h...
-
NadMesh usa Shodan para secuestrar infraestructura...
-
Hugging Face confirma brecha por IA: atacantes usa...
-
Tesla lanza bicicleta infantil mediocre
-
BleachBit: la mejor alternativa gratis y abierta a...
-
NVIDIA RTX Spark aparece en Cinebench 2026 rindien...
-
Gemini en Chrome analizará grupos de pestañas
-
Project Perception detectará fallos en Windows
-
Vulnerabilidad en Citrix Secure Access y Endpoint ...
-
Filtran Galaxy Z Fold 8
-
NVIDIA permite grabar partidas a 240 FPS
-
-
▼
julio
(Total:
524
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Acelerar el arranque de Windows es posible utilizando las herramientas propias del sistema operativo , evitando así el uso de software exte...
-
Linux ya es compatible con más versiones de PlayStation 5 , permitiendo instalar el sistema de PC para jugar desde Steam .
-
La GeForce GTX 1060 cumple 10 años , consolidándose como una de las mejores tarjetas gráficas de gama media de la historia debido a su gran...
Avances en las pruebas para clasificar a las IAs según su nivel de «inteligencia»
Se analiza el progreso de las IAs mediante tests de conocimientos como el HLE y pruebas de razonamiento abstracto como el ARC-AGI, evidenciando que aunque dominan los datos, aún carecen de sentido común e inteligencia general comparable a la humana.

¿Siguen las IAs siendo loros estocásticos o han mejorado de forma efectiva en estos últimos años? ¿Cuánto lo han hecho? ¿Y cuáles? Estas son algunas de las grandes cuestiones acerca de de la inteligencia artificial actual. Para responderlas surgieron diversas pruebas o tests que intentan medir esa (comillas, comillas) «inteligencia» aparente de algún modo: desde el conocimiento enciclopédico hasta el más puro razonamiento abstracto, que está claro que les atraganta más. ¿Cuál es el estado actual?
Las pruebas tradicionales: preguntas y respuestas
Una de las pruebas más clásicas es el conocido Humanity’s Last Exam (HLE), una prueba de 2.500 preguntas sobre matemáticas, biología, historia, lenguas clásicas y muchas otras disciplinas, planteadas y verificadas por humanos. Tienen nivel para graduados, solo que los modelos se enfrentan a una amplia variedad de temas, que un humano probablemente no abarcaría. Hay otros como el Massive Multitask Language Understanding (MMLU) y similares.
En el MLE y en apenas un año los mejores modelos pasaron de contestar correctamente el 8 por ciento de las preguntas a situarse entre el 35 y el 50% a comienzos de 2026, superando lo que podría conseguir casi cualquier persona en un examen de ese tipo. Además de eso, en el último año se aceleró su eficiencia y mejoraron más de lo previsto. De momento ganan Claude Fable 5 y GPT-5.6 Sol, llegando ya casi al 60%, aunque usando herramientas, agentes, «desvíos» a otros modelos y otros truquis.
Una cuestión sobre el HLE es que tan pronto como un modelo ha tenido acceso a las respuestas es capaz de mejorar notablemente, dado que el asunto no deja de ser una acumulación de datos, algo que es su especialidad. Si un modelo usa ese «truco» o busca las respuestas en internet (generalmente se bloquean repositorios como Hugging Face durante los «exámenes») los resultados se consideran contaminados y no valen. La forma de evitarlo es revisar su razonamiento en busca de atajos. Además, el HLE tiene un conjunto de preguntas privadas, no publicadas, que da un valor más preciso, aunque el que se plasma en las tablas comparativas es el público.
Del «preguntas y respuestas» al razonamiento abstracto
Acumular muchos datos no equivale a comprender lo que son y lo que hay que hacer con ellos. Los modelos actuales siguen cayendo en trampas aparentemente triviales: pueden resolver cuestiones de cálculo avanzado, pero fallar al ordenar números, o equivocarse al contar las letras de una palabra (el famoso «¿cuántas R hay en strawberry?») En el vídeo de Half as interesting hay unos cuantos buenos ejemplos.
Por todo eso los expertos idearon otras pruebas, como el Abstraction and Reasoning Corpus for Artificial General Intelligence (ARC-AGI), orientados a medir la capacidad de «descubrir reglas nuevas», algo que se considera fundamental para alcanzar la inteligencia artificial general. En lugar de responder preguntas, la IA debe resolver juegos y rompecabezas visuales deduciendo la lógica a partir de unos pocos ejemplos. Es como los tests que hacen a los niños en el colegio o los que se usan para medir el C.I.

Muchos de estos desafíos resultan triviales para una persona humana, pero pueden requerir enormes recursos computacionales para un modelo de IA… Algo que asusta cuando se ven las cifras de coste en tokens y dólares que alcanzan algunos modelos.
Del ARC-AGI existen dos versiones más avanzadas llamadas ARC-AGI 2 y ARC-AGI 3 que ponen el listón todavía más alto: conceptos espaciales como «dentro» y «fuera», reglas lógicas más complicadas… Los de la versión 3 son como pequeños videojuegos sin instrucciones, donde hay que descubrir tanto las reglas como la forma de jugar.

Es divertido jugar con el ARC-AGI 3, y más si te gustan los juegos de este tipo, porque resulta muy entretenido: todo tiene su lógica, se asignan mentalmente roles y definiciones (entrada, salida, puerta, transportador, herramienta para girar piezas…) Y conviene afinar, porque a veces hay límites de movimientos. Tiene su curva de aprendizaje. Es fácil imaginar lo complicado que puede resultar para un modelo que tenga que reconocer todas las piezas de colores, adivinar lo que hay que hacer e inferir el papel de cada una paso a paso.

Los modelos enfrentados al ARC-AGI-3 apenas llegan al 2% de éxito, aunque GPT-5.6 Sol Max llega casi al 8%. Pero todavía están lejos de mostrar una inteligencia general comparable a la humana.
De momento queda claro que son buenos en pruebas de conocimientos y programación, pero siguen con dificultades en cuando al «sentido común» y el razonamiento abstracto, que incluso los niños humanos pueden superar sin muchos problemas. De momento, son pruebas mejores para ver los progresos de la IA y habrá que ver dentro de unos años (o meses) cómo va la cosa.
Fuentes:
http://www.microsiervos.com/archivo/ia/avances-pruebas-ia-inteligencia.html


Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.