Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5736
)
-
▼
julio
(Total:
454
)
-
Microsoft lanza actualización KB5121767 para corre...
-
Usan bots de Telegram como puertas traseras en sis...
-
Líderes tecnológicos felicitan a España campeona d...
-
UE multa a AliExpress con 550 millones por product...
-
Linux corrige más de 400 vulnerabilidades del kern...
-
Adobe lanza una IA revolucionaria para fotografía
-
Aumentan los ataques de wp2shell en WordPress impu...
-
Robotaxi de Tesla choca siendo conducido remotamente
-
Fallo crítico en la plataforma de IA de ServiceNow...
-
Fallo en Kimai Docker permite robo de cuentas medi...
-
LG instalaría adware en Windows mediante una app
-
Microsoft recreó cabina de avión para probar sonid...
-
Caviar vende un Z Fold 8 de oro con Messi por 11.0...
-
3 herramientas gratuitas para monitorizar tu red d...
-
Nueva vulnerabilidad en 7-Zip permitiría la ejecuc...
-
Publicado PoC para vulnerabilidad crítica de RCE e...
-
Publican datos de Starbucks en foros
-
Siete paquetes maliciosos de Vite en npm emplean C...
-
En España los Hospitales y empresas tendrán su pro...
-
1Password integrará Claude para usar tus credenciales
-
Abuso de Windows Bind Link permite cegar EDR y eva...
-
PentestCode: nuevo agente de IA que automatiza pru...
-
Caos en Amazon Web Services por facturas millonarias
-
Vulnerabilidad crítica RCE wp2shell: cobertura, Po...
-
Servidor expuesto revela kit de phishing basado en...
-
Google crea chip para potenciar su IA
-
Acelera el arranque de Windows sin programas
-
Vulnerabilidad de 15 años en NGINX permite ejecuta...
-
Apple Music sube precios en España
-
NVIDIA lanza los primeros drivers para RTX Spark e...
-
Avances en las pruebas para clasificar a las IAs s...
-
Inteligencia rusa hackea cámaras IP para espiar lo...
-
Grave vulnerabilidad en F5 NGINX podría provocar c...
-
Explotan vulnerabilidades de Microsoft SharePoint ...
-
Agente de IA autónomo vulnera Hugging Face, el rep...
-
EE. UU. acusa a tres rusos por ciberdelitos de 62 ...
-
GoldenEyeDog: roban certificados de DigiCert
-
Jefe de OpenAI advierte sobre el Comunismo de la IA
-
Apple advierte a exemplepados en OpenAI
-
Más controles parentales en ChatGPT
-
Mario Kart Wii llega a PC en 4K y FPS libres: Mari...
-
Están suplantando la identidad de tu banco para ro...
-
Ben Affleck gana 587 millones de Netflix por su IA
-
Hoy se cumplen 50 años de la llegada de la Viking ...
-
Explotan vulnerabilidades de RCE en WordPress Core...
-
Alarma por la IA de Google para menores
-
Novias IA causan caos en China
-
OpenAI notificará a padres sobre infracciones de h...
-
NadMesh usa Shodan para secuestrar infraestructura...
-
Hugging Face confirma brecha por IA: atacantes usa...
-
Tesla lanza bicicleta infantil mediocre
-
BleachBit: la mejor alternativa gratis y abierta a...
-
NVIDIA RTX Spark aparece en Cinebench 2026 rindien...
-
Gemini en Chrome analizará grupos de pestañas
-
Project Perception detectará fallos en Windows
-
Vulnerabilidad en Citrix Secure Access y Endpoint ...
-
Filtran Galaxy Z Fold 8
-
NVIDIA permite grabar partidas a 240 FPS
-
Nuevo ransomware Spirals cifra empresa IT en menos...
-
Claude accede a cuentas sin contraseñas sin llegar...
-
Kimi-K3 supera a IA de EE UU pero se identifica co...
-
X será de código abierto según Musk
-
Nueva botnet NadMesh rastrea servicios de IA expue...
-
FBI detiene hacker de criptomonedas en Steam
-
Fallo HollowByte en OpenSSL podría colapsar la mem...
-
LegacyHive: vulnerabilidad 0-Day de Windows permit...
-
Rectify11 es una herramienta gratuita optimiza Win...
-
Google integra AI Mode con YouTube Music y Canva
-
Nueva vulnerabilidad RCE en wp2shell afecta a mill...
-
Explotan vulnerabilidad 0-day de SonicWall SMA1000
-
Nova Lake-S: nueva marca y fecha de lanzamiento
-
Dos miembros de Scattered Spider condenados a 5,5 ...
-
George Lucas defiende la IA
-
Samsung añade IA a sus lavadoras
-
China lanza Kimi K3 para desafiar a OpenAI y Anthr...
-
El Kimi K3 chino de 2,8 billones de parámetros sup...
-
La Unión Europea obliga a Google a dar acceso al m...
-
Next.js lanza programa de seguridad mensual y corr...
-
Vulnerabilidad 0-day en AnyDesk permite ataques DoS
-
Gemini ahora suena como un humano
-
Google renombra NotebookLM como Gemini Notebook
-
Vulnerabilidad en cámaras TP-Link permite ataques ...
-
EE. UU. acusa a dos personas de lavar 43M$ proveni...
-
Un emulador y una demo del ordenador de bolsillo +...
-
Error en AWS Cost Explorer muestra estimaciones de...
-
IA de Google recrea el gol perdido de Pelé
-
OpenAI lanza un hardware de IA que es una mini-con...
-
La película de Jurassic Park usó Unix real
-
Kimi K3: la IA china que desafía a GPT y Claude
-
Coca-Cola informa que un ataque de ransomware a Fa...
-
Un usuario descubre que su Colorful RTX 5080 Vulka...
-
OpenAI reconoce que GPT-5.6 borra archivos ocasion...
-
Google cambia el nombre de NotebookLM
-
Integrantes de Scattered Spider condenados a cinco...
-
Fallo en el intercambio de tokens de n8n podría pe...
-
GhostPairing de WhatsApp permite secuestrar cuenta...
-
Ciberataque amenaza infraestructura crítica en Jap...
-
Abrir una shell de SYSTEM en el inicio de Windows ...
-
Tornyol: el dron con IA que elimina mosquitos
-
OpenAI usa GPT-Red para automatizar pruebas de iny...
-
Nueva botnet TuxBot v3 usa IA para secuestrar disp...
-
xAI demanda a usuario por deepfakes sexuales de me...
-
Vulnerabilidad sin parchear en aspiradoras Shark p...
-
Vulnerabilidades en Splunk Enterprise permiten ata...
-
Torvalds arremete contra NVIDIA
-
Red Hat lanza soporte indefinido para RHEL en sect...
-
Hackeo a cuenta de Microsoft borra 25 años de recu...
-
Zoom alerta sobre una vulnerabilidad crítica que p...
-
Policía holandesa desmantela red de fraude de inve...
-
CachyOS lidera ProtonDB
-
Fallo crítico de Cursor permite ejecución de códig...
-
GPT-5.6 Sol Ultra crea exploit de Chrome basándose...
-
F5 corrige vulnerabilidades de NGINX que permiten ...
-
Steam Machine Windows 11 vs SteamOS: el sistema op...
-
Linux 7.2-rc3 llega a Dreamcast
-
Paquetes de npm de AsyncAPI comprometidos distribu...
-
La Comisión Europea presenta el informe en el que ...
-
Google Imágenes renueva su portada
-
Intel Foundry habría llegado a un acuerdo con AMD,...
-
Nueva vulnerabilidad 0-day de Windows en LegacyHiv...
-
OpenAI busca crear un rival físico para Alexa
-
Grupos chinos usan Claude Code y DeepSeek en ciber...
-
Explotan vulnerabilidades 0-day críticas en SonicW...
-
Logran saltar app de verificación de edad de la UE...
-
Cuidado si utilizas LastPass o Bitwarden, están ll...
-
Microsoft corrige récord de 622 vulnerabilidades, ...
-
WhatsApp comienza a probar un servicio de copias d...
-
Réplicas casi idénticas SSD Samsung 870 EVO
-
-
▼
julio
(Total:
454
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Acelerar el arranque de Windows es posible utilizando las herramientas propias del sistema operativo , evitando así el uso de software exte...
-
Meta ha solicitado una patente para una IA que analizaría las emociones del usuario mediante el tono de voz, el seguimiento ocular y el uso ...
-
La empresa textil alemana ZEGO se ha declarado en insolvencia tras sufrir un ciberataque en marzo que paralizó su producción durante seis se...
Avances en las pruebas para clasificar a las IAs según su nivel de «inteligencia»
Se analiza el progreso de las IAs mediante tests de conocimientos como el HLE y pruebas de razonamiento abstracto como el ARC-AGI, evidenciando que aunque dominan los datos, aún carecen de sentido común e inteligencia general comparable a la humana.

¿Siguen las IAs siendo loros estocásticos o han mejorado de forma efectiva en estos últimos años? ¿Cuánto lo han hecho? ¿Y cuáles? Estas son algunas de las grandes cuestiones acerca de de la inteligencia artificial actual. Para responderlas surgieron diversas pruebas o tests que intentan medir esa (comillas, comillas) «inteligencia» aparente de algún modo: desde el conocimiento enciclopédico hasta el más puro razonamiento abstracto, que está claro que les atraganta más. ¿Cuál es el estado actual?
Las pruebas tradicionales: preguntas y respuestas
Una de las pruebas más clásicas es el conocido Humanity’s Last Exam (HLE), una prueba de 2.500 preguntas sobre matemáticas, biología, historia, lenguas clásicas y muchas otras disciplinas, planteadas y verificadas por humanos. Tienen nivel para graduados, solo que los modelos se enfrentan a una amplia variedad de temas, que un humano probablemente no abarcaría. Hay otros como el Massive Multitask Language Understanding (MMLU) y similares.
En el MLE y en apenas un año los mejores modelos pasaron de contestar correctamente el 8 por ciento de las preguntas a situarse entre el 35 y el 50% a comienzos de 2026, superando lo que podría conseguir casi cualquier persona en un examen de ese tipo. Además de eso, en el último año se aceleró su eficiencia y mejoraron más de lo previsto. De momento ganan Claude Fable 5 y GPT-5.6 Sol, llegando ya casi al 60%, aunque usando herramientas, agentes, «desvíos» a otros modelos y otros truquis.
Una cuestión sobre el HLE es que tan pronto como un modelo ha tenido acceso a las respuestas es capaz de mejorar notablemente, dado que el asunto no deja de ser una acumulación de datos, algo que es su especialidad. Si un modelo usa ese «truco» o busca las respuestas en internet (generalmente se bloquean repositorios como Hugging Face durante los «exámenes») los resultados se consideran contaminados y no valen. La forma de evitarlo es revisar su razonamiento en busca de atajos. Además, el HLE tiene un conjunto de preguntas privadas, no publicadas, que da un valor más preciso, aunque el que se plasma en las tablas comparativas es el público.
Del «preguntas y respuestas» al razonamiento abstracto
Acumular muchos datos no equivale a comprender lo que son y lo que hay que hacer con ellos. Los modelos actuales siguen cayendo en trampas aparentemente triviales: pueden resolver cuestiones de cálculo avanzado, pero fallar al ordenar números, o equivocarse al contar las letras de una palabra (el famoso «¿cuántas R hay en strawberry?») En el vídeo de Half as interesting hay unos cuantos buenos ejemplos.
Por todo eso los expertos idearon otras pruebas, como el Abstraction and Reasoning Corpus for Artificial General Intelligence (ARC-AGI), orientados a medir la capacidad de «descubrir reglas nuevas», algo que se considera fundamental para alcanzar la inteligencia artificial general. En lugar de responder preguntas, la IA debe resolver juegos y rompecabezas visuales deduciendo la lógica a partir de unos pocos ejemplos. Es como los tests que hacen a los niños en el colegio o los que se usan para medir el C.I.

Muchos de estos desafíos resultan triviales para una persona humana, pero pueden requerir enormes recursos computacionales para un modelo de IA… Algo que asusta cuando se ven las cifras de coste en tokens y dólares que alcanzan algunos modelos.
Del ARC-AGI existen dos versiones más avanzadas llamadas ARC-AGI 2 y ARC-AGI 3 que ponen el listón todavía más alto: conceptos espaciales como «dentro» y «fuera», reglas lógicas más complicadas… Los de la versión 3 son como pequeños videojuegos sin instrucciones, donde hay que descubrir tanto las reglas como la forma de jugar.

Es divertido jugar con el ARC-AGI 3, y más si te gustan los juegos de este tipo, porque resulta muy entretenido: todo tiene su lógica, se asignan mentalmente roles y definiciones (entrada, salida, puerta, transportador, herramienta para girar piezas…) Y conviene afinar, porque a veces hay límites de movimientos. Tiene su curva de aprendizaje. Es fácil imaginar lo complicado que puede resultar para un modelo que tenga que reconocer todas las piezas de colores, adivinar lo que hay que hacer e inferir el papel de cada una paso a paso.

Los modelos enfrentados al ARC-AGI-3 apenas llegan al 2% de éxito, aunque GPT-5.6 Sol Max llega casi al 8%. Pero todavía están lejos de mostrar una inteligencia general comparable a la humana.
De momento queda claro que son buenos en pruebas de conocimientos y programación, pero siguen con dificultades en cuando al «sentido común» y el razonamiento abstracto, que incluso los niños humanos pueden superar sin muchos problemas. De momento, son pruebas mejores para ver los progresos de la IA y habrá que ver dentro de unos años (o meses) cómo va la cosa.
Fuentes:
http://www.microsiervos.com/archivo/ia/avances-pruebas-ia-inteligencia.html


Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.