Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7680
)
-
▼
octubre
(Total:
7
)
-
Exagente de la NCA implicado en el caso Silk Road ...
-
Cisco alerta sobre vulnerabilidad zero-day en SD-W...
-
Operación Blackout del FBI desmantela estafadores ...
-
Desarrollador entrena IA pequeña en una RTX 3080 T...
-
Windows 11 Assisted Setup: más bloatware para tu PC
-
Jailbreak disponible para casi toda la PS5
-
Aprovechan vulnerabilidad zero-day de Citrix NetSc...
-
- ► septiembre (Total: 931 )
-
▼
octubre
(Total:
7
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
2048
)
seguridad
(
1947
)
software
(
1291
)
hardware
(
1005
)
google
(
819
)
Malware
(
711
)
privacidad
(
697
)
exploit
(
605
)
ransomware
(
551
)
Windows
(
521
)
android
(
507
)
linux
(
470
)
cve
(
380
)
nvidia
(
350
)
tutorial
(
300
)
manual
(
282
)
hacking
(
274
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
143
)
Wifi
(
131
)
app
(
131
)
programación
(
128
)
cifrado
(
122
)
twitter
(
121
)
firmware
(
87
)
youtube
(
85
)
firefox
(
81
)
herramientas
(
80
)
Networking
(
73
)
adobe
(
72
)
sysadmin
(
72
)
office
(
63
)
antivirus
(
55
)
hack
(
54
)
javascript
(
52
)
Kernel
(
49
)
apache
(
48
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
37
)
multimedia
(
36
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Se ha detectado una vulnerabilidad de seguridad de alta gravedad en Sudo (CVE-2026-96512) que podría permitir a atacantes locales evadir la...
-
OpenAI ha presentado GPT-6.1 Sol , un modelo con un desempeño similar a Astra pero que cuesta cinco veces menos .
-
Microsoft ha habilitado para todos los usuarios el programa de Xbox que permite convertir juegos físicos a formato digital .
Desarrollador entrena IA pequeña en una RTX 3080 Ti para jugar Pokémon: el modelo descubrió la función de los botones prediciendo sucesiones
jueves, 1 de octubre de 2026
|
Posted by
el-brujo
Un desarrollador entrenó una pequeña IA con solo 12.5 millones de parámetros usando una GPU RTX 3080 Ti para jugar Pokémon Red. El modelo aprendió la función de los botones prediciendo los cambios en la pantalla y logró seleccionar un Pokémon inicial. Este proyecto demuestra que modelos pequeños y locales pueden adaptarse con éxito a tareas específicas.
Un desarrollador conocido como “stmonty” ha entrenado un modelo de IA pequeño en una sola RTX 3080 Ti para jugar a Pokémon Red. La publicación del blog del desarrollador, “Enseñando a un modelo de mundo a jugar Pokémon”, detalla el viaje de entrenar un modelo que trabaja desde un guardado para elegir un Pokémon inicial. El modelo es lo que se conoce como un modelo de mundo, basado en la investigación de LeWorldModel coescrita por el famoso científico de IA Yann LeCun. LeCun se separó de Meta el año pasado para construir modelos de mundo con su empresa AMI Labs, utilizando el mismo enfoque.
Este modelo en particular fue entrenado con solo unos 12,5 millones de parámetros y publicado el 20 de septiembre. En un foro de discusión, stmonty calificó el proyecto como una forma “de aprender y divertirse”, y eligió el modelo porque podía entrenarse localmente en una tarjeta gráfica de consumo.
El modelo tiene que aprender qué hace cada pulsación de botón, y lo logra analizando la pantalla que se produce. En lugar de predecir toda la pantalla siguiente, utiliza resúmenes comprimidos con solo 192 números. El entrenamiento inicial es “libre de recompensas”, en el sentido de que el modelo no es consciente de las condiciones de victoria. Los objetivos llegan más tarde, cuando el modelo planifica. Este diseño sigue un artículo de marzo de 2026 que detalla un modelo JEPA único con unos 15 millones de parámetros, entrenable en una sola GPU, no muy diferente al de stmonty.
La ejecución completa del entrenamiento requirió 42.382 fotogramas en escala de grises en más de 1.000 ejecuciones cortas, utilizando un guardado en el laboratorio del Profesor Oak. Los datos incluyeron rutas programadas, esas mismas rutas con pulsaciones aleatorias mezcladas y vagabundeo aleatorio. Esta última parte es necesaria porque un modelo entrenado solo con ejecuciones limpias “podría ver que se presiona A cada vez que aparece un cuadro de diálogo y nunca aprender qué hace B allí”, dijo stmonty. El modelo fue entrenado desde cero para el proyecto.
Los planes se desarrollan con 14 pulsaciones de botones y se intentan en el modelo, no en el juego. Cada ronda tiene 512 muestras de planes donde la búsqueda conserva uno de cada ocho, o 64. Esto continúa hasta que el plan final es el que se ejecuta en el emulador del juego. Stmonty hipotetiza que una causa posible del fallo, que dejó al jugador sin un Pokémon, es que los errores pequeños se acumulan cuando las predicciones se basan en las propias predicciones del modelo.
El siguiente intento, tras algunos ajustes, resultó ser un éxito y el modelo seleccionó a Squirtle. Luego, en más de 100 ejecuciones desde el mismo guardado, hubo 52 planes que consiguieron un inicial, en comparación con cero para las pulsaciones aleatorias y solo uno con un modelo no entrenado. Stmonty afirmó que presionar A repetidamente ya funciona desde el guardado; el objetivo era que el modelo descubriera la solución por sí mismo. Este es todavía un resultado modesto, pero demuestra que los modelos pequeños pueden adaptarse a tareas específicas.
El próximo objetivo, que el desarrollador “aún podría intentar”, es comenzar en el laboratorio, caminar hacia el Profesor, pasar el diálogo y luego elegir realmente un Pokémon. “Sospecho que la dificultad escala exponencialmente con la longitud del plan”, dijo el desarrollador. Hacer que el modelo sea lo suficientemente grande probablemente no llevaría a superar el juego: “No creo que simplemente hacer mi modelo actual más grande nos lleve allí”, afirmó el desarrollador en una respuesta.
El enfoque de modelo pequeño para jugar a Pokémon Red es uno de muchos en las últimas semanas, con al menos dos intentos separados y exitosos para superar el juego utilizando el modelo de decisión Jev y un arnés o código personalizado. Sin embargo, esos utilizan enfoques más sofisticados, mientras que los modelos pequeños siguen siendo una opción realista para los aficionados. El código del proyecto es de código abierto y está disponible en GitHub como lePokeRed, recomendando una GPU CUDA.
Fuente:
TomsHardware
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comments :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.