Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Agentes de IA usan 5 veces más tokens que humanos por prompts almacenados, camino al 10x: releen contenido, disparando la demanda de caché KV y agravando la escasez de RAM


Los agentes de IA ya utilizan cinco veces más tokens que los humanos, y se prevé que esta cifra siga creciendo exponencialmente. La mayor parte de este consumo se debe a que los agentes releen constantemente prompts almacenados en caché. Esto está disparando la demanda de memoria RAM y HBM, lo que podría agravar la escasez de hardware.





El CEO de Futurum Group, Daniel Newman, escribió en una publicación de X aquí que “la IA es utilizada actualmente por la propia IA 5 veces más de lo que es utilizada por los humanos. Ese número se acelerará a 10 veces y luego cada vez más”. Sus datos, un gráfico de Andreessen Horowitz (a16z) sobre las cifras de OpenRouter, muestran a los agentes con 7,3 billones de tokens frente a los 1,4 billones de los humanos hasta agosto, seis meses después de que el uso de agentes superara por primera vez al humano. Pero los agentes están principalmente releyendo lo que ya han visto: más del 85% de los tokens de los agentes provienen de prompts almacenados en caché, escribió a16z, citando a OpenRouter.

La IA es utilizada actualmente por la IA 5 veces más de lo que es utilizada por los humanos. Ese número se acelerará a 10 veces y luego cada vez más. Seguimos hablando de la adopción humana al intentar determinar el ROI, pero la utilización y la escala son exponencialmente mayores que eso. 30 de septiembre de 2026


OpenRouter es “una plataforma líder de enrutamiento y pasarela de modelos de IA”. Un gráfico de su jefe de insights, Peter Walker, enumera el “uso promedio de tokens de 7 días en OpenRouter dividido por tipo”. Afirma que, desde el punto de cruce de febrero, los agentes están utilizando 14 veces más tokens mientras que el uso humano ha subido 2,8 veces. El gráfico de a16z en la publicación de Newman muestra los mismos datos. OpenRouter clasifica cada clave de API en una de tres categorías: agente, mixto o humano, utilizando una “puntuación compuesta ponderada de 7 señales que incluye entradas como la tasa de llamada a herramientas, el recuento de turnos, la temporización de los huecos y otros”.

(Crédito de la imagen: OpenRouter)

La categoría mixta, que posiblemente cubre comportamientos que son parte agente y parte humano, creció 4,7 veces durante el mismo período, según nuestros cálculos. Dependiendo de cómo se divida ese tráfico, la ventaja de los agentes sobre los humanos puede variar. Los datos también miden el volumen de tokens, no el gasto. Estos datos provienen de una sola plataforma y la tendencia no es completamente constante, con caídas en abril y julio. Sin embargo, el uso de agentes está creciendo en otros lugares. En la encuesta State of AI 2026 de McKinsey, el 40% de los encuestados de grandes organizaciones informaron estar escalando agentes de IA, frente al 27% del año anterior.


Los tokens almacenados en caché también representan casi todo el crecimiento relativo en el uso de tokens, escribió a16z. Cuestan mucho menos que procesar un prompt desde cero, pero aún deben mantenerse en memoria, y a16z, inversor de OpenRouter, vincula esto con la creciente demanda de memoria de alto ancho de banda (HBM). Los modelos mantienen ese contexto almacenado en lo que se llama el caché KV, y “el caché KV está superando la capacidad de HBM de la GPU”, según nuestros informes.

El mismo patrón aparece en los registros de una consultoría de centros de llamadas aquí que probó DeepSeek en Nvidia H200 alquiladas. En el uso de septiembre de sus propios agentes en Claude Code, “el 96% de toda la entrada era relectura de conversaciones antiguas”. Junto con los datos de OpenRouter, esto sugiere que el recuento de tokens sobreestima la factura, pero el coste de hardware para la memoria sigue siendo muy real.


Esa memoria ya es escasa. Micron prevé aquí que la escasez de RAM y almacenamiento empeore en 2027 y 2028, con clientes pagando más que este año, mientras los fabricantes de memoria priorizan la HBM para los centros de datos de IA. Si la predicción de Newman de que el 5x se convertirá en “10X, 20X, 30X” es cierta, los compradores de PC estarán compitiendo por la memoria contra aún más agentes.


Fuente:
TomsHardware

0 comments :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.