// opendata

Las cifras reales
de la plataforma.

Datos de uso de la plataforma de inferencia, agregados y anonimizados. Sin prompts, sin contenido; solo contadores a nivel de petición.

Actualización semanal · 22 Jun 2026

333.8B

Tokens procesados

acumulado

27.6M

Peticiones servidas

acumulado

9

Modelos activos

en producción

// modelos

Tokens por modelo.

Tokens acumulados por modelo. Un modelo abierto concentra la mayor parte de la carga, el stack completo está siempre disponible.

01 Qwen 3.6 76.1% 254 B · 24.6 M
02 DeepSeek V4-Flash 12.4% 41.2 B · 848.6 K
03 MiMo V2.5 8.6% 28.6 B · 414.4 K
04 Gemma 4 2.4% 8 B · 1.2 M
05 Qwen3 Embedding 0.5% 1.8 B · 457.7 K
06 Qwen3 Coder <0.1% 142.8 M · 7.1 K

// tokens

Entrada vs. salida.

La inferencia es mayoritariamente de lectura, prompts largos, recuperación y contexto, con una fracción menor de tokens generados.

Entrada · prompt 329 B 98.6%
Salida · generado 4.8 B 1.4%

// uso

Tokens por día.

Tokens procesados a diario en los últimos 90 días, con pico en 3.1 B/day.

0 1 B 2 B 3 B 4 B 3.1 B peak
hace 90 díashoy

// más allá del texto

Voz y reranking.

El stack va más allá de los LLM, transcripción, síntesis y reranking funcionan sobre la misma API.

Voz a texto Whisper Large v3 18.5 K peticiones
Texto a voz Kokoro 15.8 K peticiones
Reranking Qwen3 Reranker 2.9 K peticiones

// clientes · últimos 7 días

Cómo se conectan los equipos.

Compatibilidad drop-in con OpenAI en producción real, el SDK oficial y OpenCode concentran la gran mayoría del tráfico.

OpenAI SDK (Python) 49.2% 233 devs
OpenAI SDK (JS) 12.4% 59 devs
Node.js 8.2% 39 devs
curl 6.5% 31 devs
Python httpx 6.1% 29 devs
Vercel AI SDK 5.3% 25 devs
Python aiohttp 4% 19 devs
Python requests 3.6% 17 devs
Otros 4.6% 22 devs

// geografía · últimos 7 días

Origen de las peticiones.

El 84.1% del tráfico se origina en la UE, la audiencia para la que se ha construido esta infraestructura.

España 30.5% 949.1 K
Finlandia 27.5% 857.3 K
Alemania 23.9% 745.1 K
Colombia 5.1% 158.1 K
Estados Unidos 4.9% 152.4 K
Reino Unido 2.1% 66.8 K
Argentina 1.7% 52.3 K
México 1.4% 42 K
Francia 1.1% 35 K
Países Bajos 0.4% 13.1 K
Irlanda 0.4% 10.9 K
Polonia 0.3% 7.7 K
Otros 0.8% 24 K

// rendimiento

Latencia y throughput.

Mediana de tiempo hasta el primer token y throughput sostenido por modelo, medido el 22 Jun 2026.

Modelo TTFT p50 Throughput
Qwen 3.6 1.4 s 468 rpm
DeepSeek V4-Flash 6.6 s 33.3 rpm
Gemma 4 174 ms 14.4 rpm
MiMo V2.5 1.4 s 9.5 rpm

TTFT p50 = mediana de tiempo hasta el primer token · Throughput = peticiones sostenidas por minuto.

// para quién

Dos formas de usar este stack.

Estas cifras vienen de cargas de trabajo reales, tanto de comunidad como de despliegues privados.

Builders y comunidad

Modelos frontier, precio justo, sin ceder datos.

Acceso a los últimos modelos abiertos a un coste razonable, sin compartir datos, a través de la comunidad NaN.

nan.builders →
Startups y empresas

Inferencia privada y dedicada con SLAs.

Infraestructura dedicada, soporte y SLAs contractuales, tarifa plana, datos en la UE, compatible con OpenAI.

ver_precios →

Metodología. Las cifras son contadores agregados y anonimizados recogidos a nivel de petición. Helmcode no guarda logs, nunca se almacena contenido de prompts ni respuestas. Las métricas acumuladas cubren toda la vida de la plataforma; las métricas por ventana se indican en cada sección.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.