Bitácora: el experimento terminó antes que la descarga
2026·09·27 · 2 min read

Quería ejecutar Ling-3.0-flash-VL localmente — 124B parámetros bajo licencia MIT suena como algo que puedes simplemente bajar. Leer la matriz de lanzamiento antes de iniciar la descarga me ahorró 250 GB y una tarde. Ese es el resultado.
El plan
Descargar Ling-3.0-flash-VL — publicado por inclusionAI el 4 de septiembre de 2026 bajo licencia MIT — servirlo con vLLM o SGLang, y descubrir cuál es el requisito real de VRAM versus lo que promete la tarjeta del modelo.
Paso 1: leer la tarjeta antes de tocar git lfs
Este es el paso que usualmente me salto. Los números de la propia tarjeta:
- 124B parámetros totales, 5.5B activados por token (MoE disperso).
- Entrada de imagen y video, ventana de contexto hasta 256K tokens.
- Licencia: MIT. Genuinamente MIT, no una licencia comunitaria con límite de asientos.
Y luego la sección de servidos, que es donde terminó la tarde. La receta recomendada de SGLang para el contexto completo de 256K (vía YaRN) es cuatro GPUs de clase 141GB — H20-3e o H200 — o un nodo Blackwell de cuatro GPUs (B300 / GB300). Existe una variante FP8 publicada cuatro días después que baja el listón, pero no a nada que exista en esta habitación.
Paso 2: verificar qué significa "descargar los pesos"
Los metadatos del archivo del repositorio ponen el checkpoint en BF16 en roughly 250 GB a través de 64 fragmentos. Con esta conexión eso es casi un día entero, para producir un directorio que no puedo cargar.
El hallazgo
El experimento falló, y el fracaso es la parte útil, así que aquí está claramente: una licencia MIT te dice lo que tienes permiso de hacer, no lo que eres capaz de hacer. "Pesos abiertos" en 2026 significa que puedes inspeccionar, afinar y revender el modelo sin preguntarle a nadie. No significa que el modelo quepa en tu hardware, y para cualquier cosa a esta escala, no lo cabe.
El camino realista para un modelo como este, para alguien sin un cluster de GPUs, sigue siendo la API de un proveedor de inferencia — la diferencia con un modelo cerrado siendo que hay más de un proveedor sirviendo los mismos pesos, así que cambiar es una URL base y no una reescritura. Ese es un beneficio real. Solo que no es el que implica la palabra "local".
Lo que necesitaría para el experimento real
Acceso a un nodo de cuatro GPUs clase H200 durante una tarde. Si eso se materializa, esta entrada recibe una parte dos con los números que promete la tarjeta medidos contra los números que reporta la máquina. Hasta entonces no voy a fingir que lo ejecuté.