Bitácora: dejando que Fugu Max decida qué modelo hace el trabajo
2026·09·27 · 3 min read

Un orquestador que enruta cada tarea al modelo más barato que puede manejarla es una muy buena idea o una abstracción muy cara. Aquí está la prueba que diseñé para saber cuál, y lo que me niego a concluir de ella.
Estado: preparación, no resultados. Sin ejecuciones, sin números todavía. Esta entrada existe para fijar el método antes de que los resultados puedan convencerme de una conclusión.
La premisa
El Fugu Max de Sakana AI (11 de septiembre de 2026) no es un modelo, es un enrutador. Una llamada a la API entra; detrás, un pool de modelos de peso abierto y especializados, y una capa que decide cuál es el más ligero que puede hacer el trabajo. Cotizado a 2$ por millón de tokens de entrada y 6$ por millón de tokens de salida, lo que Sakana sitúa un 40–60% por debajo de Sonnet 5, GPT-5.6 Terra y Kimi K3 en salida.
El marco del anuncio es la parte con la que estoy de acuerdo antes de probar nada: «Un sistema que despliega un modelo de múltiples billones de parámetros para ejecutar una simple búsqueda de datos no es inteligente, es desperdicio.»
Lo que quiero saber
No si es más barato en los benchmarks de Sakana — lo es, para eso está la publicación. Lo que quiero saber es dónde la decisión de enrutamiento es incorrecta, porque ese es el número que decide si entra en un producto.
Un enrutador tiene un modo de fallo específico: envía una tarea a un modelo que casi es suficiente. La salida vuelve plausible y sutilmente incorrecta, a un tercio del precio, y te enteras dos pasos después.
El conjunto de pruebas
Cuatro formas de tareas extraídas de cosas que este sitio realmente hace, cada una con una respuesta correcta conocida:
| Forma | Ejemplo de aquí | Respuesta correcta conocida porque |
|---|---|---|
| Extracción trivial | Extraer las etiquetas del cuerpo de un post | Determinista, verificable |
| Generación corta | Redactar el excerpt de una entrada | Comparado con el escrito a mano |
| Traducción | El borrador EN↔ES que el CMS ya produce | Salida existente para diffear contra |
| Razonamiento sobre contexto | Responder una pregunta de la base de conocimiento | Conjunto fijo de preguntas con respuestas evaluadas |
Cada forma se ejecuta dos veces: una a través de Fugu Max, otra contra el modelo más fuerte que de otro modo habría llamado directamente. Registrado por ejecución: costo, latencia, y si la salida es aceptable sin ediciones.
La regla que estoy estableciendo ahora, antes de ver nada
Más barato solo cuenta cuando la salida es aceptable. Una ejecución que cuesta una décima parte y necesita un humano para corregirla cuesta más que la cara. Así que la comparación es costo-por-salida-aceptada, no costo por llamada, y la decisión de aceptación se hace contra los criterios anteriores en lugar de por cómo se siente el texto cuando lo leo.
El resultado interesante sería una forma donde delegar claramente gana y una forma donde claramente pierde. Si todo sale aproximadamente igual, la conclusión honesta es que el experimento fue demasiado pequeño para decir nada — y eso es lo que se escribirá aquí.