El Comportamiento por Defecto que se Volvió Caro
La mayoría de los despliegues de agentes de IA todavía funcionan con una única suposición nunca cuestionada: enviar cada paso de cada tarea al modelo más capaz disponible y ya se ordenará la factura después. Para una prueba de concepto, eso es inofensivo. A volumen de producción - miles de tareas de código, tickets de soporte o pasos de investigación al día - esa suposición convierte la suscripción a un modelo de vanguardia en la partida más grande del presupuesto de IA, a menudo sin que nadie lo haya decidido a propósito.
Nvidia utilizó su propio anuncio del 11 de agosto para argumentar que ese comportamiento por defecto ya está obsoleto. La empresa presentó Nemotron 3.5 Lightning, un modelo abierto de mezcla de expertos con 30.000 millones de parámetros, de los que solo 3.000 millones están activos por token, junto con NeMo Switchyard, una librería de código abierto que decide - tarea por tarea, a veces turno por turno - qué modelo hace falta realmente. Ninguno de los dos es en sí mismo un nuevo modelo de vanguardia. Juntos son la propuesta de que el modelo de vanguardia debería ser la excepción a la que recurre un agente, no el punto de partida.
Un Modelo Pequeño y el Router Construido para Alimentarlo
Nemotron 3.5 Lightning está diseñado para el volumen, no para el rendimiento máximo. El propio blog para desarrolladores de Nvidia informa de que el modelo completa 10.000 tareas de PinchBench un 30% más rápido que Qwen3.6 35B con una precisión comparable, y alcanza el 86% en ese banco de pruebas con una velocidad de salida hasta 4 veces superior a la de modelos de tamaño similar - una afirmación que Nvidia atribuye a la decodificación especulativa y a dos modelos borrador, DSpark y DFlash, ajustados para tráfico de baja y alta concurrencia respectivamente. Los pesos, los datos de entrenamiento y las recetas de entrenamiento se publican bajo la licencia OpenMDW-1.1, que Nvidia describe como su lanzamiento más permisivo hasta la fecha.
NeMo Switchyard es la parte que realmente cambia el comportamiento de un presupuesto. Incluye tres estrategias de enrutamiento sin necesidad de ajuste: un clasificador basado en un LLM que juzga qué modelo necesita cada petición y sigue usando ese mismo modelo durante el resto de la sesión; un router por etapas que lee la actividad reciente de herramientas de un agente y solo asciende a un modelo más potente cuando detecta problemas reales - errores graves, exploración abierta - mientras mantiene las ediciones rutinarias y los turnos con pruebas superadas en el modelo económico; y un router de escalada que empieza cada tarea en el modelo económico y solo la asciende tras observar varios turnos de dificultad sostenida. Una cuarta opción, ajustable, extrae señales del propio estado interno de un modelo durante el entrenamiento para predecir, antes de generar el primer token, lo difícil que es realmente la consulta que llega. Nada de esto exige reescribir la aplicación: Switchyard se coloca delante de la mezcla existente de modelos abiertos, propietarios y de Nvidia de un equipo de desarrollo, y ya está disponible en GitHub.
Tres Cifras, Tres Fuentes Distintas
Las promesas de ahorro asociadas a este lanzamiento son reales, pero no todas tienen el mismo tipo de respaldo, y una empresa que presupueste en base a ellas debería distinguirlas con claridad. El propio banco de pruebas de Nvidia, ejecutado internamente, informa de que Switchyard mantiene una precisión de nivel de vanguardia mientras reduce el coste por tarea a casi un tercio de lo que cuesta operar solo con Claude Opus 4.8 - la afirmación de un proveedor sobre su propio producto, útil como estimación máxima, pero no una cifra sobre la que presupuestar.
Dos clientes publicaron sus propias cifras independientes. LangChain probó el router de escalada en 145 tareas de Deep Agents de varios turnos, enrutando entre Nemotron Lightning y Claude Opus 4.8, y declaró, en cinco ejecuciones separadas, una reducción de costes del 74% enviando solo el 7% de las llamadas al modelo de vanguardia, con un coste de precisión medido de unos 6 puntos porcentuales - una contrapartida que LangChain reconoció en lugar de ocultar. Por separado, Ramp, la empresa de tarjetas corporativas y gestión del gasto, probó el router por etapas de Switchyard contra su propio conjunto interno de pruebas de agentes de código, Ramp SWE-Bench, y declaró, a través de su equipo de ingeniería y de su página de producto, que los agentes enrutados igualaron el rendimiento de un único modelo mientras recortaban el coste un 58% y el tiempo de ejecución un 33%; el sistema ya funciona en producción dentro del propio producto de enrutamiento de Ramp.
Una tercera cifra tiene un respaldo más débil, y conviene decirlo así. El blog técnico de Nvidia atribuye a Devin Desktop, de Cognition, que ejecuta el router por etapas para los propios usuarios internos de Nvidia, un coste medio un 28% menor en el banco de pruebas FrontierCode Main, con una precisión a menos de 2,8 puntos de la de vanguardia y un coste medio de 3,11 dólares - unos 2,90 euros al cambio - por tarea. Esa cifra procede del relato de Nvidia sobre el despliegue, no de una publicación independiente de Cognition - el propio blog de Cognition describe una función de enrutamiento híbrido relacionada pero distinta, llamada Devin Fusion, con cifras de ahorro diferentes y no comparables. Dos de las tres cifras de clientes aquí citadas están confirmadas de forma independiente; una no lo está, y conviene ponderarla en consecuencia.
El Verdadero Producto que Nvidia Acaba de Regalar
El titular es un modelo más barato y más rápido. El movimiento con más consecuencias es lo que Nvidia ha regalado: la propia política de enrutamiento, abierta, independiente del modelo, situada entre un agente y la mezcla de modelos abiertos, propietarios y de Nvidia que una empresa decida usar. Es una posición deliberada, no un accidente - un router que solo apuntara a los propios modelos de Nvidia sería una historia mucho más pequeña.
Para una empresa que ejecuta agentes de IA a escala real, esto cambia lo que realmente significa la dependencia de un proveedor. El viejo riesgo de dependencia era estar atado a la API y los precios de un único laboratorio de vanguardia. El nuevo riesgo es estar atado a cualquiera que sea el router o el sistema que decide, en nombre de la empresa, a qué proveedor se llama y con qué frecuencia, porque ahora es esa capa, y no el modelo que hay debajo, la que concentra el coste de cambiar de proveedor. Un router capaz de mover el tráfico entre Anthropic, endpoints compatibles con OpenAI y pesos abiertos según convenga es una palanca de negociación realmente útil frente a cualquier laboratorio que suba precios. Pero también es una dependencia nueva que un departamento de compras nunca había tenido que garantizar, y que sea de código abierto no hace gratuito el esfuerzo operativo de mantenerlo y ajustarlo.
Hay un aspecto de cumplimiento normativo que las empresas europeas, en particular, no pueden pasar por alto. Un router que mueve la misma tarea entre tres o cuatro proveedores de modelos distintos en mitad de una sesión multiplica el número de contratos de encargado de tratamiento y subencargados que una empresa debe controlar según el artículo 28 del RGPD - cada proveedor que toca una tarea es un subencargado, decida el enrutamiento una persona o una regla de escalada que nadie del departamento financiero ha leído. En España, la Agencia Española de Protección de Datos ya exige a las empresas poder acreditar, si se les pide, la lista actualizada de sus subencargados; una capa de enrutamiento que añade en silencio un cuarto o quinto proveedor de modelos a esa lista en una semana cualquiera no es un riesgo de auditoría hipotético, es uno operativo.
Qué Cambia en la Mesa del Director Financiero
La consecuencia práctica es una nueva partida que auditar, no una herramienta nueva que comprar. Una empresa que ya opera agentes de IA a volumen debería poder responder a una pregunta igual que un equipo de infraestructura ya responde sobre la mezcla entre instancias reservadas y bajo demanda: qué porcentaje de las llamadas de agentes de este mes necesitó realmente el modelo de vanguardia, y quién lo decidió. La cifra de Ramp - 58% menos de coste enrutando, según su propio relato, solo los casos realmente difíciles hacia arriba - es un objetivo plausible para una carga de trabajo de agentes de código parecida a la suya, no una garantía para cualquier carga de trabajo; un agente de atención al cliente o un asistente de investigación enrutará de forma distinta a uno de ingeniería de software, y el primer paso honesto es medir el porcentaje actual de llamadas al modelo de vanguardia antes de asumir que un router lo va a resolver.
Leer a continuación: Grok Bot Inicia Sesión en tus Apps y Nunca Cierra | 4.000 apps en 30 días: la apuesta IA de Cloudflare



