Modelo aberto de 30 bilhões de parâmetros promete acelerar tarefas especializadas e chega acompanhado de uma biblioteca que direciona pedidos entre diferentes IAs.
- Nemotron 3.5 Lightning tem 30 bilhões de parâmetros e arquitetura mixture-of-experts.
- Nvidia afirma saída até quatro vezes mais rápida e tarefas de agentes 30% mais rápidas.
- NeMo Switchyard escolhe modelos conforme qualidade, latência e custo.
O que a Nvidia apresentou
A Nvidia ampliou a família Nemotron com o Nemotron 3.5 Lightning, um modelo aberto voltado a tarefas especializadas executadas por agentes de inteligência artificial. Ele usa uma arquitetura mixture-of-experts com 30 bilhões de parâmetros e foi projetado para operar em sistemas que combinam diferentes modelos.
A empresa também lançou o NeMo Switchyard, biblioteca aberta que direciona cada solicitação ao modelo mais adequado. A proposta é permitir que empresas combinem modelos locais, proprietários e da própria Nvidia sem reescrever toda a aplicação.
Como funciona a abordagem de vários modelos
Agentes que permanecem ativos por longos períodos não precisam usar o modelo mais caro para todas as etapas. Um sistema pode reservar um modelo avançado para planejamento e raciocínio, enquanto modelos menores cuidam de revisão de código, monitoramento de alertas, uso de ferramentas ou atendimento de dúvidas recorrentes.
O Switchyard tenta automatizar essa escolha considerando qualidade, latência e custo. Segundo benchmarks internos da Nvidia, a biblioteca manteve precisão próxima à de modelos de fronteira e reduziu o custo de conclusão de tarefas para perto de um terço do uso isolado do Opus 4.8.
Desempenho e execução local
A Nvidia afirma que o Nemotron 3.5 Lightning entrega saída até quatro vezes mais rápida e conclui tarefas de agentes 30% mais rápido que outros modelos de sua classe. Como os números foram produzidos pela própria companhia, resultados independentes serão importantes para medir o desempenho em situações reais.
O modelo pode operar em PCs com GPUs RTX, DGX Spark, DGX Station, dispositivos Jetson, estações profissionais, data centers e nuvem. Essa flexibilidade permite manter determinadas cargas dentro da infraestrutura da organização, o que pode ajudar em privacidade, latência e controle de custos.
Quem já está testando
Empresas de diferentes setores participaram da avaliação ou personalização do modelo. A lista divulgada inclui CrowdStrike em segurança cibernética, Harvey e Trajectory em serviços jurídicos, CodeRabbit e Baseten em revisão de código, além de organizações ligadas a ciência, finanças e saúde.
No roteamento, a Nvidia informou reduções de custo em testes de parceiros. A LangChain registrou custo 74% menor em 145 tarefas de múltiplos turnos, com perda de seis pontos percentuais de precisão. A Ramp relatou corte de 58% no custo e de 33% no tempo de execução em seu benchmark de engenharia de software.
Por que a Nvidia aposta em modelos abertos
Modelos gratuitos e modificáveis podem ampliar o número de aplicações que rodam em hardware acelerado. Para a Nvidia, portanto, o avanço do ecossistema aberto também estimula demanda por GPUs, estações de trabalho e infraestrutura de data center.
A estratégia ganhou destaque depois de Jensen Huang defender publicamente modelos de pesos abertos e argumentar que eles fortalecem competição, soberania tecnológica, segurança e inovação. O lançamento coloca a fabricante em uma disputa que envolve Meta, empresas chinesas e fornecedores de modelos proprietários.
Disponibilidade e limites
O Nemotron 3.5 Lightning está disponível no Hugging Face, ModelScope, OpenRouter e build.nvidia.com. O NeMo Switchyard foi publicado no GitHub e deve chegar a plataformas de parceiros.
A abertura do modelo não elimina a necessidade de avaliação. Empresas devem testar qualidade no próprio domínio, riscos de segurança, licença, consumo de memória, comportamento com ferramentas e custo total antes de usar o sistema em produção.
O que acompanhar agora
Os próximos sinais serão benchmarks independentes, adoção por ferramentas de agentes e qualidade das personalizações. Também será importante observar se o roteamento entre modelos mantém resultados consistentes quando uma tarefa atravessa várias etapas e depende de contexto acumulado.
Para equipes menores, a novidade abre a possibilidade de reservar modelos caros apenas para decisões difíceis. O ganho real, porém, dependerá de boa observabilidade: sem medir qualidade, latência e custo por etapa, o roteador pode apenas trocar uma despesa visível por uma complexidade difícil de administrar.
Perguntas frequentes
O Nemotron 3.5 Lightning é gratuito?
A Nvidia disponibilizou o modelo para download, uso e modificação segundo os termos aplicáveis nas plataformas de distribuição. Empresas devem revisar a licença antes da adoção.
Ele roda em um computador comum?
A companhia afirma que o modelo pode rodar localmente em sistemas com GPU Nvidia compatível, incluindo PCs RTX. A experiência depende da memória, quantização e configuração do equipamento.
O que o NeMo Switchyard faz?
Ele funciona como um roteador: analisa uma solicitação e a envia ao modelo considerado mais adequado para equilibrar qualidade, velocidade e custo.