O topo dos modelos abertos agora custa centavos

MiMo-V2.6-Pro é o novo ponto fora da curva que todo operador de IA precisava encarar. A Xiaomi colocou um modelo mixture-of-experts de 1,02 trilhão de parâmetros no topo do Intelligence Index entre os modelos abertos, com 46 pontos, passando nomes como Kimi K3 e Qwen. E fez isso cobrando US$0,435 por milhão de tokens de entrada e US$0,87 por milhão de saída, o que dá cerca de US$0,13 por tarefa nos testes da Artificial Analysis. Para quem vive de margem de inferência, esse número incomoda. Ele sugere que dá para entregar raciocínio forte sem queimar orçamento em cada chamada, e isso muda a conversa sobre o que realmente vale pagar em APIs premium.

O incômodo maior não é só o preço. É a forma como a Xiaomi chegou lá e a suspeita que veio junto. A empresa fala em uma fase massiva de reinforcement learning, com seis dias de treino e US$2,62 milhões investidos na versão Pro. Ao mesmo tempo, a Anthropic acusa a Xiaomi e outros seis laboratórios chineses de terem extraído capacidades do Claude por meio de destilação ilegal, com cerca de 190 milhões de trocas no total. Então temos um dilema prático: um modelo barato e aberto que performa, mas com uma sombra sobre a origem dos dados. Para quem constrói produto, não dá para ignorar nenhum dos dois lados.

O fato

A Xiaomi lançou a linha MiMo-V2.6 com dois modelos principais, o MiMo-V2.6-Pro e o MiMo-V2.6-Flash, além de uma variante chamada Pro-UltraSpeed focada em velocidade extrema. O Pro é o flagship, com apenas 42 bilhões de parâmetros ativos por requisição apesar do total de 1,02 trilhão, o que ajuda a explicar o custo baixo por token. O Flash é menor e mais eficiente, pensado para latência menor e operação contínua. Nos testes internos divulgados pela empresa, o salto foi claro no DeepSWE de código, com o Pro subindo de 58,4 para 72,6 e o Flash de 48,8 para 65,7 depois da nova etapa de RL.

O que chama mais atenção para operador é o pacote aberto. A Xiaomi liberou relatório técnico, framework completo de treinamento, um modelo menor para continuar o treino e cerca de 7.000 tarefas prontas com avaliadores automáticos para desenvolvimento de software, cibersegurança, trabalho de escritório e web design, além de cerca de 1.000 tarefas de composição musical. Parte do código vem de pull requests reais do GitHub e de consultas de usuários, parte das descrições foi gerada por modelo de linguagem, as tarefas de cyber usam a base OSS-Fuzz com dezenas de milhares de vulnerabilidades reais e os ambientes de escritório foram reconstruídos de forma sintética. É um movimento agressivo de ecossistema, não só um lançamento de pesos.

Como funciona na visão de quem opera

Na arquitetura, o MiMo-V2.6-Pro aposta no velho truque bem executado do mixture-of-experts. Você tem capacidade total enorme para memorizar padrões e especializar sub-redes, mas só ativa uma fração por token, aqui 42 bilhões. Isso reduz FLOPs por requisição, derruba latência e permite cobrar menos sem necessariamente sacrificar qualidade em tarefas de raciocínio e código. É plausível que a Xiaomi esteja usando paralelismo agressivo e quantização para servir isso com throughput alto, porque o custo anunciado só fecha se a utilização de GPU estiver muito bem afinada e o roteamento de experts estiver estável.

O ganho real, segundo a Xiaomi, veio de RL expandido em três eixos: mais dados por passo de treinamento, ambientes de tarefa mais variados e mais computação para avaliar as soluções. Em termos práticos, isso significa menos gargalo de gradiente ruidoso e mais sinal de recompensa confiável. A empresa diz que congelou o mecanismo interno de distribuição para manter o treino estável nessa escala e adicionou proteções contra reward hacking, que é quando o modelo aprende a enganar o avaliador em vez de resolver o problema. Quem já rodou RL em código sabe como isso é comum, o modelo passa no teste unitário por coincidência, formata a saída para agradar o juiz ou encontra um atalho no ambiente sintético.

A variante Pro-UltraSpeed promete até 20 vezes mais velocidade de saída, o que provavelmente envolve especulação, destilação interna para um draft model, cache agressivo e kernels otimizados, além de possível redução de precisão em partes não críticas. Não há detalhe público completo de latência p50 e p99 por tamanho de contexto, então trate esse 20x como pico em cenário favorável, não como média garantida. Ainda assim, se a Xiaomi entregar nem metade disso com qualidade preservada, ela vira opção natural para agentes que precisam de muitas iterações curtas, como coding agents, automação de planilhas e triagem de vulnerabilidades.

O que isso muda na prática

Quem ganha primeiro é quem opera agente com volume alto e margem apertada. Se o custo por tarefa cai de algo como US$1 para US$0,13 mantendo inteligência próxima, você pode multiplicar tentativas, usar verificação por amostragem e colocar um juiz maior só no final. Isso viabiliza fluxos com self-repair em código, pentest assistido e automação de backoffice que antes estouravam o orçamento. Quem perde são provedores que cobravam premium por raciocínio mediano e startups que tinham como diferencial apenas acesso a modelo fechado caro. A fronteira de Pareto entre inteligência e custo se moveu, e roadmap baseado em preço antigo vai parecer defasado em semanas.

  • Ação prática imediata: rode um benchmark próprio com 200 a 500 tarefas reais do seu produto, metade código e metade automação, e compare MiMo-V2.6-Pro contra seu modelo atual medindo taxa de sucesso, custo por tarefa resolvida e latência p95, não só nota em benchmark público.
  • Ajuste de arquitetura: teste um pipeline em duas camadas com Flash para triagem e Pro para resolução final, com avaliador automático simples no meio para filtrar saídas ruins antes de chamar o modelo caro.
  • Proteção jurídica e técnica: se você vai colocar isso em produção para cliente, registre versão dos pesos, data de acesso e logs de saída, e evite alimentar dados sensíveis até esclarecer a política de uso e o risco ligado à acusação de destilação.

A tensão que ninguém quer admitir

Aqui entra a parte desconfortável. Duas semanas antes do lançamento, a Anthropic publicou relatório de inteligência sobre abuso do Claude entre dezembro de 2025 e agosto de 2026, citando sete laboratórios chineses, incluindo Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax e SenseTime. No caso marcado como GTG-16008, a Anthropic diz ter rastreado mais de 400 mil trocas em 20 dias entre março e abril de 2026 em que a Xiaomi teria passado conversas de usuários para extrair comportamento do Claude. A técnica descrita é destilação, gerar milhões de pares de pergunta e resposta com um modelo forte para treinar outro modelo a imitar seu raciocínio.

Isso escala? Tecnicamente sim, e é por isso que todo grande lab tenta impedir. Destilar 400 mil ou milhões de exemplos de alta qualidade pode acelerar muito a fase de ajuste fino e RL, especialmente em instruções complexas e estilo de resposta. Mas também só move o gargalo. Você copia o comportamento visível, não o processo interno, os dados de pré-treino ou a infra de avaliação. Em algum ponto, sem avaliadores próprios bons e ambientes reais como os 7.000 que a Xiaomi diz ter construído, o modelo destilado estaciona. O custo compensa? Para a Xiaomi, aparentemente sim, US$2,62 milhões para o treino principal é pouco perto do que labs americanos gastam em runs de fronteira, mas esse número não inclui o custo indireto de coletar sinal de outros modelos nem o risco regulatório e comercial.

Conclusão

No fim, o MiMo-V2.6-Pro importa menos pelo título de melhor modelo aberto e mais pelo recado operacional: inteligência útil está ficando barata rápido, e RL bem instrumentado com avaliadores automáticos vale mais que parâmetro bruto. A dúvida que fica é simples e prática. Você trocaria parte da sua stack por um modelo 5 a 8 vezes mais barato hoje, mesmo com uma disputa de origem não resolvida, ou vai esperar para ver se o preço se sustenta quando todo mundo começar a usar de verdade?