Vast-10M promete 10M de tokens onde todo RAG quebra
Vast-10M é o primeiro LLM de fronteira a prometer dez milhões de tokens de contexto nativo, dez vezes mais do que o teto de um milhão que prendeu os modelos da OpenAI e da Anthropic nos últimos três anos. Para quem opera sistema em produção, isso importa menos pelo número gigante e mais pelo problema que ele tenta matar: recall preciso em volume absurdo de dados sem depender de um pipeline de RAG remendado. Se você já precisou responder perguntas que cruzam informações no início, no meio e no fim de uma base enorme, sabe que o modelo costuma lembrar do começo e do fim e inventar o meio.
A proposta da Voltropy é direta e por isso incomoda. Em vez de empilhar memória externa, chunking e reranking para compensar janela curta, colocar tudo dentro do contexto e deixar o modelo raciocinar por cima. Código inteiro do React, do SQLite ou do compilador TypeScript caberia de uma vez. O código tributário americano inteiro caberia de uma vez. Chamadas de resultado do S&P 500 inteiro, transcrição de julgamento de meses, um ano de revista médica. É um salto que, se for real na latência e no preço, muda como a gente desenha arquitetura de dados para IA.
O fato sem hype
A Voltropy lançou a família Vast-10M em três tamanhos. O Vast-10M Flash é baseado no DeepSeek V4.0 Flash, o Vast-10M Medium é baseado no GLM-5.2 e o Vast-10M Pro é baseado no DeepSeek V4.0 Pro. O que une os três é o Voltropy Scalable Attention, o VSA, um novo mecanismo de atenção que promete aumentar a inteligência em contextos curtos e ao mesmo tempo destravar recall e raciocínio em contexto ultralongo. O acesso antecipado começou agora, ainda em regime controlado.
Em números divulgados pela empresa, o Vast-10M Flash bate o Claude Fable 5.1 na faixa de um milhão de tokens no benchmark BEAM, Beyond a Million Tokens, e empata com o GPT-6 Astra. É aí que esses modelos param. O Vast-10M continua. Ele retém 82,49 por cento da pontuação quando o contexto cresce dez vezes, e marca 40,20 pontos na faixa de dez milhões de tokens do BEAM. Segundo a Voltropy, é a maior nota já obtida por um modelo puro nessa escala, acima do que se reporta para a maioria dos sistemas de RAG.
Outro detalhe chama atenção para quem acompanha evolução de base. O Vast-10M Flash domina o DeepSeek V4.1 Flash mesmo tendo sido construído sobre o V4.0 Flash, mais antigo. Na leitura da empresa, o ganho vindo do VSA foi maior do que o ganho que a DeepSeek obteve treinando uma geração nova. Isso não prova que o Vast-10M seja mais inteligente em tudo. A própria Voltropy admite que Fable e Astra seguem superiores em tarefas de inteligência bruta, como matemática de fronteira. A aposta é outra: fusão de recall de alta precisão com raciocínio em workloads de empresa e consumo.
Como funciona na visão de quem opera
Historicamente houve duas saídas para esticar contexto. Uma foi baratear a atenção do transformer, com aproximações esparsas, janelas deslizantes ou compressão agressiva de KV cache, o que quase sempre derrubou precisão. A outra foi abandonar o transformer e ir para arquiteturas sem atenção, como state-space models e RNNs lineares, que escalam bem mas perdem em raciocínio fino e em seguir instruções complexas. O VSA tenta fugir desse dilema mantendo o modelo como transformer, mas com atenção escalável que melhora até o contexto curto de 100K no BEAM.
Sem paper completo aberto, dá para inferir o caminho provável com base no comportamento descrito. Para segurar dez milhões de tokens, o VSA deve combinar atenção hierárquica ou em blocos com seleção dinâmica de tokens relevantes, algo como roteamento por relevância mais compressão de estados intermediários. Na prática, o modelo não olharia para tudo com o mesmo peso o tempo todo. Ele aprenderia a preservar âncoras de alta fidelidade e a resumir o resto em representações mais baratas, recuperando detalhe sob demanda durante o decode. Esse desenho explicaria o ganho em 100K e a retenção alta até 10M, porque o mecanismo não é só uma muleta para contexto longo, ele reorganiza como o modelo distribui capacidade.
Para operação, o que importa é API, custo e latência. Dez milhões de tokens nativos significam KV cache gigantesco. Mesmo com compressão, estamos falando de centenas de gigabytes de estado por sessão longa se for precisão total, o que exige paralelismo agressivo, paginação de memória e provavelmente precificação por token com degraus por faixa de contexto. É plausível que o Flash seja o único economicamente viável para 10M no dia a dia, com o Pro reservado para janelas menores ou para análises pontuais de alto valor. Latência de primeiro token em 10M deve ser alta, na casa de dezenas de segundos a minutos dependendo da infraestrutura, e o throughput de geração deve cair. O jogo aqui não é chatbot rápido, é batch analítico, auditoria de código, due diligence, pesquisa.
O que isso muda na prática
Quem ganha primeiro é quem hoje sofre com RAG complexo. Times que mantêm pipelines com ingestão, chunking, embeddings, banco vetorial, reranker e orquestração para responder sobre repos gigantes ou dossiês longos podem simplificar. Jogar o repo inteiro no contexto elimina uma classe inteira de erros de fragmentação, como bug que só aparece na interação entre duas partes distantes do código. Em segurança, isso é ouro. Caçar vulnerabilidade olhando arquivo por arquivo perde correlação. Olhar o sistema inteiro de uma vez muda a taxa de detecção de falhas lógicas e de fluxo de dados.
- Auditoria de código e compliance: em vez de fatiar repo, suba a árvore completa com histórico relevante e peça trilha de causa e efeito com referências de linha.
- Pesquisa e jurídico: troque dezenas de consultas fragmentadas por uma passada densa sobre o corpus completo, com extração estruturada depois.
- Finanças e saúde: cruze séries longas, como calls trimestrais ou prontuários longitudinais, sem perder o meio da história.
A ação prática mais sensata agora é montar um teste A contra B antes de reescrever tudo. Pegue um workload real onde seu RAG falha hoje, algo com necessidade de recall exato mais raciocínio em dois ou três saltos, e rode em três modos: RAG atual, contexto longo de 1M com modelo de fronteira e Vast-10M Flash com corpus completo. Meça precisão com gabarito humano, custo por tarefa resolvida e latência p95. Minha aposta de operador: não troque o RAG pelo contexto gigante de cara. Use o contexto gigante como camada de verificação e de casos difíceis, e mantenha o RAG para o trivial rápido e barato. O ajuste imediato é de roteamento, não de substituição.
A tensão real: escala, custo e gargalo movido
A dúvida que fica é simples e incômoda. Isso escala fora do benchmark. O BEAM mede recall e raciocínio sintético em longa escala, mas produção tem ruído, duplicata, PDF quebrado, código legado, contradição entre documentos. Manter 82,49 por cento da nota ao ir de 1M para 10M é impressionante, mas 40,20 pontos em 10M ainda significa errar muito. Para auditoria crítica, errar 60 por cento das vezes em perguntas difíceis não fecha conta. A pergunta não é se 10M impressiona, é qual é a taxa de acerto por dólar em tarefa que gera receita ou evita risco.
E tem o custo que ninguém gosta de detalhar no lançamento. Contexto nativo gigante transfere complexidade do pipeline para a inferência. Você economiza engenharia de chunking e banco vetorial, mas paga em tokens de entrada toda vez que rodar, paga em latência e paga em engenharia de prompt para não se perder em mar de dados. Também cria um gargalo novo: avaliação. Como auditar resposta gerada a partir de dez milhões de tokens. Como citar fonte, como reproduzir, como debugar quando o modelo mistura dois trechos parecidos distantes entre si. Resolveram o gargalo da janela e empurraram o gargalo para observabilidade, custo e confiança. Isso resolve ou só muda o problema de lugar.
Conclusão prática
Vast-10M é o primeiro movimento crível para quebrar o teto de um milhão de tokens sem emburrecer o modelo, e o VSA parece ser mais do que truque de engenharia. Se o preço por tarefa se sustentar, ele vira padrão para análise profunda de código, jurídico e pesquisa. A questão que fica para testar nesta semana é direta: no seu pior caso de RAG hoje, o contexto total dentro do modelo acerta mais por menos dinheiro ou só acerta mais gastando muito mais.



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.