Basecamp Research quer trocar texto por DNA como dado de treino
Modelos EDEN da Basecamp Research tentam resolver um problema que quem opera com IA conhece bem: dado bonito no papel nem sempre vira resultado útil em produção. A startup londrina captou US$140 milhões para treinar IA não com texto da internet, mas com DNA de microrganismos coletados em oceanos, florestas e fontes termais, com o objetivo de desenhar antibióticos e ferramentas para terapia celular. A tese é simples e incômoda ao mesmo tempo. A evolução passou 4 bilhões de anos testando soluções biológicas, e quase nada disso está nos bancos públicos de genomas.
O fato: US$140 milhões com Nvidia e Anthropic no cap table
A rodada foi liderada pela S32 e contou com Nvidia, Anthology Fund da Anthropic, NATO Innovation Fund e Redalpine, entre outros. Fundada em 2020, a Basecamp vai usar o dinheiro para continuar o desenvolvimento dos modelos EDEN e avançar candidatos próprios em direção à clínica. O foco inicial são terapias celulares, com a ambição de editar células diretamente dentro do corpo, o chamado in vivo, em vez de tirar a célula, modificar fora e reinfundir.
Por enquanto, o que existe de concreto são resultados de bancada e estudos em camundongos, incluindo candidatos contra bactérias multirresistentes. Isso é relevante, mas está longe de provar segurança e eficácia em humanos. O Wall Street Journal já apontou que farmacêuticas estão colocando bilhões em IA sem evidência clara de aumento de taxa de sucesso em desenvolvimento clínico. O CTO Philip Lorenz responde que biologia é um problema muito maior e mais complicado que linguagem, e que escala ainda vai demorar mais para aparecer na clínica.
Como funciona na visão de operador
A lógica de arquitetura é parecida com a de um foundation model, mas o corpus muda tudo. Em vez de tokens de texto, o modelo aprende com nucleotídeos, genes e contextos evolutivos. A Basecamp mantém expedições próprias de coleta e monta o banco BaseData, justamente porque os repositórios públicos são enviesados. Segundo a empresa, cerca de 68% do volume de sequências no Sequence Read Archive vem de apenas cinco espécies, com humanos respondendo por cerca de 54%. Para pesquisa médica focada isso faz sentido. Para aprender processos biológicos diversos, é um buraco.
O CTO cita uma comparação da Epoch AI para dimensionar o desafio. O limite superior de todas as palavras existentes seria algo em torno de cinco quatrilhões de tokens. Já a estimativa da Basecamp para nucleotídeos na Terra é de 10 elevado a 37. Ninguém vai treinar com isso tudo, mas a mensagem operacional é clara: os datasets atuais de bio são pequenos, fragmentados e presos em silos de estudos isolados. A aposta é combinar coleta massiva e diversificada com experimentos pequenos e direcionados para fechar o loop entre predição e validação.
Custo, latência e onde o gargalo aperta
A empresa não abre custo por inferência ou tamanho exato dos modelos EDEN, então aqui vale inferência técnica plausível. Treinar sobre diversidade genômica global exige pipeline pesado de sequenciamento, controle de qualidade, montagem e anotação antes mesmo da GPU entrar em cena. O custo dominante não deve ser só compute, mas logística de campo, wet lab e curadoria. Na inferência, gerar uma sequência candidata é barato. O caro é testar se ela dobra certo, não é tóxica, insere o gene no lugar certo e funciona em um organismo real.
Em termos de arquitetura prática, pense em dois loops. Um loop lento e caro de modelo generativo que propõe antibióticos, enzimas e sistemas de inserção gênica. E um loop rápido de triagem computacional seguido de validação em bancada. A latência que importa aqui não é token por segundo, e sim semana por ciclo de teste. Quem já operou ML aplicado a biotech sabe que o molho está em reduzir esse ciclo sem perder fidelidade, porque cada iteração errada custa reagente, tempo de CRO e janela regulatória.
O que isso muda na prática
Para quem constrói em bio e health, a Basecamp empurra uma mudança de mentalidade. Pare de presumir que o banco público resolve. Sequência sem contexto ecológico, sem metadado de habitat e sem ensaio funcional acoplado vale pouco para generalizar. Quem ganha agora são times com acesso a dado proprietário diverso e capacidade de gerar dado fechando o loop em laboratório parceiro. Quem perde são abordagens puramente in silico que otimizam benchmark acadêmico e quebram na primeira placa de cultura.
Se você opera pipeline de descoberta, a ação prática desta semana é auditar seu dataset. Separe o que é dado de treino real do que é só volume repetido da mesma espécie e do mesmo tipo de ensaio. Depois monte um conjunto pequeno, mas bem curado, com diversidade de origem e leitura funcional clara, e teste se seu modelo mantém performance fora da distribuição. É melhor ter 10 mil sequências diversas com fenótipo medido do que 10 milhões de reads redundantes sem rótulo útil. Essa é a lição operacional que a Basecamp está tentando industrializar.
- Diversidade vale mais que volume: priorize amostras de ambientes pouco estudados com metadados completos.
- Benchmark não é bancada: valide candidatos em ensaio funcional cedo, antes de escalar o modelo.
- Custo total inclui wet lab: planeje orçamento por ciclo experimental, não só por hora de GPU.
A tensão real: isso escala ou só move o gargalo
Aqui fica minha dúvida honesta como operador. Mais dados evolutivos provavelmente geram moléculas mais interessantes, mas o gargalo da medicina nunca foi só gerar candidato. É provar segurança, fabricar com qualidade, passar por fase 1, 2 e 3, e negociar com regulador e pagador. IA pode acelerar a ponta da descoberta e mesmo assim não mexer na taxa de sucesso clínico por anos. A Basecamp aposta que ferramentas melhores de inserção gênica direcionada destravam terapia in vivo, o que seria enorme. Só que entrega in vivo é justamente onde tantos programas bons morrem, por imunogenicidade, off-target e dificuldade de dose.
Tem também o risco de custo. Manter rede global de coleta, sequenciar, curar e ainda bancar desenvolvimento terapêutico próprio queima muito caixa. É um modelo full stack ambicioso em um momento em que muita biotech prefere ser plataforma asset-light. Se os primeiros candidatos de antibiótico não sustentarem diferenciação clara contra resistência, ou se a edição direcionada não mostrar janela terapêutica em primatas, o discurso de escala de dados perde força rápido. Dado maior ajuda, mas não substitui biologia translacional bem feita.
Conclusão
No fim, a Basecamp está certa no diagnóstico e ainda devedora na prova. Faltam dados diversos para IA biológica, e evolução é a melhor fonte que temos. Agora resta ver se isso vira remédio aprovado ou só mais um modelo que pontua bem e falha no corpo. Você apostaria seu próximo ciclo de P&D em dado proprietário de biodiversidade ou em otimizar o que já tem com ensaios melhores?



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.