TPUs no espaço não é delírio, é falta de energia aqui embaixo
TPUs no espaço parecem ideia de laboratório com verba infinita, mas o problema que o Google está atacando é bem terrestre: onde ligar a próxima geração de data centers de IA. O Project Suncatcher parte de uma conta simples e incômoda. Em órbita baixa, um painel solar recebe luz quase constante e pode gerar até oito vezes mais energia que o mesmo painel no chão, sem noite longa, sem nuvem, sem licenciamento de subestação que demora três anos. Se treinar e servir modelos está esbarrando em megawatt, fio e calor, faz sentido olhar para cima. A pergunta é se o ambiente mais hostil que existe compensa essa energia farta.
O fato sem enfeite
O Google confirmou que vai colocar um satélite protótipo em órbita para testar suas TPUs Trillium fora da atmosfera. A missão vai de carona na Transporter-18 da SpaceX, em parceria com a Planet, e tem um objetivo bem limitado: coletar dados reais de sobrevivência do hardware. Nada de treinar Gemini em órbita ainda. É um teste de física e engenharia para responder se o chip aguenta lançamento, radiação e calor extremo sem corromper os workloads.
Nos testes em solo, a equipe já simulou o pior. Um voo até a órbita baixa dura cerca de 10 minutos, mas com vibração intensa e cargas de até 10 g no veículo. Nos chips, os picos podem chegar a 50 a 100 g por causa da ressonância nas placas. O time colocou o satélite em mesa vibratória nos três eixos para imitar as frequências do foguete e, para surpresa deles, o conjunto segurou. Depois veio a radiação. Em facilidade de feixe de prótons no Crocker Nuclear Laboratory da UC Davis, eles rodaram workloads de IA enquanto bombardeavam as Trillium para observar bitflips e dose ionizante total. O resultado inicial indica tolerância acima do equivalente a cinco anos em órbita. Agora falta a parte que não dá para simular 100 por cento: o espaço de verdade.
Como funciona na visão de quem opera
Pensa no Suncatcher como um data center desmontado e espalhado no céu. A tese de longo prazo é ter constelações de satélites, cada um com dezenas de TPUs, interligados por links ópticos para processar workloads maiores em órbita. Na prática, isso exige resolver três camadas que hoje são triviais no chão e brutais no vácuo: energia, refrigeração e rede.
Energia é a parte boa. Sol constante resolve geração, mas cria outro problema: dissipação. TPUs concentram muito calor em poucos milímetros quadrados. No data center você usa ar, água, até imersão. No vácuo não há ar para convecção. Só resta radiação térmica via radiadores. O Google diz estar testando uma combinação de heat pipes com radiadores, validada em câmara de termo-vácuo que simula pressão e temperatura orbitais. Funciona no papel, mas em operação real o ciclo térmico é violento. O satélite passa do sol escaldante para a sombra gelada a cada 90 minutos. Dilatação, contração, fadiga de solda, tudo isso conta.
Rede é o segundo gargalo. Para inferência e principalmente para treinamento distribuído, você precisa de banda alta e latência previsível entre chips. Dentro de um rack, um interconnect como ICI das TPUs tem terabits com microssegundos de atraso. Entre satélites, mesmo com laser, você fala de distâncias de dezenas a centenas de quilômetros, apontamento preciso, jitter e handover constante porque tudo está se movendo a 7,5 km por segundo. Dá para inferir que o primeiro uso viável não será treinamento gigante síncrono, e sim inferência embarcada, pré-processamento de imagens e talvez fine-tuning pequeno, onde dá para tolerar partição e atraso. Subir peso de modelo de gigabytes para órbita e descer resultado ainda vai custar caro em espectro e estações solo.
O que isso muda na prática
Quem ganha primeiro não é você rodando API amanhã. São times que vivem de dado orbital. Planet, por exemplo, já opera constelação de imageamento. Se conseguir rodar filtragem, detecção e compressão inteligente direto no satélite com TPU, economiza downlink, que hoje é um dos custos mais altos da operação. Menos dado bruto descido, mais insight pronto. O mesmo vale para clima, agricultura de precisão, resposta a desastre e inteligência geoespacial.
Para quem constrói com IA no chão, o recado é menos futurista: acompanhe refrigeração por radiação e tolerância a falhas. As técnicas que o Google está validando para bitflip, checkpointing frequente e correção de erro em ambiente ruidoso vão pingar para clusters terrestres cada vez mais densos e quentes. E tem o lado custo. Lançar quilo para órbita baixa caiu muito, mas continua ordens de magnitude acima de empilhar rack em Iowa. Manutenção é zero. Você não troca um fan com defeito a 500 km de altitude.
- Ação prática agora: se você opera inferência pesada, faça um exercício de custo por watt útil e de sensibilidade a erro de hardware. Teste seus pipelines com injeção de bitflip e perda de nó, meça quanto checkpoint e retry custam em latência. Essa disciplina vale para GPU no chão hoje e vai ser obrigatória se qualquer parte da sua carga um dia rodar no edge orbital.
- Quem perde se isso vingar: provedores de energia e terrenos para data centers em regiões saturadas, que hoje cobram prêmio por megawatt firme.
A tensão real: isso escala ou só move o gargalo
Aqui está minha dúvida honesta depois de ler os detalhes. Energia abundante não resolve tudo, ela só desloca o limite para calor e rede. Radiador é pesado, ocupa área e precisa apontar para o frio profundo sem pegar sol. Quanto mais TPU por satélite, maior o radiador, maior a massa, maior o custo de lançamento, maior o arrasto. É um loop que morde a própria cauda. E tem física que marketing não dobra: treinar modelo de fronteira exige milhares de chips conversando em sincronia apertada. Fazer isso através de links inter-satélite com variação constante parece, hoje, bem menos eficiente que um pod de TPU com refrigeração líquida no chão.
Tem também o custo invisível. Lixo espacial, reentrada, reposição a cada cinco anos, seguro, licenciamento de espectro e de órbita. Um data center terrestre você amplia. Uma constelação você repõe. A conta de oito vezes mais sol precisa ser descontada de tudo isso. Não estou dizendo que é inviável. Estou dizendo que o primeiro produto provável é nicho e de alto valor por bit, não nuvem genérica no céu. Se o teste na Transporter-18 mostrar que a Trillium segura radiação e que o conjunto heat pipe mais radiador estabiliza temperatura em carga real, o próximo marco em 2027 faz sentido como cluster pequeno. Se mostrar throttling térmico ou taxa alta de erro silencioso, o projeto volta para a prancheta de materiais.
Conclusão operacional
Project Suncatcher é um teste de sobrevivência de hardware com uma tese ambiciosa por trás: levar infraestrutura de ML para onde há energia sobrando. O valor de curto prazo está em processamento orbital para quem já vive de satélite. O valor de longo prazo depende de resolver calor e interconnect em escala. Vale acompanhar o dado bruto dessa primeira missão antes de projetar data center em órbita? E se o gargalo da IA nos próximos cinco anos não for FLOPS, mas megawatt e dissipação, onde você gostaria que seu watt estivesse?



Comentários
0 comentáriosNenhum comentário ainda. Seja o primeiro a comentar.