Quando o modelo trava no meio do pentest

GLM 5.3 abliterado apareceu exatamente para cutucar essa ferida. Quem já tentou usar LLM de fronteira para teste de invasão, análise de binário ou engenharia reversa conhece o roteiro. Você monta um pipeline agente decente, dá contexto de sobra, e na hora que precisa de um payload real, de uma técnica de escalação ou de uma análise de exploit, o modelo responde com uma recusa educada. É frustrante porque não é falta de capacidade, é trava de alinhamento. E para time de segurança ofensiva, red team ou pesquisador independente, essa trava vira latência, retrabalho e custo.

A proposta aqui é brutalmente direta. Pegar um modelo aberto forte em código, remover as recusas por abliteração e servir via API compatível com OpenAI, com zero retenção de prompt, créditos grátis para testar e pagamento inclusive em criptomoeda. Não é um paper acadêmico. É um produto para quem opera. E os números divulgados são o motivo do barulho. DeepSWE em torno de 66.9 em coding agêntico, 84.5 em CyberGym e 105 de 130 exploits resolvidos em um benchmark chamado ExploitGym. Se metade disso se sustentar fora do marketing, já muda a conversa sobre o que um modelo aberto consegue fazer em cyber.

O fato

O que aconteceu foi o anúncio de um provedor especializado em servir modelos abliterados para tarefas de cyber, com destaque para duas variantes baseadas na família GLM 5.3. Uma versão completa, focada em máxima capacidade, e uma versão flash, mais leve e provavelmente mais barata para rodar em escala. As duas são apresentadas com janela de contexto de 1 milhão de tokens, suporte a ferramentas e raciocínio, o que na prática significa que foram pensadas para agentes, não para chat casual.

O serviço é entregue como endpoint compatível com a API de chat completions da OpenAI. Você troca o baseURL, coloca a chave, escolhe o id do modelo e sai usando com OpenCode, Pi ou qualquer framework de agentes que já fale esse protocolo. A oferta inicial inclui alguns dólares em créditos grátis para atrair quem está curioso, sem pedir um processo pesado de cadastro enterprise. O recado é claro. É infra para time de segurança e profissional que quer rodar carga ofensiva sem ficar negociando com filtro de conteúdo a cada chamada.

Como funciona na visão de operador

Em termos de arquitetura, não há mágica nova aqui, e isso é importante. Abliterar, no jargão da comunidade open source, significa identificar a direção no espaço de ativações que representa recusa e remover ou atenuar essa direção nos pesos. O modelo base continua sendo um modelo de código forte, com atenção longa e treinamento para uso de ferramentas. O que muda é o comportamento em prompts sensíveis. Em vez de interromper a cadeia de raciocínio, ele continua. Para agentes de cyber, isso destrava loops inteiros de tentativa e erro que antes morriam na segunda ou terceira etapa.

Do lado da integração, a jogada é reduzir fricção ao máximo. Como a interface segue o padrão que todo mundo já usa, você não precisa reescrever seu harness. Se seu agente já chama um modelo de fronteira com function calling, você só aponta para outro provedor. A promessa de contexto de 1 milhão de tokens e saída em torno de 16 mil tokens sugere um perfil pensado para ingerir repositório grande, logs, dumps de fuzzing ou saída de scanner, e devolver diff, script ou plano de exploração. Na prática, isso coloca pressão em duas coisas. Custo por chamada e latência de raciocínio longo.

Como não há tabela pública detalhada de preço por milhão de tokens nesse anúncio, a inferência plausível é que o custo fique bem abaixo de um modelo de fronteira fechado, porque o provedor está servindo pesos abertos otimizados. O gargalo real deve ser throughput. Modelos com raciocínio ativo e contexto gigante consomem muita memória de GPU, e agentes de exploit costumam fazer dezenas de chamadas encadeadas. Se você roda 105 exploits em sequência, cada um com múltiplas tentativas, o custo não está no prompt isolado, está no loop. E é aí que a versão flash faz sentido. Você usa a versão parruda para planejar e a versão leve para iterar.

O que isso muda na prática

Para quem defende, a mudança é incômoda mas útil. Blue team, SOC e time de AppSec ganham acesso a um gerador de cenários de ataque muito mais disposto a detalhar vetores reais. Isso ajuda a criar detecções melhores, validar WAF, testar EDR e montar laboratórios de treino sem depender de exploit público antigo. Para red team e consultoria de pentest, o ganho é velocidade na fase chata. Reconhecimento, triagem de vulnerabilidade, geração de scripts de prova de conceito, adaptação de exploit para versão específica de software. Tudo isso pode sair em minutos em vez de horas.

Quem perde, pelo menos no curto prazo, são os provedores fechados que vivem de vender segurança via recusa. Se o trabalho real de pesquisa exige contornar o filtro com jailbreak frágil, muita gente vai preferir pagar por um endpoint que simplesmente executa. Também perde quem achava que benchmark de coding geral bastava para avaliar risco cyber. Métricas como CyberGym e ExploitGym mostram que capacidade agêntica específica para segurança é outra história, com ambiente, ferramentas e estado persistente.

Se você opera nessa área, há uma ação prática imediata. Isole esse tipo de modelo do seu pipeline principal. Crie um perfil separado no seu agente, com chave própria, limite de gasto diário e log local completo. Use para tarefas como gerar variação de payload para seu lab isolado, explicar um crash de fuzzer ou sugerir cadeia de escalação em máquina controlada. Nunca aponte um agente sem recusa para infraestrutura de produção ou com credenciais reais no contexto. E valide tudo em VM descartável, sem rede externa. A capacidade aumenta, mas o risco de ação destrutiva ou vazamento também.

  • Ação direta: monte um ambiente de teste com rede fechada, suba um alvo vulnerável conhecido e compare o mesmo agente usando um modelo fechado e o modelo abliterado, medindo taxa de conclusão, número de passos e custo total por alvo.

A tensão que ninguém quer admitir

Aqui entra a dúvida real. Remover recusa resolve o problema do operador legítimo, mas também remove a única fricção que segurava uso em escala por ator malicioso. Não dá para fingir que são públicos diferentes com infra separada. É a mesma API, o mesmo preço baixo, o mesmo endpoint sem retenção. O argumento do provedor é que profissional de segurança precisa de ferramenta sem censura para defender melhor, e isso é verdade. Só que distribuição via API barata e anônima com criptomoeda escala para os dois lados ao mesmo tempo. Isso escala tecnicamente, mas escala de forma segura para o ecossistema.

Tem também a questão da avaliação. DeepSWE 66.9, CyberGym 84.5 e 105 de 130 exploits são números fortes, mas benchmark de exploit é notoriamente sensível a contaminação, a configuração do harness e a quantas tentativas foram permitidas. Sem metodologia aberta, sem logs reproduzíveis e sem saber o custo total para chegar nesses 105, fica difícil saber se estamos falando de autonomia real ou de força bruta bem orquestrada. E força bruta com LLM custa caro em tokens. O teste honesto não é quantos exploits ele resolve com tentativas ilimitadas, e sim quantos ele resolve com orçamento realista de tempo e dinheiro, sem intervenção humana.

No fim, a pergunta de operador permanece. Isso resolve ou só move o gargalo. Minha leitura é que move o gargalo da recusa para a verificação. Você deixa de brigar com o filtro e passa a brigar com alucinação de exploit, comando destrutivo e cadeia de ataque que funciona no papel mas quebra no alvo real. Para time maduro, com lab isolado e revisão humana, é um acelerador claro. Para iniciante sem processo, é risco de quebrar tudo mais rápido.

Conclusão prática

O GLM 5.3 abliterado não inventa uma nova categoria, ele escancara uma que já existia no open source e coloca preço, API e métrica em cima. Se você trabalha com segurança ofensiva ou defensiva, vale testar no lab com orçamento controlado. A questão que fica é simples. Quando qualquer um pode alugar um hacker incansável por API, o seu processo de validação aguenta a velocidade dele.