O problema que ninguém resolveu na triagem de crise

Risco de suicídio é o tipo de problema que não aceita fila. Quando alguém manda mensagem para um serviço de apoio em plena madrugada, cada minuto conta e cada palavra pesa. O conselheiro do outro lado precisa decidir rápido se aquela pessoa só precisa conversar ou se tem um plano concreto para morrer nas próximas 48 horas. Errar para um lado gera pânico e internação desnecessária. Errar para o outro pode custar uma vida. É nesse intervalo estreito, sob pressão e com pouca informação, que a equipe do MIT tentou encaixar uma ferramenta de IA.

Quem já operou um serviço de atendimento sabe como isso é difícil na prática. Voluntários cansados, conversas longas, sinais confusos, linguagem ambígua. Alguém que escreve 'não aguento mais' pode estar desabafando ou se despedindo. O contexto muda tudo e o treinamento humano nem sempre dá conta do volume. Foi aí que Daniel Low e Satra Ghosh, do McGovern Institute for Brain Research do MIT, decidiram testar se a linguagem em si poderia virar um sensor de risco, algo mensurável, auditável e rápido o suficiente para ajudar na triagem.

O fato: o que o MIT construiu

O grupo construiu uma ferramenta de processamento de linguagem focada em estimar risco de suicídio a partir de conversas por texto. O trabalho foi publicado no Journal of Psychopathology and Clinical Science e foi feito em parceria com a Crisis Text Line, organização que oferece apoio gratuito, confidencial e 24 horas por texto. Para treinar e validar o sistema, os pesquisadores analisaram textos anonimizados de cerca de 16 mil conversas com conselheiros voluntários.

Essas conversas foram separadas em três níveis definidos pela própria Crisis Text Line: sem ideação suicida, ideação suicida sem risco iminente e risco iminente. O foco era o terceiro grupo, pessoas com plano, meios ou intenção de morrer em um intervalo curto. A pergunta central não era só prever quem está em risco, mas entender quais fatores de risco realmente pesam durante a crise, na hora em que a pessoa está digitando, e não semanas depois em um questionário epidemiológico.

Como funciona na visão de operador

Na arquitetura, a solução é surpreendentemente simples se comparada com a moda atual de LLMs gigantes. Primeiro a equipe montou um léxico de risco de suicídio. Usaram IA para gerar uma lista preliminar de palavras e expressões ligadas a fatores de risco já conhecidos na literatura, depois fizeram curadoria manual. O resultado final cobre 49 fatores de risco, com cerca de 60 termos ou frases para cada um. Estamos falando de quase 3 mil marcadores linguísticos no total.

Quando um texto chega, a ferramenta varre a conversa em busca desses marcadores e calcula um escore de risco. É uma abordagem de dicionário ponderado, não um raciocínio profundo. Em termos de operação, isso tem implicações claras. Latência baixíssima, porque é basicamente busca e contagem. Custo quase zero para rodar, porque não precisa de inferência em GPU cara por mensagem. E, principalmente, interpretabilidade. Dá para dizer qual fator disparou, se foi desesperança, isolamento, trauma, uso de substâncias ou menção a plano. Para um ambiente clínico, isso vale mais do que um número preto de um modelo caixa-preta.

Por que léxico e não um LLM gigante?

A escolha faz sentido para quem pensa em escala. Um LLM de fronteira poderia até captar nuances melhores, ironia, contexto, ambiguidade, mas traria custo alto por conversa, latência variável, dificuldade de auditoria e risco de alucinação em um tema onde erro é crítico. O léxico curado é frágil em linguagem informal, gíria e erro de digitação, mas é estável, explicável e fácil de versionar. Minha leitura é que o MIT optou por um sistema que um hospital ou uma ONG consegue realmente colocar em produção sem depender de API externa cara e sem mandar dado sensível para fora.

O que isso muda na prática

Quem ganha no curto prazo não é o paciente diretamente, é a operação de triagem. Se validado em campo, esse tipo de escore pode funcionar como um segundo par de olhos para o conselheiro. Priorizar fila, chamar supervisão mais cedo, padronizar a avaliação entre voluntários com níveis diferentes de experiência. Também ajuda a pesquisa a responder o que mais importa na crise aguda. Dos cerca de 50 fatores de risco que a literatura cita, quais realmente aparecem e pesam quando a pessoa está em risco iminente? Isso pode refinar protocolos de perguntas e treinamento.

  • Para serviços de crise: testar o escore como apoio, nunca como decisão automática, com revisão humana obrigatória.
  • Para clínicas e hospitais: avaliar uso em triagem inicial por chat, com trilhas claras de escalonamento e registro do motivo do alerta.
  • Para quem constrói IA em saúde: priorizar explicabilidade e custo por mil conversas, não só acurácia no paper.

A ação prática mais direta agora é para quem opera atendimento por texto. Comece a registrar linguagem de forma estruturada e anonimizada, com consentimento claro, e rode uma versão sombra dessa lógica de léxico sem interferir no atendimento. Compare o escore com a avaliação humana depois da conversa. Você vai descobrir em poucas semanas onde o modelo ajuda e onde ele gera ruído, sem colocar ninguém em risco.

A tensão: resolve ou só move o gargalo?

Aqui está a dúvida real. Detectar sinal na linguagem é útil, mas risco iminente não é estático. Uma pessoa pode sair de um escore médio para alto em dez mensagens. O léxico capta palavras, não capta silêncio, mudança de ritmo, desistência de responder. E tem o problema clássico de generalização. Gírias, diferenças culturais, português, espanhol, jovens, idosos. O que funciona em 16 mil conversas em inglês de um serviço específico pode degradar rápido fora desse contexto. Sem validação prospectiva, em tempo real e em populações diferentes, isso é um protótipo forte, não um produto clínico.

Tem também o custo invisível. Falso positivo em saúde mental não é só um alerta errado. É acionar protocolo de emergência, quebrar confiança, sobrecarregar uma equipe já no limite. Falso negativo é ainda pior. E quem responde juridicamente quando o escore erra? O modelo não assume responsabilidade, o humano assume. Se a ferramenta virar muleta, o conselheiro pode prestar menos atenção em vez de mais. Isso já aconteceu com outros sistemas de apoio à decisão. A tecnologia não elimina o gargalo humano, ela muda o gargalo de lugar, da detecção para a revisão e responsabilização.

Conclusão

No fim, o trabalho do MIT acerta ao tratar linguagem de crise como dado operacional e ao escolher uma arquitetura simples, barata e explicável. O próximo teste não é acadêmico, é operacional. Funciona em tempo real, em outro idioma, com outro público, sem gerar fadiga de alerta? Se a resposta for sim, vira infraestrutura de triagem. Se for não, continua como boa pesquisa.