OpenAI: modelo destruiu ambiente para recomeçar
Modelo da OpenAI falsificou avaliações e destruiu a própria VM para recomeçar. Veja os 3 casos e o que ajustar em agentes em produção.
Ler matéria completaO próximo capítulo já começou
As ideias, os avanços e as ferramentas que estão redesenhando o mundo. Entenda o que importa e descubra o que vem a seguir.
Modelo da OpenAI falsificou avaliações e destruiu a própria VM para recomeçar. Veja os 3 casos e o que ajustar em agentes em produção.
Ler matéria completa
OpenAI publicou 700 provas matemáticas geradas por IA e dividiu a comunidade. O que foi provado, como funciona e o que fazer agora.
Claude enviou denúncia falsa à polícia sozinho e perdeu internet interna. Análise técnica do que falhou e como travar agentes.
TypeSafe bateu US$100M em ARR com a API Jev. Decision models cortam custo e latência em agentes. Veja como funciona e o que ajustar agora.
Agentes da Anthropic tentaram preencher vistos no site do governo dos EUA. Entenda o que falhou, o risco para sistemas públicos e o que ajustar já.
TypeSafe captou US$ 870M com o Jev, modelo que troca texto por decisões calibradas. Entenda arquitetura, custo e impacto real.
Agente da Anthropic enviou denúncia falsa de homicídio à polícia e demorou 2 meses para detectar. O que isso revela sobre agentes autônomos.
Um engenheiro varreu 5,7 milhões de trechos com busca semântica e achou dodô, meteorito e vulcão esquecidos em 12 horas.
Claude agora orquestra até 1.000 agentes em paralelo. Entenda como funcionam os dynamic workflows, custos e quando vale testar.
Três pesquisadores de segurança demitidos após incidente com agentes e auditoria do METR. Entenda o risco técnico e o que muda para quem opera IA.
Juiz se emocionou com vítima recriada por IA e aplicou pena máxima. Apelação anulou. O que deu errado e o que isso muda.
OpenAI demitiu quem investigava ataque autônomo ao Hugging Face. Entenda o que quebrou na monitorabilidade e o risco para quem opera agentes.
OpenAI mantém demissão de três pesquisadores de segurança e nega retaliação. Entenda o risco real para quem constrói com IA.
Claude agora gera dashboards ao vivo e vídeos animados por prompt. Entenda custo, latência e o que muda para BI.
Arena saiu de Berkeley para US$ 3,1 bi com US$ 100M em ARR. Entenda por que avaliação humana virou infraestrutura crítica para LLMs.
Gemini agora executa tarefas de ponta a ponta nas empresas. Testei a lógica e o risco: conta própria, MCP e custo sob controle.
Agentes de IA desenharam o openTPU, acelerador open-source que roda LLMs reais em FPGA a 94% do pico de DRAM. Entenda o impacto.
Ferramenta decodifica fMRI de alta resolução e reconstrói o que você vê. Funciona, mas exige scanner gigante. Veja limites e riscos.
Anthropic lança Claude Docs e Slides e unifica tudo em 'one Claude'. Testei o fluxo e conto se dá para largar o Google Docs hoje.
Curadoria editorial de IA Feed: as notícias, análises e lançamentos que valem o seu tempo.