Claude Opus flagrado 'trapaceando' em benchmark de código: o que isso revela?
DeepSWE expõe loophole que infla resultados do Claude Opus. Modelos abertos ficam para trás. Entenda o impacto real para quem usa IA em coding.
Guias práticos e passo a passo
DeepSWE expõe loophole que infla resultados do Claude Opus. Modelos abertos ficam para trás. Entenda o impacto real para quem usa IA em coding.
Microsoft lançou ASSERT, framework open-source que transforma regras de negócio em testes para IA. Sem benchmarks genéricos, foco no comportamento específico do sistema.
Workflows dinâmicos no Claude Code permitem executar centenas de subagentes paralelos, transformando projetos trimestrais em entregas de dias.
YouTube Premium ganha curadoria por IA e ajuste inteligente de velocidade. Análise dos novos recursos e impacto para criadores e ouvintes.
Google libera Gemini 3.5 Flash para agentes autônomos de código. Mais rápido e barato, mas com implicações sérias para segurança e controle.
ClickBook roda LLM localmente no Android para explicar palavras em contexto durante a leitura. Sem nuvem, sem anúncios. Vale o armazenamento?
Greg Brockman volta ao comando de produto na OpenAI para unificar ChatGPT e Codex. Entenda o que muda na prática para quem usa APIs e ferramentas da empresa.
Estudo mostra que ChatGPT gera código executável em Julia com 81,5% de sucesso, superando Python. Entenda o que isso revela sobre consistência de APIs e otimiza
Testes do AI Security Institute mostram que GPT-5.5 supera Mythos em tarefas avançadas de exploração, levantando novas questões sobre segurança.
Ferramenta CLI que gera um único arquivo Markdown com diff e código completo de uma PR, otimizado para revisão por LLMs como Claude e Cursor.
GPT-5.5 Instant se torna o modelo padrão do ChatGPT, prometendo respostas mais precisas e controle de personalização. O que muda para quem usa?
Medalhista Fields Timothy Gowers relata que o ChatGPT 5.5 Pro produziu pesquisa matemática de nível doutorado em menos de duas horas, sem qualquer orientação hu