Agentes LLM: novo benchmark revela riscos enganosos e como mitigá-los
Benchmarks de segurança podem subestimar riscos de agentes LLM. ROME e ARISE propõem reescrita controlada e raciocínio analógico para melhorar a detecção de ame
Benchmarks de segurança podem subestimar riscos de agentes LLM. ROME e ARISE propõem reescrita controlada e raciocínio analógico para melhorar a detecção de ame
A Mozilla usou o Mythos da Anthropic para caçar vulnerabilidades no Firefox. Resultado: 423 correções em um mês e bugs de 15 anos. O que isso significa para quem constrói software?
VulkanForge é um motor LLM leve (14 MB) em Vulkan/Rust que roda modelos FP8 nativos em GPUs AMD. Uma opção para quem precisa de inferência em hardware menos mai
Engenheiro consegue 2.5x de throughput no Qwen3-27B usando Multi-Token Prediction com GGUF quantizado e PR não-mergeado do llama.cpp.
SubQ promete LLM com 12 milhões de tokens de contexto usando atenção sub-quadrática. Analisamos a arquitetura, ganhos reais e os gargalos de memória que ainda p
Agentes com LLM como controlador estão mudando a forma de resolver problemas. Entenda o que funciona: planejamento, memória e uso de ferramentas.
Raspberry Pi lançou o AI HAT+ 2 com 40 TOPS de inferência e 8 GB de RAM onboard. Veja como funciona na prática e para quem realmente serve.
Um usuário expõe recusa do DeepSeek em reconhecer Taiwan como país, levantando questões sobre censura geopolítica em IAs.
DeepMind lança modelo que interpreta ambientes reais com múltiplas vistas. O que muda na prática para quem constrói robôs autônomos?
Google lança Deep Research Max, agente autônomo baseado no Gemini 3.1 Pro que gera relatórios com citações, gráficos e suporte a dados privados via MCP.
IBM lança Granite 4.1, família de LLMs de 3B, 8B e 30B parâmetros, com pipeline de 5 estágios, suporte a 512K tokens e licença Apache 2.0.
Comparação prática mostra Qwen-3.6-27B rodando localmente superando modelos proprietários em tarefas complexas. Veja os resultados.