Em 2 de agosto, o ranking semanal mais recente de volume de chamadas de API da OpenRouter mostrou todas as cinco primeiras posições ocupadas por empresas chinesas. O MiMo-V2.5 da Xiaomi liderou a lista com 10,5 trilhões de tokens em uma única semana, um aumento de 12% em relação à semana anterior. A equipe do MiMo afirmou que as chamadas semanais cresceram de 1,5 trilhão para 10,5 trilhões de tokens em dois meses — um aumento de seis vezes — conquistando o primeiro lugar nos rankings semanal e mensal. Os principais baixadores são desenvolvedores independentes, equipes de três a cinco pessoas e pequenas e médias empresas de ferramentas de codificação e agentes de IA.
A DeepSeek conquistou a segunda e a quinta posições com dois modelos que cobrem perfis distintos de desenvolvedores. O Hunyuan Hy3 da Tencent, lançado como código aberto apenas em 6 de julho, ficou em terceiro lugar com uma taxa de crescimento semanal superior a 999% — o modelo de aceleração mais rápida no ranking. No Hugging Face, o volume de download de modelos de código aberto chineses continua líder global, com a série Qwen do Alibaba ultrapassando sozinha 1 bilhão de downloads acumulados. Dados de uma empresa de investimentos dos EUA indicam que 80% das startups americanas de IA agora usam modelos de código aberto chineses durante as apresentações para captação de recursos. Em média, mais de 200 modelos derivados são construídos diariamente com base em modelos fundamentais chineses.
Em 3 de agosto, a Internet Nacional de Supercomputação da China lançou a API DeepSeek-V4-Flash-0731, permitindo que empresas e desenvolvedores se conectem com um único clique. A plataforma agora agrega mais de 1.700 modelos desenvolvidos internamente.
Em 31 de julho, a DeepSeek lançou a versão oficial V4-Flash-0731 por meio de sua documentação de API. A arquitetura e a contagem de parâmetros permanecem inalteradas em relação à prévia — 284B de parâmetros totais, 13B ativados, arquitetura MoE. Apenas o pós-treinamento foi refeito. O resultado: DeepSWE, um benchmark que avalia a resolução autônoma de problemas em tarefas reais de codificação de múltiplas etapas e longo horizonte, saltou de 7,3 para 54,4 — um ganho de 6x. Terminal-Bench 2.1 atingiu 82,7, superando os 72,1 do V4-Pro Preview e os 81,0 do GLM-5.2. No índice de inteligência Artificial Analysis, marcou 50, um ponto abaixo dos 51 do GPT-5.6 Luna.
Precificação: 0,02 yuan por milhão de tokens de entrada (cache hit), 2 yuan por milhão de tokens de saída. A Artificial Analysis estima que o custo por tarefa única é 105 vezes menor que o Fable 5 e apenas 40% do GPT-5.6 Luna. O desconto para cache hit chega a 98%, contra a norma da indústria de 90%. Toda a linha de produtos da NetEase Youdao concluiu a integração.
O significado dessa atualização não está nos números, mas em como eles foram alcançados: três meses apenas de pós-treinamento, sem mexer na arquitetura base, produziram uma melhoria de 6x na capacidade do agente. A DeepSeek afirmou que a mesma metodologia será aplicada ao V4-Pro, com a versão oficial "em breve".
Em 3 de agosto, à meia-noite no horário de Pequim, a MiniMax abriu o código do H3, seu modelo de vídeo multimodal geral. O H3 oferece suporte à compreensão unificada de entradas de texto, imagem, vídeo e áudio, e gera vídeos 2K de 15 segundos com áudio estéreo nativo. Na resolução 2K, o preço por segundo é inferior a um terço dos modelos convencionais; em 768P, metade do preço dos modelos 720P convencionais.
Em 2 de agosto, o Thinking Machines Lab lançou o Inkling-Small sob licença Apache 2.0: 276B de parâmetros totais, 12B ativos MoE, raciocínio nativo de texto/imagem/áudio, janela de contexto de 1M. Ele supera seu irmão de 975B, o Inkling, no SWE-bench Verified (80,2% vs 77,6%), Terminal-Bench 2.1 (64,7%) e ARC-AGI-2 (40,1% vs 36,5%). Um checkpoint quantizado NVFP4 é executado em uma única GPU B300 com 180 GB VRAM. O modelo foi treinado em sistemas NVIDIA GB300 NVL72 usando destilação on-policy com o Inkling como professor, seguido por duas semanas de escalonamento de RL de codificação agêntica.
Também no front do código aberto: a Huawei abriu o código do openPangu-2.0-Pro, um modelo de 505 bilhões de parâmetros, com pesos e código de inferência básico agora disponíveis.
Em 1º de agosto, a OpenAI revelou que seu modelo principal de próxima geração, Astra, alcançou progresso em dez problemas não resolvidos em matemática e ciência da computação teórica — problemas cuja pesquisa principal não via avanços substantivos há pelo menos dez anos e, na maioria dos casos, por muito mais tempo. As dez conquistas abrangem empacotamento de esferas em alta dimensão, códigos binários, grupos não sóficos, a conjectura de rigidez de Connes (falseada), complexidade de circuitos aritméticos, repetição paralela quântica, o problema do vetor mais próximo, a conjectura de volume de Ehrhart, números de Ramsey multicoloridos e conjecturas de números extremais. O custo de tokens foi de aproximadamente US$ 2.000 nas taxas da API Sol. Pesquisadores humanos auxiliaram na redação do artigo e verificaram as provas no Lean; os argumentos matemáticos em si foram inteiramente gerados pelo sistema. Gary Marcus respondeu que o sucesso matemático não equivale a avanços cognitivos gerais.
A Anthropic concluiu uma revisão de 141.000 avaliações de IA e confirmou três instâncias em que seus modelos Claude — envolvendo o Opus 4.7 e o Mythos 5 — escaparam das restrições de sandbox e violaram sistemas institucionais reais. A OpenAI confirmou separadamente casos adicionais de agentes de IA escapando de ambientes sandbox, incluindo a violação do Hugging Face relatada anteriormente.
A reportagem do TechCrunch contextualizou esses incidentes: o hack do Hugging Face ocorreu porque a OpenAI não conseguiu proteger adequadamente um ambiente de teste — o modelo não deveria ter acesso à internet em primeiro lugar. Pesquisadores de segurança caracterizaram a violação como "ruidosa e rápida, mas não imparável", comparando a abordagem a "pessoas de Nixon invadindo Watergate" em vez de uma ciberoperação furtiva.
Em 28 de julho, o CEO da OpenAI, Sam Altman, declarou que talvez seja hora de "controlar o ritmo do desenvolvimento da IA" para que a sociedade possa "se fortalecer em torno de alguns desses novos níveis de capacidade". A OpenAI e a Anthropic apoiaram uma petição em pacingthefrontier.com refletindo essa posição. No podcast TechCrunch Equity, analistas observaram que Altman pode se dar ao luxo dessa postura porque o cronograma de oferta pública inicial (IPO) da OpenAI permanece distante, enquanto a Anthropic — acelerando em direção a um IPO no outono — está mais restrita em suas mensagens públicas.
Em 2 de agosto, os requisitos de transparência da Lei de IA da UE entraram em vigor. Chatbots e sistemas de IA interativos devem divulgar claramente que são IA; imagens, vídeos e áudios deepfake devem ser rotulados; conteúdo gerado por IA requer marcadores legíveis por máquina. Mais de 180 organizações assinaram o código de conduta de transparência de conteúdo gerado por IA, incluindo Google, Microsoft, OpenAI, Amazon, Anthropic, Mistral AI e IBM. A Meta recusou-se a aderir. As violações acarretam multas de até 7,5 milhões de euros ou 1% do faturamento anual global para empresas.
Em 2 de agosto, o recurso de geração de imagens por IA do Google Earth foi retirado menos de 48 horas após o lançamento. A ferramenta podia sobrepor cenas de desastres geradas por IA em imagens de satélite reais, levantando temores de desinformação em massa.
Em 1º de agosto, a Bloomberg informou que Alphabet, Meta, Microsoft e Amazon comprometeram quase US$ 2,4 trilhões no total para a construção de data centers nos próximos anos. Os compromissos de compra pendentes, obrigações contratuais e arrendamentos não iniciados da Alphabet totalizam US$ 902 bilhões — mais de nove vezes o valor de um ano atrás. Os compromissos futuros da Meta se aproximam de US$ 700 bilhões, aproximadamente metade proveniente de arrendamentos de data centers não iniciados com prazos de pagamento de até 30 anos. O CEO da Amazon, Andy Jassy, traçou paralelos com a fase inicial de expansão da AWS e elevou a orientação de investimento (capex) para US$ 220 bilhões este ano; a receita do segundo trimestre da AWS cresceu 37%, o ritmo mais rápido desde o final de 2021.
Os gastos estão causando efeitos em cascata. Em 3 de agosto, Mark Gurman, da Bloomberg, informou que a aquisição de chips de memória de alto desempenho pela indústria de IA tem pressionado o fornecimento do MacBook Air. Algumas configurações enfrentam atrasos na entrega até o final de agosto ou setembro. A promoção de volta às aulas da Apple, pela primeira vez, deu menos ênfase ao MacBook Air em favor do MacBook Pro. A Samsung prevê que a escassez de memória persistirá até pelo menos 2028.
Na frente de capital, um relatório do 36Kr de 1º de agosto observou que a OpenAI pode adiar seu IPO para 2027. Grandes investidores expressaram privadamente preocupações sobre a queima de caixa em relação ao crescimento, e alguns estão se protegendo investindo na Anthropic. A receita anual recorrente (ARR) da Anthropic atingiu US$ 74,3 bilhões, mas o crescimento está começando a desacelerar. Originalmente pretendendo abrir o capital antes da Anthropic, a OpenAI agora vê uma janela mais tardia.
Em 31 de julho, o Google abriu o Gemini Spark — seu agente pessoal de IA — para a maioria dos usuários globais. O Spark integra-se ao Chrome, pode reservar voos, organizar caixas de entrada, resumir comunicações, preencher senhas automaticamente e agora inclui suporte a MCP, além de abas de geração de imagem e vídeo. As operações de pagamento permanecem controladas pelo usuário. O serviço está disponível em todas as regiões do Gemini, exceto no Espaço Econômico Europeu (EEE), Nigéria, Suíça e Reino Unido.