← voltar ao feed

DeepSeek V4: 1 trilhão de parâmetros, US$ 5 milhões de custo. O argumento 'só grandes labs conseguem' morreu

A narrativa dominante no setor de IA até 2024 era: modelos de fronteira custam bilhões de dólares para treinar, então apenas OpenAI, Google e Anthropic conseguem jogar nesse nível.

O DeepSeek V4 é mais um prego no caixão dessa narrativa.

Os números que importam

  • 1 trilhão de parâmetros — escala comparável aos maiores modelos existentes
  • US$ 5,2 milhões de custo de treinamento — fração do que os labs americanos gastam
  • Apache 2.0 — você pode usar comercialmente, modificar, hospedar onde quiser
  • Benchmarks: top-tier em coding (HumanEval, SWE-Bench), raciocínio longo e matemática

Contexto: o GPT-4 original custou estimados US$ 100 milhões para treinar. O Claude 3 Opus, na faixa similar. O DeepSeek V4 chegou ao mesmo patamar de qualidade por ~5% desse custo.

Como isso é possível

Mixture of Experts (MoE) arquitetura, treinamento eficiente em hardware menos potente (H800 em vez de H100/H200), e otimizações agressivas no pipeline de dados. A equipe DeepSeek publicou os detalhes técnicos — não é magia, é engenharia cuidadosa.

O que muda na prática

Duas coisas:

Para desenvolvedores: você pode rodar um modelo de fronteira no seu próprio servidor, sem depender de API de terceiro, sem custo por token, sem política de uso que muda a cada trimestre.

Para o setor: o argumento de que compute = moat está enfraquecendo. A vantagem competitiva está migrando para dados proprietários, produtos e distribuição — não para quem tem mais GPU.

O próximo DeepSeek provavelmente vai custar US$ 2 milhões. E vai ser melhor.