DeepSeek V4: 1 trilhão de parâmetros, US$ 5 milhões de custo. O argumento 'só grandes labs conseguem' morreu
A narrativa dominante no setor de IA até 2024 era: modelos de fronteira custam bilhões de dólares para treinar, então apenas OpenAI, Google e Anthropic conseguem jogar nesse nível.
O DeepSeek V4 é mais um prego no caixão dessa narrativa.
Os números que importam
- 1 trilhão de parâmetros — escala comparável aos maiores modelos existentes
- US$ 5,2 milhões de custo de treinamento — fração do que os labs americanos gastam
- Apache 2.0 — você pode usar comercialmente, modificar, hospedar onde quiser
- Benchmarks: top-tier em coding (HumanEval, SWE-Bench), raciocínio longo e matemática
Contexto: o GPT-4 original custou estimados US$ 100 milhões para treinar. O Claude 3 Opus, na faixa similar. O DeepSeek V4 chegou ao mesmo patamar de qualidade por ~5% desse custo.
Como isso é possível
Mixture of Experts (MoE) arquitetura, treinamento eficiente em hardware menos potente (H800 em vez de H100/H200), e otimizações agressivas no pipeline de dados. A equipe DeepSeek publicou os detalhes técnicos — não é magia, é engenharia cuidadosa.
O que muda na prática
Duas coisas:
Para desenvolvedores: você pode rodar um modelo de fronteira no seu próprio servidor, sem depender de API de terceiro, sem custo por token, sem política de uso que muda a cada trimestre.
Para o setor: o argumento de que compute = moat está enfraquecendo. A vantagem competitiva está migrando para dados proprietários, produtos e distribuição — não para quem tem mais GPU.
O próximo DeepSeek provavelmente vai custar US$ 2 milhões. E vai ser melhor.