Por que o DeepSeek foi tão cruel com seu carro-chefe quando foi retirado das prateleiras em 32 dias?

📅 2026-09-11

Resumo:

Desde o lançamento oficial até o momento em que foi substituído pelo Flash, o DeepSeek deixou apenas 32 dias para a versão oficial do V4 Pro.

Em 10 de setembro, DeepSeek lançou o Flash V4.1 e anunciou que a partir das 12h do dia 14 de setembro, horário de Pequim, todas as solicitações enviadas ao V4 Pro na API oficial serão assumidas pelo Flash e cobradas a um preço mais baixo do Flash. Este acordo continuará até o lançamento da V4.1 Pro.

O V4 Pro estará disponível como versão prévia a partir de 24 de abril e será lançado oficialmente em 13 de agosto.

Menos de um mês após o lançamento da versão oficial, a empresa já decidiu seu “horário de saída”.

O que vale mais a pena perguntar é: por que o DeepSeek não reduziu o preço do Pro e o manteve, ou simplesmente esperou até que a próxima geração do Pro estivesse pronta e então deixou os dois assumirem o controle normalmente?

Minha opinião é que o V4 Pro ainda tem pontos fortes, mas não vale mais a pena o investimento contínuo da DeepSeek apenas em poder computacional.

Assumir o Flash V4.1, que torna a arquitetura mais eficiente e superou diversos testes de agentes inteligentes, pode não apenas reduzir as despesas operacionais da empresa, mas também diminuir as contas do usuário.

01 Flash alcançou a direção que o Pro focou no mês passado

Há um mês, foi lançada a versão oficial do V4 Pro. Sua direção principal é muito clara: agentes inteligentes, programação de código e invocação de ferramentas. DeepSeek abriu diferentes intensidades de inferência para ele naquela época, e também adaptou especialmente o Codex, esperando que ele pudesse assumir um trabalho de processo mais complexo e mais longo.

Mas algo deu errado no dia em que a versão oficial foi colocada no ar: a notificação do site oficial e o anúncio da plataforma aberta foram removidos por um tempo e restaurados naquela noite. Durante este período, a entrada de chamadas da API foi sempre mantida. De acordo com relatos da mídia, alguns desenvolvedores também relataram que o tempo de pensamento do modelo era muito curto, tarefas longas terminavam prematuramente e os resultados podem ser muito diferentes se a mesma pergunta for executada algumas horas depois.

O subsequente aumento de preços elevou o padrão para seu cumprimento. A partir de 17 de agosto, o preço de produção do Pro durante os horários de pico aumentou de 6 yuans para 27 yuans por milhão de tokens, o que é 4,5 vezes o preço original.

Para desenvolvedores que já sentem que seu desempenho está instável, é difícil dizer que esse gasto extra foi trocado por melhorias correspondentes.

Agora, o recém-lançado Flash alcançou essas direções principais.

Dados oficiais mostram que no teste de engenharia de software DeepSWE v1.1 e no teste de automação de escritório AutomationBench, o Flash obteve 74,2 pontos e 54,8 pontos respectivamente, significativamente à frente dos 62,7 pontos e 43,2 pontos do V4Pro.

O que o novo modelo ganha é justamente a tarefa que o Pro promoveu no mês passado.

Pro não perde sempre. No subconjunto HLE de texto simples que não chama ferramentas, ainda lidera o Flash com 42,7 pontos e 39,1 pontos; mas no teste HLE completo que permite o uso de ferramentas, o Flash obteve 63,9 pontos, 60 pontos a mais que o Pro. Além disso, na comparação de modelos básicos antes do pós-treinamento, o Pro ainda mantém a liderança em perguntas e respostas de conhecimento verificado pelo SimpleQA e testes de texto longo LongBench-V2.

Portanto, a “superação abrangente” no anúncio oficial do DeepSeek não pode ser entendida simplesmente como uma vitória em todas as subcategorias.

Ainda há coisas que o Pro faz bem e ainda é valioso para usuários que precisam dessas habilidades específicas. O que realmente está abalado é o posicionamento comercial original do produto carro-chefe.

No passado, desenvolvedores e empresas entendiam facilmente a divisão dos dois modelos: o Flash era escolhido se o orçamento fosse limitado e tarefas complexas e longas eram deixadas para o Pro, mais caro. Agora que o Flash ultrapassou muitos testes convencionais de smartphones, é difícil para o Pro convencer o mercado com o rótulo de “mais caro, mas geralmente mais forte”.

Uma liderança ampla é suficiente para apoiar um carro-chefe caro para o público em geral; mas se dominar apenas algumas tarefas segmentadas, a empresa deve recalcular: quantas pessoas não podem viver sem estas capacidades, quanto estão dispostas a pagar por isso e se vale a pena alocar clusters de poder computacional para o apoiar.

As informações públicas ainda não fornecem contas específicas de custos e detalhamento de usuários. Mas, a julgar pelas ações de produto da DeepSeek, ela obviamente desistiu da ideia de manter um equipamento independente e exclusivo para o antigo Pro.

02 Reduza o preço do Pro e economize no custo de execução dele

Se o problema é apenas que o Flash é barato, o Pro pode seguir naturalmente a promoção de redução de preço. A dificuldade é que as reduções de preços só podem alterar os números da fatura, mas não o consumo físico subjacente ao modelo.

De acordo com os dados divulgados pelo cartão modelo oficial, o número de parâmetros ativados por cada Token do V4 Pro chega a 49 bilhões. V4.1Flash separa o processamento de entrada da geração de respostas, ativando apenas 8 bilhões e 16 bilhões de parâmetros, respectivamente. Embora a relação dos parâmetros não possa ser diretamente equiparada à redução de custos, a escala de cálculos necessária para cada inferência direta entre os dois é completamente diferente na mesma ordem de grandeza.

A nova arquitetura também reduz significativamente a sobrecarga de armazenamento de tarefas de contexto longas. Comparado com o Flash V4, o cache KV global ocupado pelo Flash V4.1 foi reduzido para cerca de um quarto, e o espaço SSD ocupado pelo cache KV persistente foi reduzido para cerca de um oitavo. A execução do agente precisa ler repetidamente o código de contexto, documentos de referência e dados retornados por ferramentas externas. O cache é usado especialmente para armazenar o estado histórico calculado pelo modelo grande.

Depois que o ciclo da tarefa for alongado e a quantidade de simultaneidade aumentar, a memória de armazenamento atingirá o nível mínimo rapidamente. O que o Flash precisa resolver não é apenas responder corretamente a uma pergunta, mas também a redução de recursos quando enormes tarefas simultâneas são executadas ao mesmo tempo.

A DeepSeek mencionou diretamente no anúncio que uma maior eficiência arquitetônica permite à empresa transportar mais simultaneidade a um custo menor, por isso é lógico reduzir o preço.

Em 11 de setembro, calculado por milhão de tokens em Gushi, o preço de entrada do cache perdido do V4 Pro era de 4,5 yuans e o preço de saída era de 13,5 yuans; os preços correspondentes do Flash V4.1 são de apenas 1 yuan e 4 yuan (os preços de pico de ambos os modelos são o dobro do Gushi). Com a implementação da mudança, os custos da interface Pro originalmente cara serão reduzidos diretamente ao nível do Flash.

Embora a diferença de preços entre os dois não seja equivalente ao custo real do material do DeepSeek, a estratégia é muito clara: usar uma nova arquitetura altamente eficiente para aceitar totalmente as solicitações de interfaces antigas e, em seguida, transferir os custos de hardware economizados para o mercado.

Se você reduzir o preço do Pro, a plataforma ainda terá que arcar sozinha com os pesados ​​custos de inferência e manutenção; mudar para Flash terá a oportunidade de reduzir as contas dos usuários e a carga do servidor ao mesmo tempo.

Depois que a grande modelo terminou o treinamento, o poço sem fundo do dinheiro não foi fechado. Cada vez que atende uma chamada, ocupa recursos computacionais em tempo real, e a operação e manutenção não podem parar por um momento.

"Só gastei muito dinheiro para treinar" não pode ser uma medalha de ouro livre de morte para manter o antigo profissional. Os custos irrecuperáveis ​​tornaram-se uma realidade e a manutenção do modelo antigo exige um consumo contínuo de dinheiro real.

Mesmo que o antigo Pro possa continuar a ganhar dinheiro, é obviamente mais econômico usar o mesmo poder de computação de hardware para executar um novo modelo com maior eficiência.

03 A entrega de 160 mil chips Ascend pode levar mais de um ano

Combinando com as ações-chave recentes da DeepSeek, podemos compreender melhor o senso de urgência por trás dessa transferência de recursos.

Em agosto deste ano, a DeepSeek lançou preços flutuantes de pico e vale para orientar a execução de tarefas de processamento em lote não em tempo real durante períodos de inatividade.

Isso é essencialmente para extrair todo o poder computacional existente do agendamento interno quando o hardware externo é limitado.

A aquisição de hardware também está a progredir, mas a água vinda de longe não consegue saciar a sede de proximidade. A Bloomberg informou em 4 de setembro, citando pessoas familiarizadas com o assunto, que a DeepSeek planeja implantar pelo menos 160.000 chips Huawei Ascend 950DT em data centers na Mongólia Interior, que atualmente são planejados principalmente para inferência de modelos, e não para treinamento. No entanto, o relatório também mencionou que a capacidade de produção da Huawei precisa cuidar de vários clientes e, devido aos gargalos da cadeia de abastecimento, todo o ciclo de entrega de pedidos pode levar mais de um ano.

O financiamento do DeepSeek também está acelerando. A Reuters informou em 9 de setembro, citando pessoas familiarizadas com o assunto, que a DeepSeek contratou a CITIC Securities para promover o processo de IPO do Conselho de Inovação Científica e Tecnológica. A angariação de fundos destina-se principalmente a preencher a lacuna de financiamento para infraestruturas informáticas, investigação e desenvolvimento de modelos de ponta e recrutamento de talentos de topo. No entanto, o cronograma de listagem, o valor da arrecadação de fundos e a meta de avaliação ainda não foram finalizados, e nem a DeepSeek nem a CITIC Securities comentaram sobre isso.

Juntando essas peças do quebra-cabeça, o que surge é uma empresa iniciante que deseja uma expansão rápida, mas está sempre limitada pelos limites dos recursos físicos.

Comprar hardware de fora e buscar financiamento para IPO resolve o problema do aumento de recursos no longo prazo; ao mesmo tempo em que se busca eficiência na arquitetura de algoritmos, é permitir que o poder de computação existente suporte um pico maior de chamadas.

O primeiro requer um longo ciclo de entrega e operação de capital, enquanto o último pode libertar imediatamente capacidade em negócios existentes, desde que a tecnologia amadureça.

Sob tais restrições de recursos, é viável continuar a manter o antigo carro-chefe, mas a relação preço/desempenho é extremamente baixa.

Quando modelos mais leves e baratos já são capazes de realizar a maioria das tarefas básicas, as poucas vantagens deixadas pelo antigo Pro são realmente difíceis de convencer a equipe a continuar a alocar clusters preciosos para apoiá-lo.

O fundador Liang Wenfeng já havia deixado essa compensação clara ao se comunicar com investidores anteriormente. Ele coloca claramente a exploração AGI a longo prazo acima da maximização do lucro a curto prazo, acredita que o modelo de código aberto e a comercialização são completamente auto-consistentes e afirma sem rodeios que o poder da computação é o principal gargalo da actual expansão dos negócios.

Olhando para esta "mudança de modelo flash" desta perspectiva, prefiro uma explicação estratégica: o objetivo da DeepSeek é levar a escala dos serviços existentes ao extremo o mais rápido possível, ao mesmo tempo que promove a próxima geração de exploração de fronteiras.

Agora que as novas tecnologias reestruturaram completamente as curvas de custo e desempenho do poder de computação, a matriz de produtos deve ser reorganizada vigorosamente. Não há necessidade de forçar um longo período de proteção premium para os carros-chefe da geração anterior.

04 DeepSeek não está esperando pelo próximo Pro

A característica mais atraente desta substituição é a sua determinação: o DeepSeek nem esperou que o V4.1 Pro tomasse forma.

De acordo com a prática do software comercial convencional, ele pode reter completamente o canal independente do antigo Pro para apaziguar os clientes corporativos que dependem do modelo antigo e, ao mesmo tempo, lançar o Flash como um substituto rebaixado; espere até que a próxima geração Pro esteja totalmente madura e, em seguida, conclua a iteração passo a passo, passo a passo, para fazer com que a linha de produtos pareça suave e organizada.

Mas DeepSeek anunciou outro acordo: o Flash antigo será assumido pelo Flash V4.1, e o tráfego da API do antigo Pro também será fundido à força no Flash após 14 de setembro. Embora o nome da interface original seja mantido e o faturamento seja descontado diretamente, o núcleo do modelo subjacente foi completamente substituído.

O funcionário ainda mencionou o futuro V4.1 Pro, mas não esperou por isso e continuou mantendo a posição do antigo Pro.

A DeepSeek está disposta a permitir que sua nova tecnologia elimine primeiro seu antigo carro-chefe. O montante do investimento em investigação e desenvolvimento e o facto de estar online há apenas um mês não se tornaram motivo para protegê-lo.

No entanto, só porque o nome da interface permanece inalterado não significa que os desenvolvedores possam sentar e relaxar.

Muitas empresas já ajustaram a estrutura do Prompt, as configurações do sistema e os links de chamada de ferramentas de várias etapas no antigo Pro e provavelmente precisarão executar novamente os testes de regressão no novo modelo.

Se o desempenho de certas tarefas que dependem fortemente de texto longo Pro ou raciocínio de texto simples diminuir, os apelos da comunidade e dos clientes corporativos para manter o canal antigo também terão racionalidade prática.

Isso representa um problema para a próxima geração do Pro que ainda não foi revelado: se ele quiser fornecer serviços independentes a um preço mais alto novamente, deverá apresentar recursos que são difíceis de obter com o Flash e que valem o pagamento extra para os usuários, e não apenas melhores que o antigo Pro.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários