Os primeiros pesos multimodais do DeepSeek-V4 abriram e “abriram os olhos” para alcançar o Opus-4.8

📅 2026-09-01

Resumo:

Depois de fortalecer continuamente os recursos de raciocínio, código e agente, o DeepSeek finalmente adicionou informações visuais à V4. Na manhã de 31 de agosto, DeepSeek estava em Hugging Face abriu os pesos do modelo DeepSeek-V4-Flash-Vision-Exp, e os desenvolvedores podem baixar diretamente os pesos do modelo e implantá-los eles próprios. Além dos arquivos de modelo, o warehouse oficial também inclui implementações de inferência de referência de componentes como codificador visual e Aligner, e cobre DFlash Atenção, MoE, Hyper-Connections e DSpark e outras partes.


Há apenas 10 dias, a DeepSeek anunciou oficialmente o modelo V4-Flash-Vision-Exp, com uma escala de aproximadamente 305 bilhões de parâmetros. É fácil dizer pelo “Exp” no nome que este é o primeiro modelo multimodal experimental da série V4. Ele é construído na arquitetura V4-Flash. Ao adicionar um módulo visual e treinamento contínuo, o modelo ganha capacidade de processar imagens.

Em termos de tarefas de texto simples, o funcionário disse que V4-Flash-Vision-Exp e V4-Flash estão geralmente em um nível semelhante. A principal diferença é que o novo modelo pode reconhecer o conteúdo das fotos, ler textos em capturas de tela, analisar gráficos e também usar imagens como parte do fluxo de trabalho do Agente, em vez de depender apenas de descrições de texto.

Os casos demonstrados pelo DeepSeek incluem fazer PPT de acordo com os requisitos, ler e modificar páginas da web e gerar páginas front-end com efeitos dinâmicos.


O que essas tarefas têm em comum não é o reconhecimento de imagem no sentido tradicional, mas o fato de que o modelo precisa primeiro entender o conteúdo visual e depois combinar código, raciocínio e chamadas de ferramentas para concluir as operações subsequentes. A julgar pelo teste de benchmark publicado pela DeepSeek, após adicionar recursos visuais, o V4 já está próximo do grande modelo multimodal antrópico Claude Opus 4.8 que escolheu para comparação em algumas tarefas de agente multimodal.

Especificamente, no teste ApexBench, a pontuação Pass@1 do V4-Flash-Vision-Exp foi de 36,5, inferior aos 39,4 do Opus-4.8. A cartografia é 64,3 e 65,0 respectivamente, a diferença é pequena. No Último Exame dos Agentes, o DeepSeek alcançou 27,3, superior aos 25,7 do Opus-4.8. A pontuação Pass@5 do ZeroBench é 35,0, que também é superior aos 34,0 do Opus-4.8.


Entre os quatro dados de testes multimodais, dois ultrapassaram o Opus-4.8

Vale a pena notar que o módulo visual recém-adicionado não sacrifica significativamente os recursos originais do agente de texto do V4-Flash.

Por exemplo, no Terminal Bench 2.1, a versão Vision obteve pontuação de 83,9, enquanto a V4-Flash-0731 obteve anteriormente pontuação de 82,7; DeepSWE subiu de 54,4 para 59,3, excedendo a pontuação Opus-4.8 oficialmente listada de 58,0. No entanto, NL2Repo é apenas 57,7, o que é significativamente inferior aos 69,7 do Opus-4.8, e o CyberGym caiu dos 76,7 anteriores para 75,3. Portanto, DeepSeek resume seus recursos de texto simples como “no mesmo nível” do V4-Flash.

Por outro lado, a própria capacidade visual tem limites. Não é um sistema visual que pode ler infinitamente detalhes em alta definição.

De acordo com a documentação da API DeepSeek, o modelo suporta imagens JPEG, PNG, GIF e WebP e pode receber imagens únicas ou múltiplas. Porém, a imagem será dimensionada de acordo com o tamanho antes de entrar no modelo. Imagens maiores serão eventualmente comprimidas para um volume total de pixels equivalente a aproximadamente 800×800, e cada imagem ocupará até 384 Tokens.

A razão para escolher esta abordagem é controlar o custo computacional causado pela entrada visual. No entanto, o dimensionamento da imagem também pode ser uma limitação em tarefas que dependem especificamente de texto pequeno, texturas locais ou resolução nativa.

Mas não importa o que aconteça, o DeepSeek finalmente compensou os olhos do V4.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários