← História: IA na China
Nível de hype: ProdutoOrigem: China

DeepSeek reduz a um quarto a memória que o modelo gasta por token no V4.1-Flash

A DeepSeek publicou em 17 de setembro no arXiv o relatório técnico do DeepSeek-V4.1-Flash, modelo multimodal de mistura de especialistas colocado em serviço em 10 de setembro, com 552 bilhões de parâmetros, contexto de até 1 milhão de tokens e pesos publicados.

O foco do relatório é a compressão do cache de chaves e valores, a memória que o modelo guarda de cada token já lido. O total cai para 890 bytes por token, cerca de um quarto do DeepSeek-V4-Flash. Segundo o ActuIA, os autores partem do uso real: agentes de longo prazo releem sem parar um contexto crescente, muito mais do que geram texto, e o custo passa a vir sobretudo da leitura.

Termômetro de hype

Produto disponível

Modelo aberto publicado e relatório técnico com números verificáveis.

Critério: Qualquer pessoa pode usar hoje (pago ou grátis).

Fontes originais

Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.

O que muda pra você

Dev
Menos memória por token permite servir contextos longos e mais usuários por GPU.
PM
Agentes com contexto longo ficam mais baratos de operar com modelos assim.
Executivo
O custo de rodar agentes depende cada vez mais da eficiência de memória, não só do preço por token.
Investidor
A DeepSeek segue competindo por eficiência, o que pressiona preços de inferência.
Educador
Bom caso para explicar por que a memória é o gargalo de modelos com contexto longo.