O desconto de cache de aproximadamente 98% do DeepSeek, contra uma norma da indústria próxima de 90%, é o mecanismo que manteve seu custo medido por tarefa cerca de 60% abaixo do Luna, mesmo após o corte de custos do Luna, disse ele.

“O cronograma reavalia exatamente esse mecanismo”, disse Gogia. A vantagem do Flash sobre Luna diminui de aproximadamente sete vezes para três vezes fora do pico e 1,4 vezes no pico. “É no cache que a vantagem realmente diminui.”

Incentivando os usuários a repensar suas programações

O V4-Pro do DeepSeek agora está disponível e o V4-Flash está em beta. Ambos os modelos têm novas capacidades de raciocínio flexíveis (baixo, alto, máximo) e “modos de pensamento” que usam o raciocínio de cadeia de pensamento (CoT) para melhorar a precisão das respostas. O V4 Pro agora está disponível no aplicativo, na web e via API, e os usuários podem experimentá-lo usando o “Modo Especialista”. O Flash V4 está agora em beta.