Entretanto, assim como o roteamento dinâmico, o cache semântico exige um cálculo arquitetônico rigoroso. Você está negociando custos de geração por custos de incorporação e pesquisa. Para verificar o cache, você ainda precisa tokenizar o prompt, chamar um modelo barato (como text-embedding-3-small) e executar uma pesquisa vetorial.

Você também apresenta o perigo muito real do achatamento semântico. Ajustar o limite de similaridade é uma arte delicada. Defina um valor muito baixo e seu aplicativo começará a fornecer respostas gerais e recicladas para perguntas diferenciadas do usuário. Para aplicações de IA abertas, criativas e generativas, o cache semântico é praticamente inútil. Mas para implementações de geração aumentada de recuperação (RAG), bots de suporte ao cliente e bases de conhecimento internas onde os usuários fazem as mesmas 20 perguntas de mil maneiras diferentes, é a alavanca de redução de custos mais eficaz que você pode usar.

Cache de prompt

Enquanto o cache semântico armazena a resposta a uma determinada intenção, o cache imediato armazena os dados necessários para contextualizar a questão. Quando o usuário insere um prompt, ele é enviado ao endpoint generativo de IA. Mas, em vez de seu aplicativo ter que coletar e enviar repetidamente as enormes informações contextuais necessárias para enquadrar o prompt (de um pipeline RAG, um banco de dados ou outra fonte), essas informações já estão pré-carregadas no cache de contexto. O modelo simplesmente aplica a nova questão aos dados armazenados em cache, reduzindo tanto a latência quanto os custos de entrada.