“O problema com a IA de agente em escala é que o consumo é difícil de prever, os agentes que pesquisam e pesquisam criam custos e latência compostos e imprevisíveis, e as equipes financeiras odeiam essas contas variáveis. Saber que seus agentes pesquisarão dentro de um teto definido e que você pode definir esse teto por carga de trabalho é o que torna a pesquisa de agente segura para ser executada em escala, em vez de um medidor descontrolado”, observou Chaturvedi.

A economia poderia se tornar ainda mais convincente, acrescentou Chaturvedi, se o modelo especializado pudesse fornecer a alegada qualidade de recuperação de modelos maiores de uso geral com menor latência.

O Adaptive Instructed-Retriever, de acordo com a Databricks, igualou ou excedeu a qualidade de recuperação de Claude Sonnet 5, GPT-5.6 Luna e DeepSeek-V4-Flash em suas avaliações internas ao concluir solicitações em 5,8 segundos, ou mais de duas vezes mais rápido que esses modelos.