A otimização conjunta do modelo e do agente poderia melhorar o planeamento e o tratamento do contexto, mas qualquer vantagem competitiva teria de ser demonstrada através de melhores resultados em projetos empresariais, reduzindo ao mesmo tempo a necessidade de intervenção humana, disse Pareekh Jain, CEO da Pareekh Consulting.
Meta relatou que o Muse Spark 1.2 alcançou uma pontuação pass@1 de 82,9% no Terminal-Bench 2.1, atrás de Claude Opus 5, mas um pouco à frente do GPT-5.6 Terra. No DeepSWE 1.1, o modelo obteve 59,3%, atrás dos dois rivais.
Para Terminal-Bench 2.1 e DeepSWE 1.1, Meta avaliou cada modelo com seu agente de codificação selecionado, em vez de usar o mesmo agente por toda parte. Também reconheceu que os modelos proprietários rivais podem ter tido um desempenho diferente com ferramentas e instruções concebidas especificamente para eles.
