Testamos este produto com mais rigor do que a maioria das pessoas se daria ao trabalho de testar uma ferramenta que não vende. Não porque gostemos de encontrar os nossos próprios bugs, mas porque a afirmação de que “a IA conhece mesmo o seu negócio” não vale nada se ninguém verificou se isso é verdade sob pressão real.
Uma pergunta continuava a falhar. Nem quase certa, nem vaga: um seco “Não tenho isso.”
A pergunta, e quantas vezes falhou
“Proponha um pacote de serviços híbrido, baseado no que realmente funcionou.”
Colocámos alguma versão desta pergunta em três rondas de simulação AlphaForge separadas, um teste completo da vertical de escritórios de advocacia, e um teste da vertical de jardinagem e paisagismo. Todas as vezes, com o método de recuperação antigo: alguma versão de “Não tenho registos do Vault nem dados que mostrem que combinações funcionaram.”
A parte frustrante não era o facto de falhar. Era que a informação realmente não estava em falta. O Vault tinha o registo geral de preços. Tinha o registo específico do resultado. Simplesmente nunca os ligou, porque o método de recuperação por trás disto fazia correspondência de palavras-chave em tempo real a cada mensagem, até quarenta pesquisas separadas na base de dados por pergunta, e a correspondência de palavras-chave não sabe que “paletes de relva” e “cobertura em paletes” falam da mesma coisa.
O que realmente mudámos
Não o que o Vault armazena. A forma como é pesquisado.
Cada registo do Vault agora é convertido num embedding, uma representação numérica do seu significado real, no momento em que é escrito, não no momento em que alguém faz uma pergunta sobre ele. A recuperação passou a ser uma única pesquisa do vizinho mais próximo sobre essa representação, em vez de percorrer todo o Vault do zero a cada mensagem. É a mesma base de dados de base, Postgres, na mesma instância que já tínhamos, com uma extensão construída exatamente para isto. Nenhuma nova categoria de infraestrutura. Apenas uma forma diferente de encontrar o que já lá estava.
Chegar até aqui exigiu trabalho de engenharia real, nada glamoroso, em que a maioria destes artigos não se detém: confirmar que fornecedores de IA sequer oferecem um endpoint de embeddings (nem todos oferecem), um design que tem em conta cada inquilino (tenant-aware) para que seja usado o fornecedor configurado próprio de cada empresa em vez de uma única chave para toda a plataforma, e um bug genuinamente minucioso em que os embeddings de um fornecedor precisavam de normalização explícita antes de as comparações de distância serem sequer matematicamente válidas. Também comparámos cinco modelos candidatos numa pergunta real antes de escolher um, e descobrimos algo que vale a pena por si só: a opção mais rápida superava a mais lenta entre dez a quinze vezes, sem qualquer diferença na qualidade da resposta na pergunta numérica exata em que a testámos.
O novo teste
Mesmo cliente. Mesma pergunta. Primeiro o método antigo, depois o novo, um a seguir ao outro.
A resposta antiga: “Não tenho registos do Vault nem dados que mostrem que combinações funcionaram.”
A resposta nova, confirmada pelos registos como tendo genuinamente usado o novo caminho de recuperação, não uma coincidência: uma proposta real e concreta, serviços com nome, um cliente real referido pelo nome, um valor total calculado, um raciocínio ligado à forma como o trabalho dessa empresa realmente flui. Não uma versão ligeiramente melhor da antiga não-resposta. Um resultado completamente diferente, numa pergunta que tinha falhado de forma idêntica, todas as vezes, ao longo de todo o programa de testes até esse momento.
O que não vamos fingir
O custo real apareceu de imediato, por isso reportamo-lo, sem o suavizar. O preenchimento retroativo de embeddings para um Vault já grande, mais de mil registos, demorou quase cinco minutos, desconfortavelmente perto de um limite rígido de tempo de espera do pedido. Num Vault genuinamente maduro, com vários milhares de registos, esse mesmo preenchimento retroativo de uma só vez provavelmente falharia a meio caminho. Sabemos isso agora porque medimos, não porque estamos a adivinhar. É um verdadeiro seguimento assinalado, não algo que lançámos e esperámos em silêncio que ninguém encontrasse.
O número por trás de tudo isto
Esta única comparação antes-e-depois é um teste dentro de um programa muito maior: cerca de vinte e cinco anos simulados de atividade empresarial em várias indústrias, mais de nove mil registos reais do Vault gerados pelo caminho, onze bugs reais encontrados e corrigidos, esta lacuna de recuperação entre eles. Despesa real total em API para todo o programa de vários meses: 9,57 $.
Preferimos mostrar-lhe a pergunta que falhou cinco vezes seguidas, e exatamente o que foi preciso para a corrigir, do que começar com um número de destaque e esperar que ninguém pergunte o que está realmente por trás dele.