Pilar

La pregunta que fallaba siempre, hasta que dejó de hacerlo

Probamos este producto con más dureza de la que la mayoría se molestaría en aplicar a una herramienta que no vende. No porque disfrutemos encontrando nuestros propios bugs, sino porque la afirmación de que “la IA realmente conoce tu negocio” no vale nada si nadie ha comprobado si es cierta bajo presión real.

Una pregunta fallaba una y otra vez. Ni casi acertada, ni vaga: un seco “No tengo eso.”

La pregunta, y cuántas veces falló

“Propón un paquete de servicios híbrido, basado en lo que realmente ha funcionado.”

Planteamos alguna versión de esto en tres tandas de simulación de AlphaForge distintas, una prueba completa de la vertical de bufetes de abogados y una prueba de la vertical de jardinería. Cada vez, con el método de recuperación antiguo: alguna versión de “No tengo entradas del Vault ni registros que muestren qué combinaciones han funcionado.”

Lo frustrante no era que fallara. Era que la información realmente no faltaba. El Vault tenía la entrada general de precios. Tenía la entrada específica del resultado. Simplemente nunca las conectó, porque el método de recuperación de fondo hacía coincidencia de palabras clave en vivo en cada mensaje, hasta cuarenta rastreos de base de datos distintos por pregunta, y la coincidencia de palabras clave no sabe que “palés de césped” y “cobertura con palés” hablan de lo mismo.

Lo que realmente cambiamos

No lo que el Vault guarda. Cómo se busca en él.

Cada entrada del Vault ahora se convierte en un embedding, una representación numérica de su significado real, en el momento en que se escribe, no en el momento en que alguien pregunta sobre ella. La recuperación pasó a ser una única búsqueda del vecino más cercano sobre esa representación, en lugar de rastrear todo el Vault desde cero en cada mensaje. Es la misma base de datos de fondo, Postgres, en la misma instancia que ya teníamos, usando una extensión creada exactamente para esto. Ninguna categoría de infraestructura nueva. Solo una forma distinta de encontrar lo que ya estaba ahí.

Llegar hasta ahí requirió trabajo de ingeniería real, nada glamuroso, en el que la mayoría de estas publicaciones no se detiene: confirmar qué proveedores de IA siquiera ofrecen un endpoint de embeddings (no todos lo hacen), un diseño consciente de cada cliente (tenant-aware) para que se use el proveedor propio configurado de cada empresa en lugar de una única clave para toda la plataforma, y un bug genuinamente quisquilloso en el que los embeddings de un proveedor necesitaban normalización explícita antes de que las comparaciones de distancia fueran siquiera matemáticamente válidas. También comparamos cinco modelos candidatos con una pregunta real antes de elegir uno, y descubrimos algo que vale la pena por sí solo: la opción más rápida superaba a la más lenta entre diez y quince veces, sin ninguna diferencia en la calidad de la respuesta en la pregunta numérica exacta con la que la probamos.

La repetición de la prueba

Mismo cliente. Misma pregunta. Método antiguo, luego el nuevo, uno tras otro.

La respuesta antigua: “No tengo entradas del Vault ni registros que muestren qué combinaciones han funcionado.”

La respuesta nueva, confirmada por los logs como realmente generada por el nuevo camino de recuperación, no una coincidencia: una propuesta real y concreta, servicios con nombre, un cliente real mencionado por su nombre, un valor total calculado, un razonamiento ligado a cómo funciona realmente el trabajo de esa empresa. No una versión ligeramente mejor de la vieja no-respuesta. Un resultado completamente distinto, en una pregunta que había fallado de forma idéntica, cada vez, durante todo el programa de pruebas hasta ese momento.

Lo que no vamos a disimular

El coste real apareció de inmediato, así que lo contamos, sin suavizarlo. El backfill de embeddings para un Vault ya grande, más de mil entradas, tardó casi cinco minutos, incómodamente cerca de un límite estricto de tiempo de espera de la solicitud. En un Vault genuinamente maduro, de varios miles de entradas, ese mismo backfill de una sola vez probablemente fallaría a medio camino. Lo sabemos ahora porque lo medimos, no porque lo supongamos. Es un seguimiento real, señalado, no algo que lanzamos esperando en silencio que nadie se topara con ello.

El número detrás de todo esto

Esta única comparación antes-después es una prueba dentro de un programa mucho más amplio: unos veinticinco años simulados de actividad empresarial en varios sectores, más de nueve mil entradas reales del Vault generadas por el camino, once bugs reales encontrados y corregidos, este vacío de recuperación entre ellos. Gasto real total en API para todo el programa de varios meses: 9,57 $.

Preferimos mostrarte la pregunta que falló cinco veces seguidas, y exactamente lo que costó arreglarla, antes que empezar con un número llamativo y esperar que nadie pregunte qué hay realmente detrás.

Preguntas que la gente realmente hace

¿Le faltaba de verdad esa información a la IA, o era un problema de búsqueda?

Un problema de búsqueda, confirmado directamente. Cada dato necesario para responder la pregunta ya estaba en el Vault. El método de recuperación antiguo usaba coincidencia de palabras clave en vivo, así que una pregunta con ‘palés’ no encontraba de forma fiable una entrada escrita con ‘palé’, y una pregunta de síntesis más amplia no conectaba de forma fiable dos entradas relacionadas pero redactadas de forma distinta. El conocimiento estaba ahí. La búsqueda simplemente no lo encontraba.

¿Qué cambió realmente?

Las entradas del Vault ahora se convierten en un embedding, una representación numérica de su significado, en el momento en que se escriben. La recuperación pasó a ser una única búsqueda del vecino más cercano sobre esa representación, en lugar de un rastreo de palabras clave en vivo por todo el Vault en cada mensaje. El mismo conocimiento de base. Una forma completamente distinta de encontrarlo.

¿Cómo saben que la mejora es real y no algo puntual?

Repetimos la pregunta idéntica en el mismo cliente, primero con búsqueda por palabras clave, luego con búsqueda vectorial, y comparamos. También revisamos el coste real: la latencia, el tiempo de backfill a gran escala y un riesgo real que encontramos (el backfill único de un Vault grande acercándose peligrosamente al límite de tiempo de una solicitud), en lugar de mostrar solo la victoria.

Únete a la Early Crew →← Volver a todos los artículos

Recorded on a live database and a live screen, but run by automated scripts standing in for a human's clicks and typing, not performed live. When Stark answers faster than the script expects, the screen can hold still for a beat before the next step starts. That's left in on purpose. The goal was never a polished demo reel, it was proof the feature actually works. Dejan's own verdict, after watching the raw footage: rough, but the best demo video we've made.