SwarmLens Cognitive Index
Nos propusimos construir un mejor grafo de conocimiento para documentos legales y de perforación y acabamos reconstruyendo el cerebro. Conoce el SwarmLens Cognitive Index: recuperación más verificación, creado para trabajo de alto riesgo.
Construimos sin querer un cerebro.
Bien, no literalmente. Es software, y ni de lejos tan capaz como la cosa real. Pero seguía recurriendo a los mismos trucos que usa el cerebro, y eso nunca lo planeamos.
Nos propusimos construir un mejor grafo de conocimiento para documentos legales y de perforación. Terminamos con análogos de software de la activación por propagación, la memoria episódica, la memoria de reconocimiento, la consolidación de la memoria, la función ejecutiva, la autoverificación y el razonamiento rápido frente al lento. Cada uno se añadió para matar un error específico. Una respuesta equivocada. Una cláusula omitida. Un número inventado. Solo cuando dimos un paso atrás, el paralelismo con la neurociencia se volvió inquietante.
Para dar contexto: somos una startup de ocho meses. Esto no salió de un laboratorio de investigación. Salió de no poder dormir mientras nuestro propio sistema daba respuestas en las que no podíamos confiar.
Seis frameworks, una brecha persistente
Comparamos seis frameworks de grafos de conocimiento con los mismos datos, el mismo LLM y los mismos embeddings: LightRAG, HippoRAG, PathRAG, OG-RAG, Graphify, PageIndex. Y el nuestro.
Honestamente, cada uno de ellos es impresionante. Son rápidos, escalan a muchos más documentos de los que probamos y aprendimos mucho solo con leer su código.
Pero para el tipo de trabajo que nos importa, había algo que nos seguía inquietando. Estos sistemas recuperan y generan, y luego te entregan la respuesta. Lo que la mayoría no hace, al menos de fábrica, es contrastar esa respuesta con la fuente antes de mostrártela. Para un chatbot, está bien. Para un contrato o un documento de cumplimiento, no. Una línea equivocada, una excepción omitida, un artículo mal citado, y nadie lo detecta hasta que importa: un abogado apoyándose en la cláusula equivocada, un responsable de cumplimiento pasando por alto una excepción, un ingeniero actuando sobre un número que nunca estuvo en la fuente.
Así que ese se convirtió en el problema que nos propusimos resolver. No porque los demás lo hicieran mal, sino porque nuestro caso de uso necesitaba algo para lo que no fueron diseñados.
Así que construimos algo diferente
Así que construimos algo diferente y dejamos de llamarlo grafo de conocimiento. Lo llamamos el SwarmLens Cognitive Index.
Esta es la idea. La mayoría de los grafos de conocimiento hacen embedding de tu consulta, emparejan nodos, recorren algunas aristas, clasifican y generan. Un solo camino, un solo intento, sin cuestionarse. Tu cerebro no funciona así. La activación se propaga por todo lo que sabes. Tu hipocampo evoca situaciones similares que has enfrentado antes. Filtras el ruido, divides la pregunta en partes, vigilas los vacíos y, cuando un número no cuadra, te detienes y compruebas.
Construimos un análogo de software de cada paso. Partes reales, separadas e inspeccionables. Mucho más toscas que la biología, pero cada una desempeñando un papel similar.
No es un grafo de conocimiento. Ni una base de datos. Ni un buscador. Ni un chatbot. Es un Índice Cognitivo.
Función cerebral a la izquierda, nuestro código a la derecha
- Activación por propagación = PageRank personalizado. Preguntas algo y la señal se propaga por el grafo siguiendo relaciones reales, de modo que cosas descritas de forma distinta pero conectadas por significado se iluminan.
- Especialización funcional = comunidades de Leiden. El grafo se autoordena en clústeres temáticos, cada uno con su propio resumen, como regiones especializadas del cerebro.
- Consolidación de la memoria = RAPTOR. Un árbol recursivo reduce muchos resúmenes de clúster a unos pocos temas y una visión general, igual que el sueño convierte el detalle en la esencia.
- Memoria de reconocimiento = un filtro rápido de hechos. Un rápido "¿he visto esto antes?" descarta el ruido antes de la búsqueda profunda. (HippoRAG lo llama igual.)
- Memoria episódica = un almacén de episodios con una guarda temporal. Reutiliza respuestas que funcionaron antes, pero descarta cualquiera basada en documentos que desde entonces se han reemplazado. Ninguno de los seis que probamos hace esto.
- Planificación prefrontal = descomposición de la consulta. Pregunta tres cosas a la vez y las divide en tres búsquedas enfocadas en lugar de una borrosa.
- Función ejecutiva = una tubería de críticos. Tras un borrador, cuatro verificadores buscan artículos faltantes, subcláusulas omitidas, disposiciones no citadas y preguntas que las fuentes no pueden responder. Si encuentran un vacío, vuelven y lo rellenan.
- Autoverificación = una barrera numérica + una compuerta de abstención. Cada cifra de la respuesta se coteja contra el texto fuente; si no está ahí, se marca. Con evidencia escasa, dice "no estoy seguro" en lugar de adivinar. Rudimentario, no autoconsciente, pero mejor que una mentira segura.
- Fuerza sináptica = aristas ponderadas por consenso. Cuantas más pasadas independientes encuentren el mismo vínculo, más fuerte se vuelve; los débiles se etiquetan como "inferidos", no "confirmados".
- Pensamiento rápido y lento = modos de ejecución. Indexamos todo por adelantado y luego elegimos la marcha en el momento de la consulta. Un modo rápido responde en segundos. Un modo completo ejecuta cada carril y cada verificación, se toma su tiempo y cuesta dinero real. Ninguno de los otros te deja regular eso.
Y seré honesto: casi ninguno de estos bloques de construcción es nuestro. Los tomamos de investigación publicada y los unimos. El PageRank personalizado sobre un grafo para recuperación al estilo de la memoria es el núcleo de HippoRAG (NeurIPS 2024), construido sobre la teoría del indexado hipocampal. Organizar un sistema en torno a la memoria de trabajo, episódica y semántica es la premisa de las "arquitecturas cognitivas para agentes de lenguaje". El razonamiento rápido frente al lento para LLMs es su propia línea de investigación activa. No seguimos ese mapa a propósito. Seguimos arreglando fallos y, al levantar la vista, descubrimos que lo habíamos vuelto a dibujar. Lo nuestro es la combinación, y la negativa a entregar una respuesta que el sistema no haya verificado.
La parte que no he visto en otros lados: el framework se reescribe para tus datos
Todas las demás herramientas que probamos son fijas. Los mismos tipos, prompts y fragmentación, sea lo que sea que les des. La nuestra lee primero tus documentos, deduce su estructura e induce sus propias categorías. Del corpus legal descubrió sus propios tipos de entidades y relaciones y escribió sus propios prompts específicos del dominio, ninguno hecho por nosotros. Luego elimina los módulos que tus datos no necesitan. Entra un framework genérico; sale uno hecho a medida. Dale reportes de perforación mañana y lo hace todo de nuevo. LightRAG usa 10 tipos fijos, PathRAG 5, OG-RAG necesita una ontología construida a mano. SwarmLens es el único que hemos encontrado que descubre la suya propia.
Y no es solo para prosa. Pregunta "cuál fue la tendencia de la velocidad de perforación en los últimos 7 días" y está diseñado para devolver números que puedes graficar, no un párrafo. Reportes desordenados entran, datos estructurados salen.
¿Funcionó?
Le dimos a cada herramienta una pregunta difícil que abarcaba dos leyes, calificada contra la misma clave de respuestas extraída de la fuente. La nuestra fue la única que devolvió la respuesta completa con cada cifra trazable hasta su línea exacta, nada inventado, nada omitido. Las otras lo hicieron bien, pero cada una pasó por alto detalles que importan cuando el documento es la ley o la perforación.
Hablando claro: probamos sobre una porción más pequeña de documentos, así que las cifras brutas de tamaño no son una comparación justa, y no fingiré que lo sean. La comparación justa es la pregunta, calificada igual para todos. Esa es la parte que ganamos.
Y no lo hicimos solos. Nos apoyamos en ideas que estos frameworks fueron pioneros en desarrollar: la recuperación al estilo de la memoria de HippoRAG, el canal de relaciones de PathRAG, los resúmenes de RAPTOR. Hicimos que votaran a través de ocho carriles de recuperación fusionados, incluido un carril de palabras clave BM25 que ninguno de los otros tenía, el que atrapa de forma fiable identificadores exactos como "Artículo 22". Luego añadimos la capa de verificación que ninguno de ellos tiene. Porque para el trabajo de alto riesgo, la recuperación es solo la mitad del problema. La verificación es la otra mitad. Bajo el capó, más de 40 técnicas de la literatura trabajan juntas, junto con las partes menos glamorosas: compresión de tokens, embedding por lotes, fragmentación por archivo y una configuración de tres niveles con protecciones de seguridad.
El compromiso honesto
En modo completo somos la opción lenta y cara, minutos por respuesta y mucho más cómputo. Los otros son más rápidos, más baratos y más fáciles de lanzar hoy. Elegimos la precisión primero a propósito, para los casos en los que una respuesta equivocada cuesta más que el cómputo. Pero no nos quedamos quietos: subir la velocidad y bajar el coste de tokens es donde va la mayor parte de nuestra ingeniería ahora mismo. Si tus preguntas son simples, no nos necesitas, y te lo diré a la cara.
Conclusión
Entonces, lo que construimos: un sistema que aprende tu dominio, se reescribe en torno a tus datos y piensa tan intensamente como la pregunta lo exija. Extrae datos estructurados de documentos desordenados, comprueba sus propias respuestas contra la fuente, señala contradicciones, se abstiene cuando la evidencia es escasa y olvida lo que está desactualizado.
No es un grafo de conocimiento. Ni una base de datos. Ni un buscador. Ni un chatbot. Es un Índice Cognitivo.
Llevamos ocho meses, no lo estamos liberando como código abierto y buscamos algunos socios de diseño en legal y cumplimiento, petróleo y gas, due diligence financiera, y salud y farmacéutica. Si "lo bastante cerca" no es suficiente para tu trabajo, hablemos: hello@swarmlens.com
(Y si investigas arquitecturas cognitivas, me encantaría comparar notas. Los paralelismos nos encontraron a nosotros; no los diseñamos.)
Una pregunta a la que sigo volviendo: ¿es una respuesta rápida lo bastante buena para tu trabajo? ¿O "mayormente correcto" es la frase más peligrosa de la IA?
Dime dónde te sitúas.
