Cuando empezamos a diseñar CaseLawAI, la pregunta obvia era: ¿base vectorial o grafo de conocimiento?
La respuesta rápida era vectores. Semántica, embeddings, búsqueda por similitud. Lo probamos durante meses y llegamos a una conclusión incómoda: para jurisprudencia, los vectores solos no alcanzan — necesitan un grafo al lado.
El problema que los vectores no resuelven
Los fallos judiciales no son documentos independientes. Son nodos en una red densa de relaciones: un fallo cita a otro, que cita a una norma, que fue interpretada por un tercer fallo que a su vez modifica la doctrina del primero. Esa estructura relacional es exactamente lo que le interesa a un abogado que investiga jurisprudencia.
Cuando buscás “daño punitivo en contratos bancarios” en un sistema vectorial, obtenés los fallos más similares semánticamente. Pero no sabés cuáles se citan entre sí, cuál es el fallo fundacional de la línea ni si hubo un fallo posterior que revirtió la doctrina.
Esas preguntas no tienen respuesta en un índice vectorial. Tienen respuesta en un grafo.
La arquitectura de CaseLawAI
CaseLawAI extrae entidades y relaciones de cada fallo:
- Nodos: fallos (tribunal, fecha, carátula), normas (artículos de código, leyes, decretos), doctrinas (conceptos jurídicos extraídos), partes procesales cuando son relevantes.
- Aristas: CITA_A (fallo a fallo), APLICA (fallo a norma), DESARROLLA (fallo a doctrina), REVOCA (fallo a fallo), MATIZA (fallo a doctrina).
El pipeline de extracción usa un LLM con ejemplos few-shot para identificar estas relaciones. REVOCA es el tipo de arista más difícil de detectar: los fallos rara vez dicen “revocamos” de forma explícita, así que el sistema tiene que inferir la relación a partir de contexto indirecto — un cambio de criterio, una remisión a un fallo anterior con matices distintos. Por eso esas aristas pasan por una capa de revisión adicional antes de quedar firmes en el grafo — un segundo paso de verificación contra el texto del fallo, no solo la inferencia del primer LLM — antes de quedar firmes: la automatización acelera la extracción, pero no reemplaza el chequeo final en el tipo de relación que más impacta la lectura de una línea jurisprudencial.
Cada fallo nuevo dispara el pipeline, se reconcilian las entidades con el grafo existente (deduplicación de normas, unificación de variantes de nombres) y se actualizan las aristas.
Por qué esto cambia la forma de investigar
Con esta estructura, una consulta sobre “daño punitivo en contratos bancarios” no devuelve solo una lista de fallos. Devuelve el subgrafo: el fallo fundacional, los que lo citan, las normas que invocan en común y las tensiones doctrinarias activas entre cámaras.
A modo ilustrativo (no es un caso real, es el tipo de estructura que arma el subgrafo): un fallo fundacional que reconoce daño punitivo bajo el artículo 52 bis de la Ley 24.240, cuatro fallos posteriores que lo citan vía CITA_A aplicando el mismo criterio a distintos productos bancarios, y un fallo de otra cámara conectado por REVOCA porque restringió el criterio a casos de mala fe probada. Esa última arista es la que un sistema puramente vectorial no distingue de una cita cualquiera — para el índice, los tres fallos son “similares”; para el grafo, uno de ellos cambió la doctrina.
Un abogado puede ver de un vistazo si está trabajando en territorio consolidado o si hay una división activa entre, por ejemplo, la Cámara Civil y la Cámara Comercial sobre cómo interpretar el art. 52 bis de la Ley de Defensa del Consumidor.
Eso antes requería leer diez fallos y construir mentalmente el mapa. Ahora el sistema lo hace.
El trade-off que aceptamos
Mantener un grafo cuesta más que mantener un índice vectorial. Dos costos concretos:
Costo de extracción: cada fallo nuevo dispara el pipeline de NLP. Un fallo de 20 páginas puede generar entre 15 y 30 entidades y entre 8 y 15 aristas. Escalado a miles de fallos por mes, ese costo es real.
Costo de reconciliación: cuando un fallo nuevo menciona “la CSJN en Fallos 340:1400”, el sistema tiene que identificar que ese es el mismo nodo que ya existe en el grafo con metadatos distintos. La deduplicación de entidades legales es un problema no trivial.
Decidimos que esos costos valen la pena porque el caso de uso central es la investigación profunda, no la búsqueda rápida. Un índice vectorial devuelve documentos parecidos; no devuelve la razón por la que un fallo importa dentro de una línea jurisprudencial. Esa distinción — similitud semántica versus relación argumentativa — es la misma que identifica la investigación reciente sobre GraphRAG en tareas que exigen razonamiento sobre múltiples saltos de relación o síntesis de un corpus completo, en vez de recuperar un dato puntual (Edge et al., 2024, Microsoft Research).
Vectores y grafos: los dos mundos
En la práctica, CaseLawAI combina las dos representaciones:
- Consulta semántica: los 50 fallos principales por similitud vectorial
- Expansión por grafo: incluir fallos conectados por CITA_A o que aplican la misma norma
- Re-rank por centralidad: los fallos más citados por los ya seleccionados suben en el ranking
- Presentación del subgrafo al usuario, no solo una lista plana
En consultas de investigación compleja —las que requieren entender cómo se relacionan varios fallos entre sí, no solo encontrar el más parecido— la ventaja del grafo está en la calidad de lo que se puede armar con el resultado, no únicamente en qué tan arriba queda un documento en el ranking. Es la misma distinción que describe la literatura reciente sobre RAG legal que combina bases vectoriales y grafos de conocimiento para navegar constituciones, estatutos y jurisprudencia relacionada (arXiv:2502.20364, 2025).
Para quién es esto
Para estudios jurídicos que investigan a fondo antes de litigar. Para equipos legales de empresas que necesitan entender el estado de la jurisprudencia antes de tomar una decisión de negocio. Para investigadores que siguen la evolución de doctrinas específicas a lo largo del tiempo.
Si hacés investigación legal en Argentina y todavía dependés de la búsqueda textual o de leer fallos uno por uno, vale la pena explorar qué cambia cuando el grafo trabaja para vos. CaseLawAI es la implementación de esta arquitectura dentro del ecosistema Arteclaw.
¿Querés ver cómo un grafo de conocimiento puede cambiar la forma en que tu equipo investiga jurisprudencia? Conversemos.