
Nexus RAG — RAG Agéntico Avanzado con Grafo y Memoria
Transforma tu documentación en un asistente que responde con fuentes, sin alucinar y respetando permisos.
1. Ingesta y ETL inteligente
- PDF, DOCX, TXT + OCR (RapidOCR/Docling) para escaneados
- Chunking contextual 700 tokens / 70 overlap con herencia de metadatos
- Metadatos canónicos obligatorios: fecha_publicacion ISO 8601, categoria, id_proyecto, autor, nivel_confidencialidad (público/interno/confidencial/secreto)
- Grafo: NER (personas, orgs, productos, conceptos) + relaciones + resolución de sinónimos por embedding
2. Almacenamiento y Búsqueda Híbrida
- Vector DB PGVector (embeddings NV-Embed-v2 / BGE) + Graph DB (graph_nodes / graph_edges)
- Híbrida: dense + BM25 (tsvector) fusionado por RRF + filtrado por metadatos y confidencialidad
- Filtros nativos: por fecha, categoría, proyecto, clearance del usuario
3. Orquestación Agéntica (LangGraph)
- Query Router: SEMANTIC | FILTERED | RELATIONAL decide si va a vector, grafo o stats
- Planificación CoT para consultas complejas
- Tools JSON: search_vector(query, filters), query_graph(entity_name), get_metadata_stats(filter_query)
- Self-correction: re-formula y reintenta si el contexto es insuficiente
4. Respuesta con garantías
- Citas con título, ID y fragmento + streaming SSE <5s
- Fact-checking: valida cifras y fechas contra los chunks recuperados
- Trazabilidad completa: agent_runs / agent_spans, log de tools, fragmentos y CoT
- Seguridad: filtra confidentiality <= clearance del usuario
- Escalabilidad: miles de documentos, advisory lock, multi-worker
Memoria de 3 capas (inspiración MemGraphRAG)
- Schema layer: ontologías (head_type, relation, tail_type)
- Fact layer: triples (head, relation, tail) con frecuencia
- Passage layer: fragmentos originales
- Inducción de ontología + filtrado por frecuencia + detección/resolución de conflictos + Personalized PageRank
