¿Tu RAG falla o miente?
No es culpa del prompt.

Convertimos pilotos de RAG que no llegaron a producción en sistemas verificables, auditables, precisos y operables.

Estás atrapado en el Naïve RAG

Construiste un sistema que embebe documentos, recupera los fragmentos más similares y genera una respuesta. Funcionó en la demo. En producción, la búsqueda vectorial simple no basta: es un problema de arquitectura, no de prompt engineering.

"Legal nos ha prohibido lanzar la herramienta porque no podemos garantizar que no filtre datos confidenciales."
Responsable de producto, sector asegurador
"El bot mezcla políticas de 2021 con las de 2024 porque no entiende la vigencia temporal."
Dirección de operaciones, banca
"Si pregunto por impagos no encuentra nada, porque en los documentos pone deuda pendiente."
Equipo jurídico, despacho de abogados

Las cinco causas del fallo

  • Chunking sin sentido

    Cortes fijos de 500 tokens que rompen tablas y parten ideas por la mitad. Necesitas chunking semántico.

  • Embeddings genéricos

    Los modelos de propósito general fallan en dominios específicos. Sin adaptación al dominio, la precisión cae.

  • Latencia de orquestación

    Recuperación, reranking y generación suman más de tres segundos. Sin optimización, el sistema se siente roto.

  • Sin evaluación retroalimentada

    No hay pipelines automáticos de evaluación. Si el modelo alucina, te enteras por un ticket de soporte, no por tus métricas.

  • Explosión de costes

    Facturas altas por bases vectoriales gestionadas y modelos gigantes para preguntas que un modelo local resolvería.

El mito del wrapper y la ingeniería real

En 2023 se desestimaron muchas startups como simples envoltorios de un modelo. Hoy, empresas como Perplexity demuestran que el valor está en la orquestación. Estas son tus opciones actuales:

Etapa 1, 2022

Naïve RAG

Scripts simples de LangChain. Embeddings básicos y búsqueda vectorial pura.

Fácil de prototipar. Falla en producción: sin búsqueda híbrida, el recall es insuficiente.
Enterprise

Cajas negras

Copilot, NotebookLM, Azure AI Search, Glean. Soluciones todo en uno.

Infraestructura resuelta. Opacidad total: no puedes ajustar el reranker ni optimizar costes cuando la factura crece.
Etapa 3

GraphRAG

El nuevo estándar para razonamiento complejo en varios saltos.

Conecta conceptos dispersos entre documentos. Costoso y complejo de mantener. A menudo es excesivo para preguntas simples.
Etapa 5, 2025

Agentic RAG

Sistemas que razonan, planifican y usan herramientas.

Se autocorrige y alcanza alta precisión. Requiere orquestación avanzada y control estricto de latencia. Es el objetivo a alcanzar.

Nuestra misión: llevarte de cualquier etapa al RAG corporativo en producción más avanzado, sin reconstruirlo todo desde cero.

De la búsqueda al razonamiento

La búsqueda híbrida ya no es una mejora opcional: es el estándar mínimo. Si no combinas recuperación vectorial con palabras clave y reranking, pierdes hasta un 45% de precisión en la recuperación.

Tu piloto

Naïve RAG
  • PDF convertido a texto plano
  • Chunking fijo de 512 tokens
  • Búsqueda vectorial simple
  • Generación directa, sin verificación
  • Sin evaluación automática

Un sistema de producción

Agentic RAG
  • Chunking semántico y comprensión visual del documento
  • Búsqueda híbrida con reranking
  • Autovalidación antes de responder
  • Evaluación continua con RAGAS
  • Respuesta citada y auditada

Lo que entregamos

Con reranking de cross-encoders y arquitecturas multimodales reales, el sistema deja de ser una caja negra y se convierte en un activo medible.

Precisión en la recuperación

Con búsqueda híbrida y reranking, la recuperación de información relevante mejora drásticamente frente a la búsqueda vectorial simple.

Multimodalidad real

Tratamos los documentos como imágenes, preservando el contexto visual de gráficos y tablas que el OCR tradicional destruye.

Confianza verificada

El sistema se evalúa a sí mismo antes de responder. Si la confianza es baja, busca más información o admite que no lo sabe.

Costes contenidos

Migramos de stacks gestionados caros a arquitecturas open source optimizadas, evitando facturas mensuales de cinco cifras.

Razonamiento en varios saltos

Lógica capaz de conectar información repartida en documentos separados, algo imposible para el RAG básico.

Evaluación continua

Pipelines automáticos que miden fidelidad y relevancia en cada despliegue. Sabrás si el sistema mejora o empeora con cada cambio.

En resumen: pasas de un prototipo a un sistema de producción. Dejamos de perseguir el último paper académico para centrarnos en lo que funciona: evaluación, latencia y despliegue.

Comprometidos con el conocimiento compartido

Análisis y reportes que hemos publicado sobre el ecosistema RAG. Si te surge cualquier duda sobre ellos, escríbenos.

Skills

Skill Collapse

Degradación del enrutamiento de habilidades en agentes LLM al crecer la biblioteca.

Las bibliotecas de habilidades de agentes se han vuelto una pieza común en los agentes basados en modelos de lenguaje. A medida que pasan de un puñado de habilidades a varios cientos, distintos equipos reportan un enrutamiento degradado: el agente invoca la habilidad equivocada o pasa por alto la correcta. Llamamos a este fenómeno skill collapse y presentamos un estudio controlado para medirlo.

Chunking arXiv:2601.10215

Topo-RAG

Recuperación consciente de la topología para documentos híbridos de texto y tabla.

Un marco que desafía la suposición de que todo es texto. Proponemos una arquitectura dual que respeta la topología de los datos: la narrativa fluida pasa por recuperadores densos tradicionales, mientras las estructuras tabulares se procesan con un mecanismo de interacción tardía consciente de celdas, preservando sus relaciones espaciales. Evaluado en SEC-25, mejora un 18.4% el nDCG@10 en consultas híbridas frente a la linealización estándar.

Fiabilidad arXiv:2601.15476

Fiabilidad por diseño: una medición cuantitativa del riesgo de fabricación en LLMs

Análisis comparativo de la IA generativa frente a la consultiva en el dominio jurídico, con lecciones para cualquier corpus de conocimiento.

Los LLMs pueden automatizar tareas jurídicas, pero las alucinaciones son inaceptables en dominios de alto rigor. Cuantificamos el riesgo comparando generación generalista, RAG básico y RAG consultivo avanzado, con dos métricas: tasa de citas falsas (FCR) y tasa de hechos fabricados (FFR). La generación pura falla (FCR superior al 30%); el RAG básico reduce el error más de cien veces; el RAG avanzado baja la fabricación por debajo del 0.2%.

Embeddings arXiv:2601.08851

Más contexto no es mejor

La paradoja de la dilución vectorial en RAG corporativos.

Las técnicas recientes de chunking contextualizado inyectan resúmenes para mejorar el contexto, pero introducen una dilución vectorial que opaca el contenido local. Evaluando distintos ratios de inyección, demostramos una curva en U invertida: una inyección moderada mejora el recall un 18%, pero superar un umbral crítico reduce la precisión un 22% en consultas específicas. Proponemos un marco teórico para calcular el ratio óptimo.

Compliance arXiv:2510.12830

Gobernanza y trazabilidad a prueba de AI Act para casos de uso legales

Un marco técnico-jurídico, métricas forenses y evidencias auditables.

Un marco integral de gobernanza para sistemas de IA en el sector legal, diseñado para garantizar el cumplimiento verificable del Reglamento de IA de la UE. Integra una cartografía normativa de la ley a controles técnicos, una arquitectura forense para sistemas RAG y un sistema de evaluación con métricas ponderadas por riesgo jurídico. Como principal contribución se presenta rag-forense, una implementación de código abierto acompañada de un protocolo experimental de conformidad.

Alucinaciones arXiv:2509.09467

Inteligencia artificial jurídica y el desafío de la veracidad

Análisis de alucinaciones, optimización de RAG y principios para una integración responsable.

Este informe analiza las alucinaciones en los LLMs aplicados al derecho: sus causas, manifestaciones y la efectividad del RAG como mitigación, exponiendo sus limitaciones y proponiendo optimizaciones holísticas. Concluye que la solución no reside en mejorar incrementalmente los modelos generativos, sino en adoptar un paradigma de IA consultiva que priorice la veracidad y la trazabilidad, amplificando el juicio profesional en lugar de sustituirlo.

Reranking

¿El reranking es todo lo que necesitas?

Recuperación en dos etapas frente a ajuste fino de embeddings en sistemas RAG con pocos datos.

El despliegue de RAG en dominios corporativos especializados se enfrenta al problema del arranque en frío: vastos corpus documentales, pero muy pocos pares de entrenamiento etiquetados. Este estudio presenta un experimento controlado que compara el ajuste fino few-shot de modelos bi-encoder con una arquitectura de recuperación en dos etapas basada en búsqueda híbrida y reranking con cross-encoder.

Previsto marzo 2026

RAGes

Mejores prácticas para la generación aumentada por recuperación en español. En preparación.

El cambio de paradigma

Dejamos atrás la era del wrapper y entramos en la era de la arquitectura de información. El éxito en RAG no depende de qué modelo uses, sino de cómo gestionas tus datos.

Magia opaca Ingeniería medible
Chunking fijo Chunking semántico
Búsqueda vectorial Híbrida con reranking
Sin validación Autoevaluación
Coste ilimitado Eficiencia open source

Cómo arreglamos tu sistema en seis pasos

Una metodología de ingeniería estricta para pasar de la demo a un RAG corporativo en producción.

Auditoría de ingesta

Revisamos tu estrategia de datos, fuentes y casuísticas para definir la mejor forma de crear semántica y relación entre todos los datos del corpus.

Embeddings de dominio

Sustituimos modelos genéricos por embeddings específicos o ajustados que entienden la jerga de tu sector: legal, financiero, sanitario.

Búsqueda híbrida y reranking

Vectores, palabras clave y reranking con cross-encoder: la combinación que maximiza la precisión de la recuperación.

Evaluación con RAGAS

Un pipeline automático de evaluación. Conocerás la fidelidad y relevancia de tus respuestas antes de cada despliegue.

Arquitectura agéntica

Dotamos al sistema de capacidad de planificación y reflexión para resolver consultas complejas de múltiples pasos.

Optimización de producción

Resolvemos el muro de latencia: cachés, inferencia y costes optimizados para que el sistema sea rápido y rentable.

Lo que nadie te cuenta sobre RAG

Respuestas honestas a las preguntas que surgen cuando el piloto falla.

¿Por qué RAG no es siempre la respuesta?

Si tu base de conocimiento es estática y menor a 10 GB, a veces un fine-tuning funciona mejor y es más barato. RAG es para datos dinámicos y vastos. Te ayudaremos a decidir con honestidad si realmente lo necesitas.

¿Realmente importa tanto el chunking?

Es la causa número uno de respuestas pobres. Si cortas una frase a la mitad, el embedding pierde el sentido semántico. Implementar chunking semántico es una deuda técnica que conviene pagar desde el día uno.

¿GraphRAG es puro hype o lo necesito?

Es impresionante para preguntas de resumen global, como qué dicen cincuenta contratos sobre riesgos, pero es complejo y caro. Si tus preguntas son de búsqueda directa, el RAG tradicional optimizado es suficiente y más rápido.

¿Por qué citar no significa estar grounded?

Porque una cita puede ser irrelevante, ambigua o no contener la evidencia exacta. En entornos críticos la pregunta no es si hay enlace, sino si prueba la afirmación, con el alcance correcto, para este usuario, hoy.

¿Qué hace que un documento sea difícil para RAG?

Estructuras no lineales como anexos, tablas y referencias cruzadas, versiones múltiples, contenido escaneado, mezcla de idiomas, entidades similares y verdades que dependen de fecha, jurisdicción o rol.

¿Podemos seguir usando nuestro proveedor actual?

Sí. Normalmente el problema no es la marca, sino el sistema completo. Trabajamos de forma agnóstica al proveedor: mejoramos calidad, control y operación sobre el stack que ya tienes, o te ayudamos a decidir cambios con evidencia.

¿Por qué mi demo funcionaba bien pero producción es un desastre?

Porque las demos usan datos limpios y preguntas predecibles. En producción, el ruido de los documentos reales y la ambigüedad de los usuarios confunden al modelo. La ingeniería de demo es muy distinta de la ingeniería de producción.

¿Es necesario tirar todo lo que hemos construido?

Raramente. Solemos reutilizar la infraestructura, pero rediseñamos la lógica de ingesta y la estrategia de recuperación. A menudo el problema no es la herramienta, sino cómo se ha configurado.

¿Cómo garantizáis que no haya alucinaciones?

En IA generativa el riesgo cero no existe, pero lo mitigamos con verificaciones de groundedness, en las que el modelo comprueba su propia respuesta contra la fuente, y forzando al sistema a responder que no lo sabe si la evidencia es débil. Preferimos el silencio al error.

¿Qué pasa con la seguridad de mis datos confidenciales?

No inyectamos documentos en el contexto de forma indiscriminada. Aplicamos filtrado de permisos antes de la búsqueda vectorial: si el usuario no tiene acceso a un documento, el sistema ni siquiera lo ve para esa consulta.

Tu sistema RAG puede ser un activo o un coste hundido.

La diferencia es la arquitectura. Cuéntanos qué construiste y te diremos, con honestidad, qué falla y cómo arreglarlo.

hola@humanizinginternet.com

Post-mortem

Analizamos tu sistema actual, modelo de negocio y producto para explicarte los puntos de fallo.

Roadmap

Un plan paso a paso, con quick wins, hacia una arquitectura híbrida o agéntica escalable y estable.

Validación

Pipelines de evaluación implementados para que nunca vuelvas a volar a ciegas.