¿Qué es RAG y en qué se diferencia de subir mis archivos a ChatGPT?
RAG es un patrón: en lugar de que el modelo responda con lo que "recuerda" de su entrenamiento, primero se busca en tus documentos, se recuperan los fragmentos relevantes y solo entonces el modelo redacta con esa evidencia. El flujo tiene cinco pasos: ingesta (leer el documento), fragmentación o chunking (partirlo), embeddings (convertir cada fragmento en un vector), recuperación (buscar lo que responde la pregunta) y generación con citas.
Subir archivos a una conversación resuelve un análisis puntual. Un RAG empresarial resuelve un servicio que opera todos los días. La diferencia no es la calidad de la redacción, es el control:
| Aspecto | Subir archivos a una conversación | RAG empresarial |
|---|---|---|
| Actualización | Normalmente manual, por conversación o proyecto | Sincroniza fuentes y reindexa cambios |
| Fuentes | Los archivos que el usuario eligió | Repositorios, bases documentales, sistemas internos y APIs |
| Permisos | Dependen del producto y del espacio de trabajo | Se diseñan por usuario, grupo, área, cliente o clasificación |
| Recuperación | Trabaja con el contexto de la sesión | Recupera fragmentos relevantes en cada consulta |
| Trazabilidad | Puede ser limitada | Registra documento, fragmento, versión y consulta |
| Operación | Personal o de un departamento | Servicio integrado al entorno de trabajo |
Lo que más se subestima es el control de versiones. Si alguien subió el manual de crédito de 2024 a una conversación, ese archivo se queda ahí y nadie sabe que ya se derogó. En un RAG bien hecho, el fragmento obsoleto se marca y deja de recuperarse.
También conviene aclarar qué no es RAG. No es entrenar ni afinar un modelo con tus datos (eso resuelve estilo y formato, no conocimiento cambiante). Y no garantiza por sí solo que el modelo nunca invente: para eso se necesitan instrucciones de abstención, evidencia bien recuperada, validaciones y evaluación con preguntas reales de tu empresa.
¿Qué procesos de mi empresa justifican un RAG y cuáles no?
La prueba rápida es esta: si la respuesta está en un párrafo escrito por un humano, RAG es buen camino. Si está en una celda de una base de datos, no.
Casos donde normalmente se justifica:
- Consulta interna de políticas, procedimientos y manuales, sobre todo cuando cambian.
- Mesa de ayuda interna: sistemas, recursos humanos, viáticos, compras.
- Soporte técnico que depende de la versión del producto.
- Atención a clientes con contratos, fichas técnicas y documentación autorizada.
- Búsqueda de cláusulas, obligaciones, fechas y excepciones contractuales.
- Consulta de expedientes con permisos por cliente o cuenta.
- Asistencia a ventas con información vigente de productos y precios.
- Inducción de nuevo personal sobre procedimientos operativos.
Casos donde recomendamos no hacerlo:
- Consultas aisladas sobre pocos documentos estáticos: un buscador de archivos alcanza.
- Preguntas sobre datos estructurados ("cuánto vendimos en agosto en la sucursal Apodaca"). Eso lo responde mejor y más barato un reporte del ERP o un tablero.
- Cálculos contables, financieros o transaccionales exactos sin conexión a los sistemas fuente.
- Muy pocos usuarios, donde el costo de integración supera el beneficio.
- Procesos que exigen una respuesta determinista y no toleran interpretación lingüística sin una capa de reglas o validación encima.
El error más común al plantear estos proyectos es querer que el asistente responda "cuál es el saldo del cliente X". Eso no es RAG documental, es una consulta a tu sistema, y lo que corresponde es un agente con acceso a herramientas y APIs, un tema distinto que tratamos en agentes de IA para empresas. Muchos proyectos terminan siendo mixtos: RAG para documentos y llamadas al ERP para números.
¿Por qué la búsqueda solo vectorial falla y para qué sirve la híbrida?
La búsqueda vectorial convierte la pregunta y los fragmentos en vectores y recupera lo semánticamente parecido. Es excelente para "¿cómo se tramita una devolución?" aunque el documento diga "proceso de retorno de mercancía". Y es mala precisamente en lo que más se pregunta en una empresa mexicana: identificadores.
Ejemplos donde la similitud semántica traiciona:
- "Contrato MX-4817" contra "Contrato MX-4187". Para un vector son casi idénticos.
- "Versión 3.2" contra "Versión 3.1".
- Un RFC, un folio de póliza, un número de factura, un SKU, una clave de producto y servicio del SAT.
- Una negación, una excepción o una condición contractual ("salvo que el cliente…").
- Una fecha de vigencia específica.
La búsqueda híbrida combina recuperación vectorial con búsqueda léxica por palabras clave, de modo que atiende al mismo tiempo la intención conceptual y la coincidencia exacta. Casi toda pregunta empresarial real es mixta: "¿cuál es el procedimiento de devolución para el SKU-742 en la versión 2026?" tiene una parte conceptual y dos restricciones exactas.
En ARIA, nuestro motor propio, la búsqueda es híbrida por diseño: texto completo más búsqueda semántica con pgvector. La usamos internamente como memoria de conocimiento del equipo, para consultar decisiones y documentación, y es la base de Cítalo (citalo.ai), nuestro asistente que responde con los documentos y datos del negocio, hoy operando con dos clientes.
Si estás evaluando proveedores, esta es una pregunta de filtro: "¿su recuperación es solo vectorial o híbrida?". Si es solo vectorial, pídeles una demostración buscando un número de parte de tu catálogo. El resultado suele decidir la conversación.
¿Cómo preparo mis documentos: chunking, metadatos y control de versiones?
Aquí se gana o se pierde el proyecto. El modelo es intercambiable; tu corpus, no.
- Chunking. Fragmentos suficientemente pequeños para devolver una sección concreta y suficientemente amplios para conservar contexto. Corta por secciones, artículos o cláusulas antes de cortar por número de caracteres, y deja un solape para que una idea partida a la mitad no pierda sentido.
- Metadatos obligatorios. Título, área propietaria, tipo de documento, cliente, idioma, fecha de emisión, fecha de vigencia, versión, clasificación y permisos. Sin vigencia y versión no puedes evitar que el asistente cite una política derogada.
- Estructura. Preserva encabezados, tablas, listas, notas, anexos y referencias cruzadas durante la extracción. Una tabla de tarifas que pierde sus columnas se convierte en una línea de números sin significado.
- Calidad. Revisa OCR, caracteres especiales, encabezados repetidos, columnas mezcladas y páginas sin texto extraíble. Un PDF escaneado sin capa de texto no existe para el índice, aunque lo veas perfecto en pantalla.
- Reindexación. Debe activarse cuando un documento se crea, se modifica, se elimina o cambian sus permisos. Si es manual, el asistente empieza a responder con material vencido en pocas semanas.
Decisión previa que casi nadie toma a tiempo: quién es el dueño del documento. Si nadie en la empresa es responsable de marcar una política como derogada, ningún RAG te va a salvar. Es un problema de gobierno documental, no de tecnología.
¿No sabes si esto aplica a tu empresa? Haz el diagnóstico gratuito de 3 minutos.
¿Cómo evito que el asistente vea documentos que ese usuario no debería ver?
El error más caro es filtrar permisos en el prompt: pedirle al modelo "no muestres información de nóminas a quien no sea de recursos humanos". Eso no es un control de acceso, es una sugerencia. Si el fragmento llegó al contexto, la información ya se expuso al sistema generativo y basta una pregunta creativa para sacarla.
Los permisos se aplican en la recuperación, no después de generar la respuesta. El flujo correcto:
- Identificar al usuario y sus grupos con la autenticación real de la empresa.
- Traducir esa identidad a filtros de acceso.
- Recuperar únicamente fragmentos autorizados para ese usuario.
- Mantener esos filtros también en la parte léxica de la búsqueda híbrida y en el reordenamiento. Es el hueco típico: el filtro se aplica al vector y se olvida en el texto completo.
- Evitar que documentos restringidos entren en cachés compartidas.
- Registrar intentos de acceso y resultados bloqueados, y revocar permisos cuando cambia la fuente original.
Por eso el índice debe conservar atributos de usuario, área, cliente, clasificación, vigencia y nivel de confidencialidad a nivel de fragmento, no solo de archivo. Un contrato puede ser visible para ventas en su parte comercial y restringido en su anexo de precios.
Qué revisar antes de conectar recursos humanos, legal o finanzas: prueba con al menos tres usuarios de distinto perfil y un juego de documentos de distinta clasificación, y verifica en la bitácora qué fragmentos se recuperaron en cada caso. Si el proveedor no te puede mostrar esa bitácora, no conectes esas áreas.
¿Cómo garantizo trazabilidad y que no invente respuestas?
Con tres cosas: citas, abstención y registro. Un RAG que responde sin decir de dónde salió la respuesta no lo va a aceptar tu área legal ni tu auditor, y tienen razón.
Lo que debe existir para que sea auditable:
- Respuesta con cita interna: documento, sección, página o identificador de fragmento, con enlace al original.
- Regla explícita de abstención: cuando no hay evidencia suficiente, la respuesta correcta es "no encontré esto en la documentación". Es más valioso un asistente que se calla que uno que adivina.
- Separación visible entre hechos recuperados e inferencias del modelo.
- Registro por consulta de la pregunta, los fragmentos recuperados y sus identificadores, las puntuaciones, la versión del índice, la versión de cada fuente, el modelo usado y la respuesta generada. Sin eso no puedes auditar qué evidencia recibió el modelo.
- Evaluación con preguntas reales del negocio, incluidas preguntas sin respuesta en el corpus, para medir si el asistente se abstiene cuando debe.
- Revisión humana en procesos regulados y monitoreo de respuestas sin citas, contradicciones y documentos obsoletos.
Criterio propio: antes de liberar a toda la empresa, armen un conjunto de preguntas que la gente pregunta de verdad —digamos, entre 50 y 100, es un supuesto de trabajo, no un estándar— con su respuesta correcta validada por el dueño del proceso, y que incluya una porción de preguntas sin respuesta posible. Ese conjunto es su contrato de calidad: cada vez que cambien modelo, chunking o corpus, se vuelve a correr.
¿Cuánto cuesta montar y operar un RAG en México?
Separa dos cosas: el proyecto y la operación mensual.
El proyecto incluye diseño de arquitectura e integración, limpieza y extracción documental, embeddings e indexación, base vectorial o motor de búsqueda, almacenamiento y observabilidad, desarrollo de autenticación y permisos, evaluación y pruebas de seguridad. En un proyecto de RAG el trabajo pesado está en la ingesta documental y en los permisos, no en conectar el modelo. No publicamos tarifas en el blog; si quieres el rango, revisa la página de servicios de IA y automatización y lo cotizamos con tu corpus real.
La operación mensual sí la puedes estimar tú. Un RAG separa dos operaciones con costos distintos: la indexación (leer, fragmentar y generar embeddings, que se paga fuerte una vez y luego solo por cambios) y la consulta (buscar, reordenar y generar la respuesta, que se paga cada vez).
Precio de lista por 1 millón de tokens de entrada, según la página de modelos de OpenAI consultada en septiembre de 2026:
| Modelo | USD por millón de tokens de entrada |
|---|---|
| GPT-5 mini | 0.25 |
| GPT-5 | 1.25 |
Para los modelos equivalentes de Anthropic y Google, los precios que circulan en agregadores de terceros consultados en septiembre de 2026 ubican la entrada estándar aproximadamente entre USD 0.30 y USD 2.00 por millón de tokens, y la salida varias veces por encima de la entrada. No publicamos aquí nombres de versión ni cifras exactas de esos proveedores porque las tarifas y la nomenclatura cambian rápido: verifícalas en la página oficial de precios del proveedor antes de contratar.
La fórmula del componente de entrada:
costo mensual = (consultas al mes × tokens de entrada por consulta ÷ 1,000,000) × precio por millón
Supongamos, solo para ilustrar el orden de magnitud, 8,000 consultas al mes y 6,000 tokens de entrada por consulta (la pregunta más los fragmentos recuperados). Son 48 millones de tokens: con GPT-5 mini a USD 0.25 serían USD 12; con GPT-5 a USD 1.25, USD 60. El volumen y los tokens por consulta son un supuesto nuestro; el precio por millón sí es público.
Antes de presupuestar con esa cuenta: falta la salida, que casi siempre es más cara por token que la entrada, y faltan embeddings, almacenamiento, búsquedas, caché, procesamiento por lotes, infraestructura e impuestos. Además, los precios publicados distinguen cada vez más entre entrada estándar, entrada en caché, lotes y salida, así que un solo número por modelo no representa tu costo real. El criterio práctico: el gasto de tokens rara vez es el problema; el problema es el tiempo de personas para curar documentos. Ese panorama más amplio lo tratamos en IA y automatización para empresas mexicanas.
¿Compro una plataforma o lo construyo a medida?
| Criterio | Plataforma | A medida |
|---|---|---|
| Tiempo inicial | Menor | Mayor |
| Integraciones estándar | Habitualmente disponibles | Se desarrollan |
| Control sobre recuperación y permisos | Variable | Alto |
| Personalización | Limitada por el producto | Amplia |
| Operación | Del proveedor | Interna o del integrador |
| Procesos regulados | Depende del aislamiento, auditoría y residencia de datos | Se puede diseñar a la medida |
| Costo inicial | Suscripción o consumo | Desarrollo e infraestructura |
Una plataforma tiene sentido para un piloto, fuentes relativamente estándar y permisos simples (todos ven todo, o dos o tres grupos). Construir a medida —o usar un producto como Cítalo, que corre sobre nuestro motor ARIA RAG— tiene sentido cuando hay permisos complejos, varios sistemas de origen, requisitos de auditoría, flujos transaccionales o necesidad de controlar por completo la recuperación. Si tu empresa ya vive en Salesforce, vale comparar primero contra las capacidades nativas de la plataforma, que revisamos en Agentforce y los agentes de IA de Salesforce; y si el conocimiento debe salir hacia el cliente, el mismo corpus puede alimentar un canal de atención, como explicamos en chatbot de WhatsApp con IA integrado a CRM y ERP.
Preguntas para no quedar atado al modelo de datos de un proveedor:
- ¿La recuperación es híbrida o solo vectorial?
- ¿Los permisos se aplican en el índice, por fragmento, y también en la parte léxica y el reordenamiento?
- ¿Puedo exportar mi corpus, sus metadatos y el historial de consultas si me voy?
- ¿Dónde residen los datos y mis documentos se usan para entrenar modelos? ¿Está por escrito?
- ¿Me entregas la bitácora de qué fragmentos se recuperaron en cada respuesta?
- ¿Qué pasa cuando se deroga una política: hay versión y vigencia por fragmento?
Si la plataforma es de código abierto, pregunta explícitamente qué funciones quedan en la edición comunitaria y cuáles requieren la edición comercial. Los permisos finos, la auditoría y el control de acceso suelen estar del lado de pago, y eso cambia el presupuesto por completo.
¿Cómo se ve un proyecto realista y qué mido a las 6 semanas?
Seis semanas alcanzan para un piloto honesto, no para cubrir toda la empresa. Un orden razonable:
- Semanas 1 y 2: elegir un proceso, usuarios, fuentes y métricas; definir las preguntas de prueba; inventariar documentos, permisos, versiones y problemas de extracción.
- Semanas 3 y 4: construir ingesta, chunking, metadatos, embeddings y búsqueda híbrida; integrar el modelo, las citas, la abstención, la autenticación y los filtros de acceso.
- Semana 5: probar exactitud, recuperación, permisos, latencia, costos y documentos obsoletos.
- Semana 6: piloto con usuarios reales, comparación contra el proceso actual y decisión de escalar o no.
Seis métricas al cierre bastan para decidir: porcentaje de preguntas con evidencia correcta, porcentaje de respuestas con citas válidas, tasa de abstención correcta en preguntas sin respuesta, incidentes de exposición de documentos, costo por consulta y por usuario activo, y resolución o satisfacción en el proceso elegido.
Señales tempranas de que el proyecto va mal:
- Nadie en el negocio quiere validar las respuestas correctas del conjunto de pruebas. Sin dueño del proceso, no hay proyecto.
- Una parte importante de los PDF no tiene texto extraíble y nadie asigna presupuesto de OCR.
- El equipo discute cuál modelo usar en la semana uno, antes de haber inventariado los documentos.
- La respuesta llega correcta pero sin cita, y se acepta "por ahora".
- Los usuarios dejan de preguntar en la semana dos. La adopción es el indicador más honesto.
Fuentes
- OpenAI, GPT-5 Model — https://developers.openai.com/api/docs/models/gpt-5
- BenchLM, Claude API Pricing (September 2026) — https://benchlm.ai/anthropic/api-pricing
- BenchLM, Gemini API Pricing (September 2026) — https://benchlm.ai/google/api-pricing
- Our Code World, Google Gemini API Pricing 2026: Flash, Pro, and the Costs — https://ourcodeworld.com/articles/read/4598/google-gemini-api-pricing-2026-flash-pro-and-the-costs
- G2, OpenAI API Pricing: A Complete Breakdown for 2026 — https://www.g2.com/articles/openai-api-pricing
- G2, Claude API Pricing: A Complete Guide for 2026 — https://www.g2.com/articles/claude-api-pricing
Si quieres que revisemos tu corpus y te digamos si conviene RAG o un reporte, empieza por el diagnóstico de IA y de ahí definimos el alcance en servicios de IA y automatización.
