Subir archivos no es enseñar: cómo crear una base consultable que también sabe decir «no encontré»
La unidad de trabajo no debería ser «todos mis archivos», sino un corpus pequeño, autorizado, vigente y recuperable que pueda someterse a una prueba concreta.
La respuesta a una duda operativa suele estar en algún procedimiento, manual o nota. El problema es encontrarla sin depender de la memoria, releer todo o preguntarle otra vez a la misma persona.
Ante esa fricción aparece un atajo tentador: cargar una carpeta completa en una herramienta de IA y esperar que «aprenda el negocio». Pero cargar no es enseñar.
Una base consultable funciona de otra manera. El sistema busca información en un conjunto separado de documentos y aporta fragmentos relevantes como contexto para responder [C1]. Algunas implementaciones combinan búsqueda por significado y por palabras, y muestran citas a los archivos [C2]. Eso no reentrena al modelo, no demuestra que comprenda el negocio y no garantiza exactitud.
La unidad de trabajo no debería ser «todos mis archivos», sino un corpus pequeño, autorizado, vigente y recuperable que pueda someterse a una prueba concreta.
Empieza por la pregunta, no por la carpeta
Define primero una duda recurrente:
¿Qué pasos indica este procedimiento para recibir y cerrar una solicitud?
La pregunta delimita qué documentos hacen falta y cuáles sobran. Para una primera prueba, elige entre una y tres fuentes de 3 a 10 páginas en total. Usa sólo material ficticio, público o expresamente autorizado.
Excluye PII, credenciales, contratos, datos de clientes, secretos comerciales y documentos internos cuya autorización o política de retención no conozcas. Mantén fuera de esta práctica cualquier decisión sobre personas, dinero, seguridad, salud o legalidad.
Más archivos pueden sumar versiones vencidas, contradicciones, ruido y una superficie de acceso mayor. El corpus inicial debe ser deliberado, no exhaustivo.
Registra la autoridad de cada fuente
Antes de cargar, anota por documento:
- dueño;
- permiso de uso;
- versión o fecha;
- vigencia y próxima revisión;
- propósito dentro de la base;
- quién puede acceder;
- retención, reemplazo y borrado.
Si no puedes reconocer alguno de esos elementos, la fuente todavía no está lista. Los documentos recuperados forman parte de la superficie de seguridad: importan sus permisos, procedencia, integridad, aislamiento, atribución y ciclo de vida [C4].
Una herramienta es apta para esta prueba sólo si permite identificar la fuente, respeta el acceso al corpus y ofrece reglas conocidas de retención y borrado compatibles con el material. Si no puedes comprobarlo, usa otra herramienta o un corpus ficticio.
Recuperación no es entrenamiento
La recuperación aporta fragmentos como contexto para una consulta [C1]. El contenido sigue viviendo en un corpus separado. No se convierte en memoria permanente ni prueba aprendizaje o comprensión.
Algunas implementaciones organizan documentos por capítulos, temas o referencias consultables [C5]. Esa posibilidad técnica no demuestra que una estructura funcione mejor para cualquier corpus, ni que reduzca universalmente costo, tokens, errores o mantenimiento.
La frontera práctica es ésta:
- consultar: recuperar un fragmento y mostrar una respuesta para revisión;
- ejecutar: usar esa respuesta para cambiar un registro, enviar un mensaje, aprobar algo o afectar a una persona.
Este primer ejercicio llega sólo hasta la consulta. No incluye agentes, integraciones, automatizaciones, acciones privilegiadas ni decisiones basadas en la respuesta.
Prepara cinco preguntas antes de ver los resultados
Diseñar la prueba por adelantado evita adaptar el criterio a lo que la herramienta ya respondió. Incluye:
- una pregunta directa cuya respuesta aparezca en una sección;
- una pregunta que relacione dos fragmentos;
- una pregunta sobre una excepción, condición o límite;
- una pregunta sobre versión, fecha o responsable;
- una pregunta cuya respuesta no esté en el corpus.
La quinta pregunta es obligatoria. Una base útil no sólo recupera información: también debe permitir reconocer cuándo las fuentes no alcanzan.
Una cita orienta; no verifica
Abre el fragmento original para cada respuesta y comprueba:
- que sostenga la afirmación;
- que pertenezca a la versión vigente;
- que conserve alcance, condiciones y excepciones;
- que la respuesta no complete vacíos con información ausente.
Clasifica el resultado como:
- correcta: coincide con el documento y permite ubicar el fragmento;
- parcial: una parte está respaldada, pero falta alcance, condición o información;
- no encontrada: el corpus no contiene evidencia suficiente y la respuesta reconoce el límite.
Cargar documentos no garantiza respuestas correctas, completas ni vigentes [C3]. Por eso la revisión se hace contra la fuente original, no contra la fluidez del texto ni contra la mera presencia de una cita.
Mantener, corregir o retirar
Al terminar las cinco verificaciones, toma una decisión explícita.
Mantener: el corpus responde dentro del propósito definido, identifica fuentes y reconoce el caso ausente. La revisión humana sigue siendo obligatoria.
Corregir: hay versiones superadas, permisos incompletos, fragmentos ambiguos o respuestas parciales. Ajusta el corpus y repite las mismas cinco preguntas.
Retirar: no puedes sostener permisos, procedencia, vigencia, acceso o borrado; apareció material indebido; o la base responde con seguridad cuando las fuentes no contienen la respuesta.
Cierra con un responsable de vigencia, una fecha de revisión, eventos que obliguen a actualizar y un procedimiento de reemplazo y borrado. Sin mantenimiento, documentos viejos pueden convertirse en respuestas nuevas.
La prueba mínima
Elige un procedimiento público, ficticio o autorizado. Registra de una a tres fuentes y diseña cinco preguntas, incluida una ausente. Verifica cada respuesta contra el fragmento original y decide si la base se mantiene, se corrige o se retira.
El objetivo no es subir más. Es construir un corpus que puedas gobernar y una consulta que pueda decir, con claridad, «esto no está en la base».
Fuentes y alcance
- [C1] NIST, “retrieval-augmented generation”: https://csrc.nist.gov/glossary/term/retrieval_augmented_generation
- [C2] OpenAI, “File search”: https://developers.openai.com/api/docs/guides/tools-file-search — capacidad de esa implementación; no se generaliza a todas las herramientas.
- [C3] NIST y OWASP: recuperar contexto no garantiza exactitud, completitud ni vigencia.
- [C4] OWASP, LLM08:2025 y RAG Security Cheat Sheet: https://genai.owasp.org/llmrisk/llm082025-vector-and-embedding-weaknesses y https://cheatsheetseries.owasp.org/cheatsheets/RAG_Security_Cheat_Sheet.html
- [C5]
book-to-skill, “How it works”: https://github.com/virgiliojr94/book-to-skill/blob/master/docs/how-it-works.md — capacidad de esa implementación, no evidencia de efectividad universal.