Lección
Qué es RAG y por qué importa
Retrieval-Augmented Generation explicado de forma simple, con un ejemplo mínimo de código y cuándo conviene usarlo.
RAG (Retrieval-Augmented Generation) es una de las técnicas más útiles para construir aplicaciones de IA fiables. La idea es sencilla: en lugar de confiar solo en lo que el modelo "recuerda", le damos contexto recuperado de tus propios datos antes de que responda.
El problema
Un modelo de lenguaje no conoce tus documentos internos ni la información que cambia cada día. Si le preguntas por ellos, se lo inventa (alucina). RAG resuelve esto buscando la información relevante y pasándosela al modelo.
Cómo funciona RAG
- Embeddings: conviertes tus textos en vectores numéricos.
- Recuperación: ante una pregunta, buscas los fragmentos más parecidos.
- Generación: el modelo responde usando solo ese contexto recuperado.
El paso que decide si tu RAG funciona es el 2. Juega con él: pregunta, mira qué fragmentos se recuperan y con qué puntuación, y mueve el top-k para ver cómo cambia el contexto que recibiría el modelo.
- #133%✓ contexto
Los tokens de salida suelen costar de 3 a 4 veces más que los de entrada; pedir respuestas más cortas es la optimización de coste más fácil.
fuente: cuanto-cuesta-la-ia
- #433%✓ contexto
Un token es la unidad mínima que procesa un modelo de lenguaje: trozos de palabra, no letras ni palabras enteras.
fuente: que-es-un-token
- #633%
La ventana de contexto es la cantidad máxima de tokens que el modelo puede tener en cuenta a la vez; si te pasas, se trunca.
fuente: glosario
- #20%
La temperatura controla la aleatoriedad de la generación: cerca de 0 es determinista y conservador; alta, más diverso y caótico.
fuente: glosario
- #30%
Las Noticias salen cada día con lo importante, verificado contra su fuente por un pipeline anti-alucinación.
fuente: noticias
- #50%
Una alucinación es una respuesta plausible pero falsa, dicha con total seguridad; fluido no es lo mismo que correcto.
fuente: cuando-la-ia-alucina
- #70%
MaitreAI atiende reservas por WhatsApp y voz en un restaurante real de Bilbao.
fuente: como-hice-maitreai
- #80%
El curso interactivo de IA tiene lecciones en orden, gratis y sin registro, con el progreso guardado en tu navegador.
fuente: empieza-aqui
Lo que recibiría el modelo
Responde solo con el contexto. Contexto: [1] Los tokens de salida suelen costar de 3 a 4 veces más que los de entrada; pedir respuestas más cortas es la optimización de coste más fácil. [4] Un token es la unidad mínima que procesa un modelo de lenguaje: trozos de palabra, no letras ni palabras enteras. Pregunta: ¿Cuánto cuestan los tokens?
Un ejemplo mínimo
from openai import OpenAI
client = OpenAI()
def answer(question: str, context: str) -> str:
prompt = f"Responde solo con el contexto.\n\nContexto:\n{context}\n\nPregunta: {question}"
res = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": prompt}],
)
return res.choices[0].message.contentEl truco está en context: ahí va lo que recuperaste de tus datos, no todo
internet.
Cuándo usarlo
Usa RAG cuando necesites respuestas ancladas en información específica y verificable (documentación, catálogos, normativa). Si solo necesitas redacción genérica, quizá no haga falta. La regla de oro: menos alucinación, más control.
Por dónde seguir
Aprender
Entiende la IA tocándola
Un itinerario en orden, de los tokens a medir un sistema. Gratis, sin cuenta, y el progreso se guarda en tu navegador.
▸ Ver el itinerarioAplicarlo
¿Tienes un proceso que se come las horas?
Leer correos, sacar datos de documentos, tareas que alguien repite a mano cada día. Cuéntame cuál es y te digo qué haría yo — a veces la respuesta es que la IA no ayuda.
▸ Contarme tu casoEscribirme
O simplemente responde
Si algo de aquí te ha servido, o te ha parecido mal, quiero saberlo. Lo leo yo y cambia lo que publico.
▸ info@ianexora.com