Kata Ivanovych

Lección

Qué es RAG y por qué importa

Retrieval-Augmented Generation explicado de forma simple, con un ejemplo mínimo de código y cuándo conviene usarlo.

Kata Ivanovych
Publicado el 1 min de lectura

RAG (Retrieval-Augmented Generation) es una de las técnicas más útiles para construir aplicaciones de IA fiables. La idea es sencilla: en lugar de confiar solo en lo que el modelo "recuerda", le damos contexto recuperado de tus propios datos antes de que responda.

El problema

Un modelo de lenguaje no conoce tus documentos internos ni la información que cambia cada día. Si le preguntas por ellos, se lo inventa (alucina). RAG resuelve esto buscando la información relevante y pasándosela al modelo.

Cómo funciona RAG

  1. Embeddings: conviertes tus textos en vectores numéricos.
  2. Recuperación: ante una pregunta, buscas los fragmentos más parecidos.
  3. Generación: el modelo responde usando solo ese contexto recuperado.

El paso que decide si tu RAG funciona es el 2. Juega con él: pregunta, mira qué fragmentos se recuperan y con qué puntuación, y mueve el top-k para ver cómo cambia el contexto que recibiría el modelo.

RAG · recuperación
2
  • #133%✓ contexto

    Los tokens de salida suelen costar de 3 a 4 veces más que los de entrada; pedir respuestas más cortas es la optimización de coste más fácil.

    fuente: cuanto-cuesta-la-ia

  • #433%✓ contexto

    Un token es la unidad mínima que procesa un modelo de lenguaje: trozos de palabra, no letras ni palabras enteras.

    fuente: que-es-un-token

  • #633%

    La ventana de contexto es la cantidad máxima de tokens que el modelo puede tener en cuenta a la vez; si te pasas, se trunca.

    fuente: glosario

  • #20%

    La temperatura controla la aleatoriedad de la generación: cerca de 0 es determinista y conservador; alta, más diverso y caótico.

    fuente: glosario

  • #30%

    Las Noticias salen cada día con lo importante, verificado contra su fuente por un pipeline anti-alucinación.

    fuente: noticias

  • #50%

    Una alucinación es una respuesta plausible pero falsa, dicha con total seguridad; fluido no es lo mismo que correcto.

    fuente: cuando-la-ia-alucina

  • #70%

    MaitreAI atiende reservas por WhatsApp y voz en un restaurante real de Bilbao.

    fuente: como-hice-maitreai

  • #80%

    El curso interactivo de IA tiene lecciones en orden, gratis y sin registro, con el progreso guardado en tu navegador.

    fuente: empieza-aqui

Lo que recibiría el modelo

Responde solo con el contexto.

Contexto:
[1] Los tokens de salida suelen costar de 3 a 4 veces más que los de entrada; pedir respuestas más cortas es la optimización de coste más fácil.
[4] Un token es la unidad mínima que procesa un modelo de lenguaje: trozos de palabra, no letras ni palabras enteras.

Pregunta: ¿Cuánto cuestan los tokens?
Pregunta, mira qué fragmentos se recuperan y con qué puntuación — y cómo cambia el contexto que recibiría el modelo al mover el top-k. La similitud aquí es léxica (coincidencia de términos), calculada en tu navegador; en producción la calcula un embedding sobre el significado. Los fragmentos son frases reales de este sitio.

Un ejemplo mínimo

from openai import OpenAI
 
client = OpenAI()
 
def answer(question: str, context: str) -> str:
    prompt = f"Responde solo con el contexto.\n\nContexto:\n{context}\n\nPregunta: {question}"
    res = client.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": prompt}],
    )
    return res.choices[0].message.content

El truco está en context: ahí va lo que recuperaste de tus datos, no todo internet.

Cuándo usarlo

Usa RAG cuando necesites respuestas ancladas en información específica y verificable (documentación, catálogos, normativa). Si solo necesitas redacción genérica, quizá no haga falta. La regla de oro: menos alucinación, más control.

Por dónde seguir

  • Aprender

    Entiende la IA tocándola

    Un itinerario en orden, de los tokens a medir un sistema. Gratis, sin cuenta, y el progreso se guarda en tu navegador.

    Ver el itinerario
  • Aplicarlo

    ¿Tienes un proceso que se come las horas?

    Leer correos, sacar datos de documentos, tareas que alguien repite a mano cada día. Cuéntame cuál es y te digo qué haría yo — a veces la respuesta es que la IA no ayuda.

    Contarme tu caso
  • Escribirme

    O simplemente responde

    Si algo de aquí te ha servido, o te ha parecido mal, quiero saberlo. Lo leo yo y cambia lo que publico.

    info@ianexora.com