¿Cansado de pagar suscripciones caras por cada token que procesa tu IA o de preocuparte porque tus documentos confidenciales viajan a servidores en el exterior? Hoy te voy a mostrar cómo montar un sistema RAG local n8n Ollama Qdrant sin API, una combinación poderosa que te permite crear chatbots inteligentes usando tus propios documentos sin enviar ni un solo byte a la nube. Es la solución perfecta para empresas que manejan datos sensibles, desarrolladores que quieren experimentar sin límites de rate o simplemente para quienes buscan independizarse de los grandes proveedores de IA. Lo mejor es que una vez configurado, funciona en tu máquina sin costos recurrentes y con total soberanía sobre la información. En esta guía te llevo de la mano desde la instalación hasta tener tu primer flujo conversacional funcionando, explicando cada paso sin asumir que sos experto en infraestructura.

¿Qué es RAG local n8n Ollama Qdrant sin API?

Antes de meternos en la parte técnica, desmenucemos este concepto que suena complicado pero es más sencillo de lo que parece. RAG son las siglas de Retrieval-Augmented Generation (Generación Aumentada por Recuperación). En criollo: es una técnica donde tu IA primero busca información relevante en tus documentos y luego genera respuestas basadas en ese contexto específico, no en lo que «recordó» durante su entrenamiento.

El «local» significa que todo ocurre dentro de tu computadora o servidor privado. No hay llamadas a OpenAI, Anthropic ni Google. N8n actúa como el orquestador visual donde diseñas los flujos de trabajo, Ollama se encarga de ejecutar modelos de lenguaje (LLMs) como Llama, Mistral o DeepSeek directamente en tu hardware, y Qdrant funciona como la base de datos vectorial donde se almacenan los «embeddings» (representaciones numéricas del significado de tus textos) para buscar similitudes semánticas.

La magia está en el «sin API». Mientras que la mayoría de tutoriales te enseñan a conectar n8n con ChatGPT o Claude mediante claves API, aquí todo se comunica mediante URLs locales (localhost). Tus documentos nunca salen de tu red, no hay latencia por viajes al exterior, y no tenés que validar tarjetas de crédito para obtener keys. Es soberanía tecnológica pura.

¿Qué es RAG local n8n Ollama Qdrant sin API?

Requisitos y preparación del entorno

Antes de arrancar, necesitás asegurarte de que tu máquina puede con el peso de correr modelos locales. No hace falta una supercomputación, pero tampoco vas a poder usar una netbook del 2010 sin frustrarte.

Hardware y software necesario

Para una experiencia fluida, te recomiendo al menos 16GB de RAM (aunque con 8GB podés probar modelos pequeños) y un procesador moderno. Si tenés una GPU de NVIDIA con CUDA, mejor que mejor, porque acelera muchísimo la inferencia. Si no, no te preocupes: los CPUs modernos con aceleración AVX2 también funcionan bien para modelos de 7B parámetros.

En cuanto al sistema operativo, podés hacer esto en Windows, macOS o Linux. En Windows recomiendo usar WSL2 (Windows Subsystem for Linux) porque Ollama corre más estable ahí que en la versión nativa, aunque la instalación directa también funciona. Necesitás tener instalado Docker porque Qdrant corre en un contenedor, y obviamente una instancia de n8n funcionando. Si aún no tenés n8n corriendo localmente, podés instalarlo vía Docker también para mantener todo homogéneo.

Los tres componentes principales que vamos a instalar son:

1. Ollama: El motor que descarga y ejecuta los modelos locales 2. Qdrant: La base de datos vectorial donde indexaremos los documentos 3. n8n: La plataforma de automatización donde armamos el flujo RAG

Asegurate de tener puertos libres como el 11434 (Ollama), 6333 (Qdrant) y 5678 (n8n) para evitar conflictos.

Requisitos y preparación del entorno

Paso a paso: Configurando RAG local n8n Ollama Qdrant sin API

Ahora sí, manos a la obra. Vamos a levantar cada componente y hacer que se hablen entre ellos. Tomate tu tiempo en cada paso porque la base es lo más importante.

Instalación y configuración de Ollama

Primero descargá Ollama desde su sitio oficial e instalalo según tu sistema. Una vez instalado, abrí una terminal y ejecutá `ollama pull llama3.2` (o el modelo que prefieras como mistral o qwen2.5). Este comando descarga el modelo a tu máquina. Dependiendo de tu conexión, puede tardar unos minutos porque son archivos de varios gigas.

Cuando termine la descarga, probalo ejecutando `ollama run llama3.2` y hacé una pregunta de prueba. Si respondió, ya tenés el motor de IA funcionando. Para que n8n pueda comunicarse con Ollama, necesitás que esté corriendo en modo servidor. Cerrá la sesión anterior con `/bye` y ejecutá `ollama serve`. En Windows a veces est

Paso a paso: Configurando RAG local n8n Ollama Qdrant sin API

Deja un comentario