Los 5 errores que cometen los novatos al montar IA local en su propio ordenador (y cómo evitarlos)

La promesa es tentadora: tu propio asistente de IA corriendo en tu ordenador, sin suscripciones, sin nube y sin que tus datos salgan de casa. En 2026 la infraestructura ya es madura —herramientas gratuitas como Ollama o LM Studio lo permiten en minutos—. Pero el camino de ida está sembrado de tropiezos que hacen que mucha gente desista a los pocos días, convencida de que «lo local no funciona».

Casi siempre el problema no es el ordenador ni el software, sino decisiones equivocadas al empezar. Estos son los cinco errores más comunes de quien arranca con IA local y cómo evitar cada uno desde el primer día.

En esta guía:

Qué es la IA local y por qué ahora

Una IA local es un modelo de lenguaje que se ejecuta íntegramente en tu hardware: los pesos, la inferencia y el procesado de tus preguntas ocurren en tu procesador o tu tarjeta gráfica, nunca en servidores externos. Las ventajas son evidentes: cero coste por uso, funcionamiento sin conexión, privacidad sobre tus conversaciones y control completo del sistema.

¿Y por qué se ha puesto de moda ahora? Tres razones coinciden: las herramientas se han simplificado (instalar y ejecutar un modelo ya no exige configurar librerías complejas), los modelos abiertos de calidad se han disparado —la familia Llama 4 de Meta (2025), Gemma 4 de Google (abril de 2026) o la serie Qwen de Alibaba cubren desde 3 mil millones de parámetros hasta decenas de miles— y los ordenadores domésticos han ganado memoria suficiente: los chips Apple Silicon con memoria unificada y las GPU de consumo con más de 8 GB de VRAM ejecutan modelos que hace tres años requerían servidores.

Guía rápida: los pasos correctos antes de fallar

Antes de entrar en los errores, conviene fijar el procedimiento que sí funciona: casi todos los tropiezos vienen de saltarse alguno de estos pasos.

Primero, evalúa tu hardware honestamente. Lo que importa no es la velocidad del procesador, sino la memoria. En Mac con Apple Silicon, la memoria unificada (la RAM del sistema) hace las veces de VRAM: un Mac de 16 GB mueve con soltura modelos de 7-8 mil millones de parámetros comprimidos. En PC, la pregunta clave es la VRAM de tu gráfica: un 7B necesita unos 4 GB solo para sus pesos en Q4, más 1-2 GB de margen para el contexto, así que 8 GB de VRAM es el punto de partida cómodo.

Segundo, elige la herramienta según tu perfil. Ollama es la más sencilla para empezar: se instala en minutos y expone un servidor local compatible con la API de OpenAI. LM Studio ofrece interfaz gráfica y buscador de modelos integrado (con un mínimo recomendado de 16 GB de RAM, según sus requisitos oficiales). Si eliges algo minoritario, verifica que el proyecto siga vivo: GPT4All lleva sin actualizaciones estables desde comienzos de 2025 y los debates en su GitHub muestran preocupación por su estado.

Tercero, empieza pequeño: un 7-8B va a 20-50 tokens por segundo en GPU (frente a 2-8 en CPU) y te da la curva de aprendizaje completa. Cuando domines la mecánica, sube de tamaño si tu memoria lo permite.

Tabla comparativa: qué modelo cabe en qué hardware

Tu hardwareRango realista de modelo (Q4)Ejemplo de familia adecuada
Portátil con 8 GB de RAM o GPU de 4 GB1-4 mil millones de parámetrosVariantes pequeñas de Gemma o Qwen
GPU de 8 GB de VRAM / Mac de 16 GB7-8B cómodosLlama, Mistral, Qwen en 7-8B
GPU de 12-16 GB / Mac de 24-32 GB13-27B cómodosQwen3.6-27B, Gemma 4 intermedios
GPU de 24 GB / Mac de 32-64 GB27-32B muy fluidosQwen3.8-27B, modelos de razonamiento locales
48+ GB de VRAM o Mac de 64 GB+70B posiblesModelos abiertos de gran tamaño

Esta tabla resume rangos aproximados según tamaños reales de ficheros GGUF verificados en Hugging Face: un 7B ocupa cerca de 4 GB en Q4, un 13B alrededor de 8 GB y un 70B en torno a 42 GB, siempre con margen para el contexto.

Error 1: RAM insuficiente para el modelo elegido

Es el tropiezo número uno. El razonamiento «si cabe en el disco, correrá» lleva a descargar un modelo de 20 GB en un Mac de 16 GB de memoria: el sistema intercambia datos con el disco y el resultado son respuestas que tardan minutos, ventiladores a máxima potencia y una experiencia inutilizable. El modelo ni siquiera se niega a arrancar —ese sería el caso benigno—, simplemente se ejecuta mal.

La regla que evita el problema: el modelo debe ocupar bastante menos que tu memoria total, porque el sistema, el navegador y tus aplicaciones también necesitan espacio. En un Mac de 16 GB reserva 4-5 GB para el modelo; en una GPU con 8 GB de VRAM, un 7B cuantizado es prácticamente el límite sensato. Para comprobarlo: multiplica los miles de millones de parámetros por 0,6 para estimar los GB de pesos en Q4, y añade 1-2 GB de margen por el contexto.

Error 2: elegir el modelo por hype en lugar de por hardware

El segundo error es elegir según la comparativa de moda en lugar de según tu máquina. «El mejor modelo local» de cualquier ranking suele ser enorme —Llama 4 Scout de Meta, por ejemplo, aunque solo tiene 17 mil millones de parámetros activos, carga los 109 mil millones totales de su arquitectura de expertos, lo que exige decenas de GB de memoria—. Si tu equipo no da para él, tendrás el sistema ahogado y la calidad penalizada por cuantizaciones agresivas.

El enfoque correcto es el inverso: fija tu presupuesto de memoria, mira qué modelos caben y elige el mejor de ese rango. Un 8B bien dimensionado responde mejor y más rápido que un 30B exprimido en la misma máquina. La pregunta útil no es «qué modelo es mejor», sino «qué es lo mejor que puedo correr con fluidez en lo que tengo». El catálogo se actualiza sin parar —Qwen3.6-27B llegó en abril de 2026 para programación, Gemma 4 el mismo mes enfocado a razonamiento y el Qwen3.8-27B lo relevó en agosto—, así que revísalo con el filtro de tu memoria real, no con el de la moda.

Error 3: entender mal la cuantización

Ahora bien, incluso con el modelo correcto queda una decisión técnica que arruina experiencias: confundir la cuantización con una opción de «calidad alta o baja». La cuantización comprime los pesos del modelo de 16 bits de precisión completa a enteros de 4 u 8 bits para que quepan en menos memoria. Q8_0 conserva casi toda la calidad y reduce la memoria a la mitad. Q4_K_M es el estándar de consumo: pierde en torno a un 2 por ciento de calidad respecto a la precisión completa —difícil de percibir en tareas cotidianas— y reduce la memoria a una cuarta parte.

El error está en los extremos. Descargar el modelo más grande posible en Q2 (2 bits) produce respuestas incoherentes y alucinaciones, porque la pérdida ahí ya no es marginal sino estructural. La regla práctica de la comunidad es clara: mejor un modelo más pequeño en Q4_K_M que uno grande comprimido en Q3 o Q2. Si tu hardware no permite la cuantización cómoda del modelo que quieres, cambia de tamaño de modelo, no de bits de cuantización.

Error 4: creer que «local» es automáticamente privado

Este error tiene doble fondo. El primero es técnico: quien instala Ollama en un servidor para acceder desde el móvil modifica la variable de entorno del host para que escuche en todas las interfaces (el clásico 0.0.0.0 en lugar del 127.0.0.1 por defecto). Sin darse cuenta, abre su asistente a toda la red local o, si el puerto acaba expuesto, a internet entero. No es paranoia: en enero de 2026 se identificaron más de 175.000 instancias de Ollama expuestas públicamente, según TechRadar. Un endpoint abierto permite que terceros usen tu GPU, manipulen respuestas con inyección de prompts o ejecuten código si hay alguna vulnerabilidad en el runtime.

La solución es de sentido común: deja el servicio en localhost (127.0.0.1) por defecto y, si necesitas acceso desde otros dispositivos, protégelo con autenticación y cortafuegos; desde fuera de casa, un túnel privado como Tailscale es más seguro que abrir puertos en el router.

El segundo fondo es conceptual: confundir «el modelo corre en mi casa» con «todo lo que hago es privado». La privacidad es real mientras los datos no salgan, pero revisa dos matices: los plugins o herramientas externas que integraste pueden enviar información a sus propios servidores, y conviene saber qué queda en logs o cachés de tu instalación. La privacidad de la IA local es un resultado de tu arquitectura, no un regalo automático de la instalación.

Error 5: expectativas irreales sobre lo que hace un modelo local

El último tropiezo es psicológico, y el que provoca más abandonos. El usuario compara su modelo con el mejor de frontera de OpenAI o Anthropic, le pide un razonamiento en múltiples pasos y la decepción termina en un «lo local da porquería».

La comparación es injusta: el mejor modelo local queda por detrás de los de frontera en razonamiento complejo, y es normal, porque son redes más grandes entrenadas con más cómputo. Pero un modelo local hace muy bien una lista larga de tareas cotidianas: resumir documentos, clasificar correos, redactar borradores, corregir textos, traducir o responder preguntas sobre sus propios documentos. Para eso, un 8-27B contemporáneo es competente y gana en privacidad y coste cero.

Cambia el criterio: en lugar de «¿puede tanto como el de la nube?», pregúntate qué tareas de tu día a día son rutinarias o sensibles y puedes delegarlas en tu máquina. Ajusta el tamaño a la tarea: resumen y clasificación van bien con un 8B, programación seria prefiere modelos especializados como Qwen3.6-27B, y para razonamiento profundo el híbrido (local para lo privado, nube para lo complejo) es la recomendación honesta de la comunidad en 2026.

Errores secundarios que conviene conocer

Aunque los cinco anteriores son los grandes, hay dos patrones menores frecuentes. Uno: no verificar que la herramienta elegida sigue activa —el caso de GPT4All, con actualizaciones estancadas desde comienzos de 2025, es el recordatorio habitual—. Dos: ignorar el idioma. Si vas a usar el modelo en español, comprueba en su ficha que fue entrenado o ajustado con castellano, porque no todos los modelos pequeños lo hacen bien.

Preguntas frecuentes

¿Qué hardware necesito para ejecutar una IA local y cómo saber si un modelo cabe en mi ordenador?

El límite real no es la velocidad del procesador sino la memoria: la RAM unificada en Mac o la VRAM de la gráfica en PC. Para estimar los GB de pesos en cuantización Q4, multiplica los miles de millones de parámetros por 0,6 y añade 1-2 GB de margen para el contexto. El modelo debe ocupar bastante menos que la memoria total, porque el sistema y tus aplicaciones también necesitan espacio.

¿Qué herramienta me recomiendan para empezar con IA local?

Ollama es la más sencilla: se instala en minutos y expone un servidor local compatible con la API de OpenAI, mientras que LM Studio ofrece interfaz gráfica y buscador de modelos integrado, con un mínimo recomendado de 16 GB de RAM. Si eliges algo minoritario, verifica que el proyecto siga activo, como muestra el caso de GPT4All, que lleva sin actualizaciones estables desde comienzos de 2025. Para empezar, un modelo de 7-8B es suficiente y va a 20-50 tokens por segundo en GPU.

¿Qué cuantización conviene elegir: Q4, Q8 o Q2?

En consumo, Q4_K_M equilibra tamaño y calidad: cuesta puntitos de precisión difíciles de percibir y deja el modelo en una cuarta parte de su memoria original. Q8_0 conserva casi toda la calidad pero ocupa el doble. En cambio, las cuantizaciones extremas (Q2 o Q3) degradan el modelo de forma estructural, con respuestas incoherentes y alucinaciones: conviene bajar de tamaño de modelo antes que de bits.

¿Una IA local es privada por defecto?

No del todo: esa privacidad depende de cómo montes el sistema. Conviene dejar el servicio escuchando solo en localhost (127.0.0.1) y, si necesitas acceso desde otros dispositivos, usar un túnel como Tailscale con autenticación y cortafuegos en lugar de abrir puertos. Revisa también los plugins o herramientas externas que integraste, porque pueden enviar información a sus propios servidores, y ten presente que en enero de 2026 se detectaron más de 175.000 instancias de Ollama expuestas en internet.

¿Para qué tareas es adecuada una IA local y cuándo no lo es?

Con un modelo contemporáneo de 8-27B, tareas como resumir, ordenar el correo, escribir borradores, revisar textos o traducir quedan bien resueltas; también responder preguntas sobre documentos propios. Donde flaquea es el razonamiento complejo frente a los modelos de frontera, de ahí que en 2026 la recomendación honesta sea el enfoque híbrido: lo privado y rutinario en local, lo difícil en la nube. Y si trabajarás en castellano, comprueba que el modelo se haya entrenado o ajustado con español.

Resumen práctico

  • Evalúa tu memoria (RAM unificada en Mac, VRAM en PC) antes de descargar nada: es el límite real, no la velocidad del procesador.
  • Regla de memoria: parámetros × 0,6 GB en cuantización Q4, más 1-2 GB de margen para el contexto.
  • Elige herramientas mantenidas y con comunidad activa: Ollama o LM Studio como punto de partida estándar.
  • Mejor un modelo pequeño en Q4_K_M que uno grande comprimido en Q2 o Q3: la calidad colapsa por debajo de 4 bits.
  • Deja el servicio en localhost (127.0.0.1) por defecto y protégelo con autenticación y cortafuegos si lo abres a la red; nunca lo expongas directo a internet.
  • Usa IA local para tareas rutinarias y sensibles (resúmenes, clasificación, borradores), y resérvala de la nube para razonamiento complejo.

Referencias externas:

Chloe

Modelos: glm-5.2, Deepseek V4 y Qwen 3.5 + x/flux2-klein:9b