IA en tu móvil sin internet: modelos de lenguaje locales y tus datos siempre contigo

Qué es la IA local en móviles y por qué ahora

La IA local en móviles permite ejecutar modelos de lenguaje directamente en tu teléfono —sin enviar datos a servidores externos— gracias a chips con NPU (Unidad de Procesamiento Neuronal) cada vez más potentes. Tus conversaciones, documentos y consultas permanecen en el dispositivo, con privacidad real y sin consumir datos móviles.

Tres factores convergen en 2026 para hacer esto viable:

  • Hardware maduro: chips flagship como Snapdragon 8 Elite (Qualcomm) y A18 Pro (Apple) incluyen NPU dedicadas con aceleración cuantizada.
  • Modelos optimizados: versiones pequeñas de Llama, Gemma, Qwen y Phi, diseñadas específicamente para edge devices con 4-8 GB de RAM.
  • Formatos eficientes: GGUF (cuantización a 4-6 bits) reduce el tamaño de modelos de 7-14 GB a 2-4 GB sin pérdida significativa de calidad.

El umbral psicológico de fluidez está en torno a 10 tokens por segundo: por encima de esa velocidad, la experiencia se siente responsiva aunque esté por debajo de la lectura humana. Los modelos modernos en hardware flagship superan ese umbral consistentemente.

Cómo funciona: cuantización, NPU y límites de RAM

La cuantización es la técnica clave. Reduce la precisión de los pesos del modelo de 16 bits (formato original) a 4-6 bits, disminuyendo el tamaño y la demanda de memoria entre 3 y 4 veces. Un modelo de 7B parámetros que ocupaba 14 GB en precisión completa, cabe en 2-3 GB con cuantización Q4_K_M (4 bits).

La NPU (Neural Processing Unit) es un procesador especializado dentro del chip del móvil, diseñado exclusivamente para operaciones de IA. A diferencia de la CPU (propósito general) o la GPU (gráficos), la NPU ejecuta operaciones matriciales en paralelo con eficiencia energética extrema.

ComponenteFunción principalEfficiencia en IA
CPUPropósito generalBaja (1x)
GPUGráficos y paralelismoMedia (10-20x vs CPU)
NPUOperaciones neuronalesAlta (50-100x vs CPU)

La RAM es el factor limitante más crítico. Un modelo de 3B parámetros en cuantización Q4 ocupa ~2 GB solo en pesos. Sumando contexto (KV cache), sistema operativo y apps en segundo plano, necesitas mínimo 6-8 GB de RAM total en el dispositivo para una experiencia usable. Dispositivos con 4 GB pueden ejecutar modelos de 1B o menos, pero con limitaciones severas de contexto.

El throttling térmico es el segundo límite. Los móviles disipan menos calor que un laptop o desktop. Después de 3-5 minutos de inferencia continua, el chip reduce frecuencia para evitar sobrecalentamiento, bajando la velocidad de 40 tok/s a 15-20 tok/s. No es un defecto: es protección hardware. Las sesiones largas de conversación pueden verse afectadas.

Modelos recomendados en agosto de 2026

La generación más reciente de modelos optimizados para móvil incluye:

Gemma 4 E2B y E4B (Google, abril 2026): diseñados específicamente para mobile e IoT. El E2B (2B parámetros) cabe en 1.5 GB con cuantización Q4, corre a 30-50 tok/s en Snapdragon 8 Elite. El E4B (4B) requiere 3 GB, ofrece razonamiento superior pero es más sensible al throttling. Licencia permisiva, multilingüe (140+ idiomas).

Qwen 3.5 2B y 4B (Alibaba, febrero 2026): optimizados para on-device inference. El 2B funciona en iPhone 15 Pro y Android flagship (Snapdragon 8 Gen 2+, Exynos 2400+) a 30-40 tok/s. El 4B requiere iPhone 16 Pro o Android high-end. Fuerte en multilingüe (100+ idiomas) y código. Licencia comercialmente usable.

Llama 3.2 3B (Meta, octubre 2025): sigue siendo referencia en calidad/rendimiento. Requiere 2.5 GB en Q4, corre bien en dispositivos con 8 GB RAM. Excelente en inglés y lenguas europeas. Licencia abierta con restricciones menores.

Phi-4 Mini 3.8B (Microsoft, enero 2026): sorprendente calidad para su tamaño. Optimizado para razonamiento lógico y código. Requiere 3 GB en Q4. Funciona mejor en laptops que en móviles por demanda de RAM.

Modelos a evitar en móvil: anything sobre 9B parámetros. Un modelo de 13B en Q4 ocupa 8-9 GB, dejando casi nada para contexto y sistema. Técnicamente posible en dispositivos con 12-16 GB RAM, pero la experiencia es pobre: swapping constante, throttling agresivo, contexto limitado a 512-1024 tokens.

Apps para ejecutar modelos locales

Off Grid (OGAM) (Android, iOS, macOS, gratuita, código abierto): la opción más completa en 2026. Soporta GGUF, Whisper.cpp para transcripción, Stable Diffusion para imágenes. Disponible en GitHub y stores oficiales. La aceleración por NPU en Snapdragon está marcada como experimental en la documentación oficial — funciona pero puede ser inestable en algunos dispositivos. En Apple Silicon (iPhone, Mac) la aceleración CoreML es madura y fiable.

LM Studio para iOS (gratuita, cerrada): interfaz pulida, catálogo integrado de modelos descargables desde HuggingFace. Soporta Ollama backend para sincronización con desktop. Limitada a iPhone 15 Pro+ por requisitos de RAM.

Maid (Mobile AI Dashboard) (Android, gratuita, código abierto): ligera, enfocada en privacidad. Sin telemetría, todo offline. Soporta menos formatos que Off Grid pero es más estable en dispositivos mid-range.

Ollama + cliente móvil: si tienes Ollama corriendo en tu laptop o servidor local, apps como Enchanted (iOS) o Maid (Android) pueden conectarse vía Wi-Fi. Ventaja: el modelo corre en hardware más potente. Desventaja: requiere red local, no es verdaderamente offline.

Configuración práctica: paso a paso

Paso 1: Verifica hardware mínimo

  • iPhone: 15 Pro o superior (8 GB RAM, A17 Pro o A18 Pro con NPU)
  • Android flagship: Snapdragon 8 Gen 2 / Exynos 2400 o superior, 8 GB RAM
  • Android mid-range: Snapdragon 778G / Exynos 1280 o superior, 6 GB RAM (solo modelos 0.8B-2B)

Paso 2: Instala la app

Descarga Off Grid desde GitHub o la tienda de apps de tu dispositivo. En Android, permite permisos de almacenamiento para guardar modelos. En iOS, la app gestiona almacenamiento internamente sin permisos adicionales.

Paso 3: Descarga un modelo

Empieza con Qwen 3.5 2B Q4_K_M o Gemma 4 E2B Q4. Ocupan ~1.5-2 GB. Evita modelos grandes en el primer intento. La app suele incluir un navegador integrado de HuggingFace para descargar directamente.

Paso 4: Configura contexto

Ajusta el máximo de contexto a 2048-4096 tokens. Valores más altos (8192+) pueden causar out-of-memory en móviles con 6-8 GB RAM. El contexto incluye tu prompt + respuesta + historial de conversación.

Paso 5: Prueba y ajusta

Ejecuta un prompt simple. Si la velocidad es inferior a 8-10 tok/s, prueba: (1) reducir contexto máximo, (2) cerrar apps en segundo plano, (3) bajar cuantización a Q3_K_M (menos calidad, más velocidad), (4) verificar que la aceleración NPU esté habilitada en settings.

Casos de uso reales

Privacidad en sectores regulados: abogados, médicos, terapeutas que necesitan procesar documentos sensibles sin violar GDPR, HIPAA o secreto profesional. El modelo local nunca envía datos fuera del dispositivo.

Trabajo offline: investigadores en campo, periodistas en zonas sin cobertura, viajeros internacionales sin roaming de datos. La IA está disponible 24/7 sin conexión.

Reducción de costes: evitar APIs de pago por token para tareas de alto volumen (resumen de documentos, clasificación, extracción). El coste inicial es hardware; la inferencia es gratis.

Latencia crítica: aplicaciones que requieren respuesta inmediata sin round-trip a la nube. Asistentes de voz locales, traducción en tiempo real, transcripción de reuniones. Para el primer caso, hay una guía práctica de asistente de voz offline para casa.

Errores comunes al empezar

1. Elegir modelo demasiado grande: empezar con un 7B o 13B en un móvil con 8 GB RAM. Resultado: out-of-memory inmediato o velocidad de 1-2 tok/s. Empieza con 2B-4B, domina la configuración, luego escala si tu hardware lo permite.

2. Ignorar cuantización: descargar modelo en precisión completa (16 bits) ocupa 4x más RAM y es 3x más lento sin beneficio perceptible en calidad. Usa Q4_K_M como estándar; Q3_K_M si necesitas más velocidad; Q5_K_M solo si sobra RAM.

3. No cerrar apps en segundo plano: Chrome, Spotify, redes sociales consumen 1-3 GB RAM. Antes de inferencia larga, cierra todo. En Android, usa «Modo concentración» o «No molestar» para liberar recursos.

4. Esperar calidad de GPT-4: un modelo 2B-4B local no compite con GPT-4, Claude o Gemini Ultra en razonamiento complejo. Es suficiente para resumen, clasificación, escritura asistida, Q&A factual. Para razonamiento avanzado, usa cloud o modelos más grandes en laptop.

5. Olvidar throttling térmico: después de 5 minutos de uso continuo, el móvil reduce frecuencia. No es un fallo: es protección. Para sesiones largas, haz pausas de 1-2 minutos o usa un laptop con mejor disipación.

6. Confiar en aceleración NPU experimental: en algunos Android con Snapdragon, la aceleración NPU está marcada como experimental. Puede ser inestable o no soportar todos los modelos. Si experimentas crashes o corrupción de output, deshabilita NPU y usa CPU/GPU (más lento pero estable).

Preguntas frecuentes

¿Qué es la cuantización y por qué es importante para la IA en móviles?

La cuantización es una técnica que reduce la precisión de los pesos del modelo de 16 bits a 4-6 bits, disminuyendo su tamaño y la demanda de memoria entre 3 y 4 veces. Esto permite que modelos que ocupaban 14 GB quepan en 2-3 GB sin pérdida significativa de calidad, siendo esencial para ejecutar IA local en dispositivos con RAM limitada.

¿Cuáles son las principales limitaciones de hardware al ejecutar IA local en un teléfono?

La RAM es el factor limitante más crítico, necesitando un mínimo de 6-8 GB totales para una experiencia usable con modelos de 3B parámetros. Además, el throttling térmico reduce la frecuencia del chip tras 3-5 minutos de uso continuo para evitar el sobrecalentamiento, lo que baja la velocidad de inferencia.

¿Qué tamaño de modelo y formato de cuantización son recomendables para empezar?

Se recomienda empezar con modelos pequeños de 2B a 4B parámetros, como Qwen 3.5 2B o Gemma 4 E2B, evitando modelos de más de 9B parámetros. En cuanto a la cuantización, el estándar recomendado es Q4_K_M, ya que reduce el tamaño 4 veces sin pérdida perceptible de calidad.

¿Qué aplicaciones puedo usar para ejecutar modelos de lenguaje locales en mi móvil?

Off Grid (OGAM) es la opción más completa, gratuita y de código abierto para Android, iOS y macOS. Otras alternativas incluyen LM Studio para iOS, Maid para Android con enfoque en privacidad, y clientes como Enchanted o Maid para conectarse vía Wi-Fi a un servidor Ollama local.

Resumen práctico

  • IA local en móvil es viable en 2026: hardware maduro (Snapdragon 8 Elite, A18 Pro), modelos optimizados (Gemma 4, Qwen 3.5, Llama 3.2) y formatos eficientes (GGUF Q4) convergen.
  • Privacidad real: tus datos nunca salen del dispositivo. Crítico para sectores regulados (legal, médico, financiero).
  • Umbral de fluidez: 10 tok/s: por encima se siente responsivo. Hardware flagship alcanza 30-50 tok/s con modelos 2B-4B.
  • RAM es el límite principal: mínimo 6-8 GB totales en el dispositivo. Modelos 2B-4B ocupan 1.5-3 GB en Q4.
  • Cuantización Q4_K_M: estándar recomendado. Reduce tamaño 4x sin pérdida perceptible. Q3 para más velocidad, Q5 si sobra RAM.
  • Modelos agosto 2026: Gemma 4 E2B/E4B (abril 2026), Qwen 3.5 2B/4B (febrero 2026), Llama 3.2 3B (octubre 2025), Phi-4 Mini 3.8B (enero 2026).
  • Off Grid (OGAM): app multiplataforma (Android + iOS + macOS), gratuita, código abierto. Aceleración NPU en Snapdragon es experimental; CoreML en Apple es maduro.
  • Throttling térmico: después de 3-5 minutos, el móvil reduce frecuencia. Haz pausas para sesiones largas.
  • Errores a evitar: modelo demasiado grande, ignorar cuantización, no cerrar apps en segundo plano, esperar calidad GPT-4, olvidar throttling, confiar en NPU experimental.
  • Casos de uso ideales: privacidad regulada, trabajo offline, reducción de costes APIs, latencia crítica.

Referencias externas:

Berythium

Modelos: gpt-5 + dall-e 2