
Qué es la IA local en móviles y por qué ahora
La IA local en móviles permite ejecutar modelos de lenguaje directamente en tu teléfono —sin enviar datos a servidores externos— gracias a chips con NPU (Unidad de Procesamiento Neuronal) cada vez más potentes. Tus conversaciones, documentos y consultas permanecen en el dispositivo, con privacidad real y sin consumir datos móviles.
Tres factores convergen en 2026 para hacer esto viable:
- Hardware maduro: chips flagship como Snapdragon 8 Elite (Qualcomm) y A18 Pro (Apple) incluyen NPU dedicadas con aceleración cuantizada.
- Modelos optimizados: versiones pequeñas de Llama, Gemma, Qwen y Phi, diseñadas específicamente para edge devices con 4-8 GB de RAM.
- Formatos eficientes: GGUF (cuantización a 4-6 bits) reduce el tamaño de modelos de 7-14 GB a 2-4 GB sin pérdida significativa de calidad.
El umbral psicológico de fluidez está en torno a 10 tokens por segundo: por encima de esa velocidad, la experiencia se siente responsiva aunque esté por debajo de la lectura humana. Los modelos modernos en hardware flagship superan ese umbral consistentemente.
Cómo funciona: cuantización, NPU y límites de RAM
La cuantización es la técnica clave. Reduce la precisión de los pesos del modelo de 16 bits (formato original) a 4-6 bits, disminuyendo el tamaño y la demanda de memoria entre 3 y 4 veces. Un modelo de 7B parámetros que ocupaba 14 GB en precisión completa, cabe en 2-3 GB con cuantización Q4_K_M (4 bits).
La NPU (Neural Processing Unit) es un procesador especializado dentro del chip del móvil, diseñado exclusivamente para operaciones de IA. A diferencia de la CPU (propósito general) o la GPU (gráficos), la NPU ejecuta operaciones matriciales en paralelo con eficiencia energética extrema.
| Componente | Función principal | Efficiencia en IA |
|---|---|---|
| CPU | Propósito general | Baja (1x) |
| GPU | Gráficos y paralelismo | Media (10-20x vs CPU) |
| NPU | Operaciones neuronales | Alta (50-100x vs CPU) |
La RAM es el factor limitante más crítico. Un modelo de 3B parámetros en cuantización Q4 ocupa ~2 GB solo en pesos. Sumando contexto (KV cache), sistema operativo y apps en segundo plano, necesitas mínimo 6-8 GB de RAM total en el dispositivo para una experiencia usable. Dispositivos con 4 GB pueden ejecutar modelos de 1B o menos, pero con limitaciones severas de contexto.
El throttling térmico es el segundo límite. Los móviles disipan menos calor que un laptop o desktop. Después de 3-5 minutos de inferencia continua, el chip reduce frecuencia para evitar sobrecalentamiento, bajando la velocidad de 40 tok/s a 15-20 tok/s. No es un defecto: es protección hardware. Las sesiones largas de conversación pueden verse afectadas.
Modelos recomendados en agosto de 2026
La generación más reciente de modelos optimizados para móvil incluye:
Gemma 4 E2B y E4B (Google, abril 2026): diseñados específicamente para mobile e IoT. El E2B (2B parámetros) cabe en 1.5 GB con cuantización Q4, corre a 30-50 tok/s en Snapdragon 8 Elite. El E4B (4B) requiere 3 GB, ofrece razonamiento superior pero es más sensible al throttling. Licencia permisiva, multilingüe (140+ idiomas).
Qwen 3.5 2B y 4B (Alibaba, febrero 2026): optimizados para on-device inference. El 2B funciona en iPhone 15 Pro y Android flagship (Snapdragon 8 Gen 2+, Exynos 2400+) a 30-40 tok/s. El 4B requiere iPhone 16 Pro o Android high-end. Fuerte en multilingüe (100+ idiomas) y código. Licencia comercialmente usable.
Llama 3.2 3B (Meta, octubre 2025): sigue siendo referencia en calidad/rendimiento. Requiere 2.5 GB en Q4, corre bien en dispositivos con 8 GB RAM. Excelente en inglés y lenguas europeas. Licencia abierta con restricciones menores.
Phi-4 Mini 3.8B (Microsoft, enero 2026): sorprendente calidad para su tamaño. Optimizado para razonamiento lógico y código. Requiere 3 GB en Q4. Funciona mejor en laptops que en móviles por demanda de RAM.
Modelos a evitar en móvil: anything sobre 9B parámetros. Un modelo de 13B en Q4 ocupa 8-9 GB, dejando casi nada para contexto y sistema. Técnicamente posible en dispositivos con 12-16 GB RAM, pero la experiencia es pobre: swapping constante, throttling agresivo, contexto limitado a 512-1024 tokens.
Apps para ejecutar modelos locales
Off Grid (OGAM) (Android, iOS, macOS, gratuita, código abierto): la opción más completa en 2026. Soporta GGUF, Whisper.cpp para transcripción, Stable Diffusion para imágenes. Disponible en GitHub y stores oficiales. La aceleración por NPU en Snapdragon está marcada como experimental en la documentación oficial — funciona pero puede ser inestable en algunos dispositivos. En Apple Silicon (iPhone, Mac) la aceleración CoreML es madura y fiable.
LM Studio para iOS (gratuita, cerrada): interfaz pulida, catálogo integrado de modelos descargables desde HuggingFace. Soporta Ollama backend para sincronización con desktop. Limitada a iPhone 15 Pro+ por requisitos de RAM.
Maid (Mobile AI Dashboard) (Android, gratuita, código abierto): ligera, enfocada en privacidad. Sin telemetría, todo offline. Soporta menos formatos que Off Grid pero es más estable en dispositivos mid-range.
Ollama + cliente móvil: si tienes Ollama corriendo en tu laptop o servidor local, apps como Enchanted (iOS) o Maid (Android) pueden conectarse vía Wi-Fi. Ventaja: el modelo corre en hardware más potente. Desventaja: requiere red local, no es verdaderamente offline.
Configuración práctica: paso a paso
Paso 1: Verifica hardware mínimo
- iPhone: 15 Pro o superior (8 GB RAM, A17 Pro o A18 Pro con NPU)
- Android flagship: Snapdragon 8 Gen 2 / Exynos 2400 o superior, 8 GB RAM
- Android mid-range: Snapdragon 778G / Exynos 1280 o superior, 6 GB RAM (solo modelos 0.8B-2B)
Paso 2: Instala la app
Descarga Off Grid desde GitHub o la tienda de apps de tu dispositivo. En Android, permite permisos de almacenamiento para guardar modelos. En iOS, la app gestiona almacenamiento internamente sin permisos adicionales.
Paso 3: Descarga un modelo
Empieza con Qwen 3.5 2B Q4_K_M o Gemma 4 E2B Q4. Ocupan ~1.5-2 GB. Evita modelos grandes en el primer intento. La app suele incluir un navegador integrado de HuggingFace para descargar directamente.
Paso 4: Configura contexto
Ajusta el máximo de contexto a 2048-4096 tokens. Valores más altos (8192+) pueden causar out-of-memory en móviles con 6-8 GB RAM. El contexto incluye tu prompt + respuesta + historial de conversación.
Paso 5: Prueba y ajusta
Ejecuta un prompt simple. Si la velocidad es inferior a 8-10 tok/s, prueba: (1) reducir contexto máximo, (2) cerrar apps en segundo plano, (3) bajar cuantización a Q3_K_M (menos calidad, más velocidad), (4) verificar que la aceleración NPU esté habilitada en settings.
Casos de uso reales
Privacidad en sectores regulados: abogados, médicos, terapeutas que necesitan procesar documentos sensibles sin violar GDPR, HIPAA o secreto profesional. El modelo local nunca envía datos fuera del dispositivo.
Trabajo offline: investigadores en campo, periodistas en zonas sin cobertura, viajeros internacionales sin roaming de datos. La IA está disponible 24/7 sin conexión.
Reducción de costes: evitar APIs de pago por token para tareas de alto volumen (resumen de documentos, clasificación, extracción). El coste inicial es hardware; la inferencia es gratis.
Latencia crítica: aplicaciones que requieren respuesta inmediata sin round-trip a la nube. Asistentes de voz locales, traducción en tiempo real, transcripción de reuniones.
Errores comunes al empezar
1. Elegir modelo demasiado grande: empezar con un 7B o 13B en un móvil con 8 GB RAM. Resultado: out-of-memory inmediato o velocidad de 1-2 tok/s. Empieza con 2B-4B, domina la configuración, luego escala si tu hardware lo permite.
2. Ignorar cuantización: descargar modelo en precisión completa (16 bits) ocupa 4x más RAM y es 3x más lento sin beneficio perceptible en calidad. Usa Q4_K_M como estándar; Q3_K_M si necesitas más velocidad; Q5_K_M solo si sobra RAM.
3. No cerrar apps en segundo plano: Chrome, Spotify, redes sociales consumen 1-3 GB RAM. Antes de inferencia larga, cierra todo. En Android, usa «Modo concentración» o «No molestar» para liberar recursos.
4. Esperar calidad de GPT-4: un modelo 2B-4B local no compite con GPT-4, Claude o Gemini Ultra en razonamiento complejo. Es suficiente para resumen, clasificación, escritura asistida, Q&A factual. Para razonamiento avanzado, usa cloud o modelos más grandes en laptop.
5. Olvidar throttling térmico: después de 5 minutos de uso continuo, el móvil reduce frecuencia. No es un fallo: es protección. Para sesiones largas, haz pausas de 1-2 minutos o usa un laptop con mejor disipación.
6. Confiar en aceleración NPU experimental: en algunos Android con Snapdragon, la aceleración NPU está marcada como experimental. Puede ser inestable o no soportar todos los modelos. Si experimentas crashes o corrupción de output, deshabilita NPU y usa CPU/GPU (más lento pero estable).
Resumen práctico
- IA local en móvil es viable en 2026: hardware maduro (Snapdragon 8 Elite, A18 Pro), modelos optimizados (Gemma 4, Qwen 3.5, Llama 3.2) y formatos eficientes (GGUF Q4) convergen.
- Privacidad real: tus datos nunca salen del dispositivo. Crítico para sectores regulados (legal, médico, financiero).
- Umbral de fluidez: 10 tok/s: por encima se siente responsivo. Hardware flagship alcanza 30-50 tok/s con modelos 2B-4B.
- RAM es el límite principal: mínimo 6-8 GB totales en el dispositivo. Modelos 2B-4B ocupan 1.5-3 GB en Q4.
- Cuantización Q4_K_M: estándar recomendado. Reduce tamaño 4x sin pérdida perceptible. Q3 para más velocidad, Q5 si sobra RAM.
- Modelos agosto 2026: Gemma 4 E2B/E4B (abril 2026), Qwen 3.5 2B/4B (febrero 2026), Llama 3.2 3B (octubre 2025), Phi-4 Mini 3.8B (enero 2026).
- Off Grid (OGAM): app multiplataforma (Android + iOS + macOS), gratuita, código abierto. Aceleración NPU en Snapdragon es experimental; CoreML en Apple es maduro.
- Throttling térmico: después de 3-5 minutos, el móvil reduce frecuencia. Haz pausas para sesiones largas.
- Errores a evitar: modelo demasiado grande, ignorar cuantización, no cerrar apps en segundo plano, esperar calidad GPT-4, olvidar throttling, confiar en NPU experimental.
- Casos de uso ideales: privacidad regulada, trabajo offline, reducción de costes APIs, latencia crítica.
Referencias
- Snapdragon 8 Elite Mobile Platform — Qualcomm (documento oficial)
- Gemma 4 — Google DeepMind (lanzamiento abril 2026)
- Qwen 3.5 — Alibaba (febrero 2026)
- Off Grid (OGAM) — Repositorio oficial GitHub
- Llama 3.2: Revolutionizing edge AI — Meta
- Snapdragon 8 Elite Gen 5 Analysis — Counterpoint Research (octubre 2025)