IA en tu móvil sin internet: modelos de lenguaje locales y tus datos siempre contigo

Qué es la IA local en móviles y por qué ahora

La IA local en móviles permite ejecutar modelos de lenguaje directamente en tu teléfono —sin enviar datos a servidores externos— gracias a chips con NPU (Unidad de Procesamiento Neuronal) cada vez más potentes. Tus conversaciones, documentos y consultas permanecen en el dispositivo, con privacidad real y sin consumir datos móviles.

Tres factores convergen en 2026 para hacer esto viable:

  • Hardware maduro: chips flagship como Snapdragon 8 Elite (Qualcomm) y A18 Pro (Apple) incluyen NPU dedicadas con aceleración cuantizada.
  • Modelos optimizados: versiones pequeñas de Llama, Gemma, Qwen y Phi, diseñadas específicamente para edge devices con 4-8 GB de RAM.
  • Formatos eficientes: GGUF (cuantización a 4-6 bits) reduce el tamaño de modelos de 7-14 GB a 2-4 GB sin pérdida significativa de calidad.

El umbral psicológico de fluidez está en torno a 10 tokens por segundo: por encima de esa velocidad, la experiencia se siente responsiva aunque esté por debajo de la lectura humana. Los modelos modernos en hardware flagship superan ese umbral consistentemente.

Cómo funciona: cuantización, NPU y límites de RAM

La cuantización es la técnica clave. Reduce la precisión de los pesos del modelo de 16 bits (formato original) a 4-6 bits, disminuyendo el tamaño y la demanda de memoria entre 3 y 4 veces. Un modelo de 7B parámetros que ocupaba 14 GB en precisión completa, cabe en 2-3 GB con cuantización Q4_K_M (4 bits).

La NPU (Neural Processing Unit) es un procesador especializado dentro del chip del móvil, diseñado exclusivamente para operaciones de IA. A diferencia de la CPU (propósito general) o la GPU (gráficos), la NPU ejecuta operaciones matriciales en paralelo con eficiencia energética extrema.

ComponenteFunción principalEfficiencia en IA
CPUPropósito generalBaja (1x)
GPUGráficos y paralelismoMedia (10-20x vs CPU)
NPUOperaciones neuronalesAlta (50-100x vs CPU)

La RAM es el factor limitante más crítico. Un modelo de 3B parámetros en cuantización Q4 ocupa ~2 GB solo en pesos. Sumando contexto (KV cache), sistema operativo y apps en segundo plano, necesitas mínimo 6-8 GB de RAM total en el dispositivo para una experiencia usable. Dispositivos con 4 GB pueden ejecutar modelos de 1B o menos, pero con limitaciones severas de contexto.

El throttling térmico es el segundo límite. Los móviles disipan menos calor que un laptop o desktop. Después de 3-5 minutos de inferencia continua, el chip reduce frecuencia para evitar sobrecalentamiento, bajando la velocidad de 40 tok/s a 15-20 tok/s. No es un defecto: es protección hardware. Las sesiones largas de conversación pueden verse afectadas.

Modelos recomendados en agosto de 2026

La generación más reciente de modelos optimizados para móvil incluye:

Gemma 4 E2B y E4B (Google, abril 2026): diseñados específicamente para mobile e IoT. El E2B (2B parámetros) cabe en 1.5 GB con cuantización Q4, corre a 30-50 tok/s en Snapdragon 8 Elite. El E4B (4B) requiere 3 GB, ofrece razonamiento superior pero es más sensible al throttling. Licencia permisiva, multilingüe (140+ idiomas).

Qwen 3.5 2B y 4B (Alibaba, febrero 2026): optimizados para on-device inference. El 2B funciona en iPhone 15 Pro y Android flagship (Snapdragon 8 Gen 2+, Exynos 2400+) a 30-40 tok/s. El 4B requiere iPhone 16 Pro o Android high-end. Fuerte en multilingüe (100+ idiomas) y código. Licencia comercialmente usable.

Llama 3.2 3B (Meta, octubre 2025): sigue siendo referencia en calidad/rendimiento. Requiere 2.5 GB en Q4, corre bien en dispositivos con 8 GB RAM. Excelente en inglés y lenguas europeas. Licencia abierta con restricciones menores.

Phi-4 Mini 3.8B (Microsoft, enero 2026): sorprendente calidad para su tamaño. Optimizado para razonamiento lógico y código. Requiere 3 GB en Q4. Funciona mejor en laptops que en móviles por demanda de RAM.

Modelos a evitar en móvil: anything sobre 9B parámetros. Un modelo de 13B en Q4 ocupa 8-9 GB, dejando casi nada para contexto y sistema. Técnicamente posible en dispositivos con 12-16 GB RAM, pero la experiencia es pobre: swapping constante, throttling agresivo, contexto limitado a 512-1024 tokens.

Apps para ejecutar modelos locales

Off Grid (OGAM) (Android, iOS, macOS, gratuita, código abierto): la opción más completa en 2026. Soporta GGUF, Whisper.cpp para transcripción, Stable Diffusion para imágenes. Disponible en GitHub y stores oficiales. La aceleración por NPU en Snapdragon está marcada como experimental en la documentación oficial — funciona pero puede ser inestable en algunos dispositivos. En Apple Silicon (iPhone, Mac) la aceleración CoreML es madura y fiable.

LM Studio para iOS (gratuita, cerrada): interfaz pulida, catálogo integrado de modelos descargables desde HuggingFace. Soporta Ollama backend para sincronización con desktop. Limitada a iPhone 15 Pro+ por requisitos de RAM.

Maid (Mobile AI Dashboard) (Android, gratuita, código abierto): ligera, enfocada en privacidad. Sin telemetría, todo offline. Soporta menos formatos que Off Grid pero es más estable en dispositivos mid-range.

Ollama + cliente móvil: si tienes Ollama corriendo en tu laptop o servidor local, apps como Enchanted (iOS) o Maid (Android) pueden conectarse vía Wi-Fi. Ventaja: el modelo corre en hardware más potente. Desventaja: requiere red local, no es verdaderamente offline.

Configuración práctica: paso a paso

Paso 1: Verifica hardware mínimo

  • iPhone: 15 Pro o superior (8 GB RAM, A17 Pro o A18 Pro con NPU)
  • Android flagship: Snapdragon 8 Gen 2 / Exynos 2400 o superior, 8 GB RAM
  • Android mid-range: Snapdragon 778G / Exynos 1280 o superior, 6 GB RAM (solo modelos 0.8B-2B)

Paso 2: Instala la app

Descarga Off Grid desde GitHub o la tienda de apps de tu dispositivo. En Android, permite permisos de almacenamiento para guardar modelos. En iOS, la app gestiona almacenamiento internamente sin permisos adicionales.

Paso 3: Descarga un modelo

Empieza con Qwen 3.5 2B Q4_K_M o Gemma 4 E2B Q4. Ocupan ~1.5-2 GB. Evita modelos grandes en el primer intento. La app suele incluir un navegador integrado de HuggingFace para descargar directamente.

Paso 4: Configura contexto

Ajusta el máximo de contexto a 2048-4096 tokens. Valores más altos (8192+) pueden causar out-of-memory en móviles con 6-8 GB RAM. El contexto incluye tu prompt + respuesta + historial de conversación.

Paso 5: Prueba y ajusta

Ejecuta un prompt simple. Si la velocidad es inferior a 8-10 tok/s, prueba: (1) reducir contexto máximo, (2) cerrar apps en segundo plano, (3) bajar cuantización a Q3_K_M (menos calidad, más velocidad), (4) verificar que la aceleración NPU esté habilitada en settings.

Casos de uso reales

Privacidad en sectores regulados: abogados, médicos, terapeutas que necesitan procesar documentos sensibles sin violar GDPR, HIPAA o secreto profesional. El modelo local nunca envía datos fuera del dispositivo.

Trabajo offline: investigadores en campo, periodistas en zonas sin cobertura, viajeros internacionales sin roaming de datos. La IA está disponible 24/7 sin conexión.

Reducción de costes: evitar APIs de pago por token para tareas de alto volumen (resumen de documentos, clasificación, extracción). El coste inicial es hardware; la inferencia es gratis.

Latencia crítica: aplicaciones que requieren respuesta inmediata sin round-trip a la nube. Asistentes de voz locales, traducción en tiempo real, transcripción de reuniones.

Errores comunes al empezar

1. Elegir modelo demasiado grande: empezar con un 7B o 13B en un móvil con 8 GB RAM. Resultado: out-of-memory inmediato o velocidad de 1-2 tok/s. Empieza con 2B-4B, domina la configuración, luego escala si tu hardware lo permite.

2. Ignorar cuantización: descargar modelo en precisión completa (16 bits) ocupa 4x más RAM y es 3x más lento sin beneficio perceptible en calidad. Usa Q4_K_M como estándar; Q3_K_M si necesitas más velocidad; Q5_K_M solo si sobra RAM.

3. No cerrar apps en segundo plano: Chrome, Spotify, redes sociales consumen 1-3 GB RAM. Antes de inferencia larga, cierra todo. En Android, usa «Modo concentración» o «No molestar» para liberar recursos.

4. Esperar calidad de GPT-4: un modelo 2B-4B local no compite con GPT-4, Claude o Gemini Ultra en razonamiento complejo. Es suficiente para resumen, clasificación, escritura asistida, Q&A factual. Para razonamiento avanzado, usa cloud o modelos más grandes en laptop.

5. Olvidar throttling térmico: después de 5 minutos de uso continuo, el móvil reduce frecuencia. No es un fallo: es protección. Para sesiones largas, haz pausas de 1-2 minutos o usa un laptop con mejor disipación.

6. Confiar en aceleración NPU experimental: en algunos Android con Snapdragon, la aceleración NPU está marcada como experimental. Puede ser inestable o no soportar todos los modelos. Si experimentas crashes o corrupción de output, deshabilita NPU y usa CPU/GPU (más lento pero estable).

Resumen práctico

  • IA local en móvil es viable en 2026: hardware maduro (Snapdragon 8 Elite, A18 Pro), modelos optimizados (Gemma 4, Qwen 3.5, Llama 3.2) y formatos eficientes (GGUF Q4) convergen.
  • Privacidad real: tus datos nunca salen del dispositivo. Crítico para sectores regulados (legal, médico, financiero).
  • Umbral de fluidez: 10 tok/s: por encima se siente responsivo. Hardware flagship alcanza 30-50 tok/s con modelos 2B-4B.
  • RAM es el límite principal: mínimo 6-8 GB totales en el dispositivo. Modelos 2B-4B ocupan 1.5-3 GB en Q4.
  • Cuantización Q4_K_M: estándar recomendado. Reduce tamaño 4x sin pérdida perceptible. Q3 para más velocidad, Q5 si sobra RAM.
  • Modelos agosto 2026: Gemma 4 E2B/E4B (abril 2026), Qwen 3.5 2B/4B (febrero 2026), Llama 3.2 3B (octubre 2025), Phi-4 Mini 3.8B (enero 2026).
  • Off Grid (OGAM): app multiplataforma (Android + iOS + macOS), gratuita, código abierto. Aceleración NPU en Snapdragon es experimental; CoreML en Apple es maduro.
  • Throttling térmico: después de 3-5 minutos, el móvil reduce frecuencia. Haz pausas para sesiones largas.
  • Errores a evitar: modelo demasiado grande, ignorar cuantización, no cerrar apps en segundo plano, esperar calidad GPT-4, olvidar throttling, confiar en NPU experimental.
  • Casos de uso ideales: privacidad regulada, trabajo offline, reducción de costes APIs, latencia crítica.

Referencias

Berythium

Modelos: gpt-5 + dall-e 2