Ejecutar IA en local ha dejado de ser un capricho de entusiasta. Cada vez más profesionales quieren correr un Llama 3.1, un Mistral o un Qwen sin mandar datos a la nube, y la pregunta que llega a la redacción se repite: ¿qué portátil compro para esto? La respuesta no es "el más caro". Es el que cumple tres o cuatro números concretos. Vamos a por ellos.
Los 4 criterios que de verdad deciden
1) RAM unificada o RAM + VRAM: el techo del modelo que puedes cargar. Un LLM cuantizado a 4 bits ocupa, muy aproximadamente, la mitad de sus parámetros en GB. Un 7B pide unos 5-6 GB, un 13B ronda 8-10 GB, un 70B se va a 40 GB o más. Si el modelo no entra en memoria, no hay chip que lo salve.
2) VRAM de la GPU (o memoria unificada en Apple Silicon). La NPU es útil para cargas ligeras, pero la inferencia seria en Windows sigue tirando de CUDA sobre GeForce RTX. En Mac, la memoria unificada del SoC hace las veces de VRAM y esa es su gran ventaja frente a un portátil x86 con 16 GB de VRAM como techo.
3) TOPS de NPU y etiqueta Copilot+ PC. Microsoft fijó el umbral en 40 TOPS de NPU para certificar un equipo como Copilot+ PC. Es la referencia que hoy separa un portátil "con IA de verdad" de uno que solo la ejecuta a base de CPU. No es imprescindible para Ollama o LM Studio —esos tiran de GPU—, pero sí para funciones nativas de Windows 11 y para modelos pequeños optimizados vía DirectML o QNN.
4) Sistema de refrigeración y autonomía bajo carga. Inferir un 13B durante veinte minutos calienta. Los ultraligeros de 1 kg se estrangulan térmicamente antes de acabar el prompt. Si vas a trabajar sostenido, el chasis importa tanto como el chip.
Qué tamaño de modelo cabe en qué hardware
| Modelo LLM (cuantizado Q4) | RAM/VRAM mínima | RAM/VRAM cómoda | Framework típico |
|---|---|---|---|
| 7B (Llama 3.1 8B, Mistral 7B) | 8 GB | 16 GB | Ollama, LM Studio |
| 13B (Qwen 2.5 14B) | 12 GB | 24 GB | Ollama, llama.cpp |
| 30-34B (Yi, CodeLlama 34B) | 24 GB | 32 GB | llama.cpp, LM Studio |
| 70B (Llama 3.1 70B) | 40 GB unificada / 2× GPU | 64 GB+ | llama.cpp (offload) |
Esta tabla es la brújula de todo lo que viene después. Antes de mirar precios, decide qué tamaño de modelo vas a usar el 80% del tiempo. Si tu respuesta honesta es "7B y algún 13B suelto", no necesitas gastarte 4.000 €.
Perfil 1: usuario que quiere modelos 7B-13B sin complicarse
Aquí manda el equilibrio entre NPU certificada Copilot+ y 32 GB de RAM. Los Snapdragon X Elite y los Intel Core Ultra Serie 2 (Lunar Lake) rondan los 45-48 TOPS de NPU y cumplen el listón de Microsoft.
El Microsoft Surface Laptop 7 con Snapdragon X Elite y 32 GB es la opción más pulida en Windows on Arm. Ejecuta 7B sin despeinarse en LM Studio (build ARM64) y aguanta jornada completa. Su pega: compatibilidad de algunos frameworks —llama.cpp funciona, pero ciertas builds con aceleración GPU todavía cojean en Arm.
Alternativa x86: el ASUS Zenbook S 14 con Core Ultra 7 258V, NPU de 47 TOPS y 32 GB LPDDR5X. Más flexible con software legacy, algo menos de autonomía. Si vienes de un ultraligero clásico y no quieres sorpresas con drivers, es la apuesta segura. Ya hicimos números con estos ultraligeros en el comparativo de 14 pulgadas y el veredicto se sostiene.
| Modelo | Pantalla | Procesador | RAM | SSD | Gráfica | Autonomía real | Peso | SO | Precio desde |
|---|---|---|---|---|---|---|---|---|---|
| Microsoft Surface Laptop 7 (13,8″) | 13,8″ 2304×1536 táctil | Snapdragon X Elite (45 TOPS NPU) | 32 GB | 1 TB | Adreno integrada | 14-16 h ofimática | 1,34 kg | Windows 11 ARM | 2.199 € |
| ASUS Zenbook S 14 UX5406 | 14″ OLED 2880×1800 | Intel Core Ultra 7 258V (47 TOPS NPU) | 32 GB LPDDR5X | 1 TB | Intel Arc 140V | 12-14 h | 1,20 kg | Windows 11 | 1.699 € |
| HP OmniBook Ultra 14 | 14″ 2240×1400 | AMD Ryzen AI 9 HX 375 (55 TOPS NPU) | 32 GB | 1 TB | Radeon 890M | 10-12 h | 1,49 kg | Windows 11 | 1.799 € |
Perfil 2: desarrollador o creador que quiere hasta 30B-34B
Aquí el juego cambia. Necesitas VRAM real o memoria unificada masiva. Dos caminos:
Camino Apple: el MacBook Pro M4 Pro con 48 GB de memoria unificada corre un 34B cuantizado sin drama vía Ollama o LM Studio. El M4 Max con 64 o 128 GB es otra liga —permite incluso rozar un 70B con paciencia—. Ventaja: silencioso, autonomía inmejorable, MLX como framework nativo optimizado. Desventaja: precio y que dependes del ecosistema de Cupertino.
Camino Windows con GPU discreta: una Razer Blade 16 con RTX 4080/4090 Laptop (12-16 GB de VRAM) o el ASUS ProArt P16 con RTX 4070 y Ryzen AI 9 HX 370. El ProArt es probablemente la mejor relación potencia/precio para IA local en Windows: NPU de 50 TOPS, GPU dedicada con CUDA y hasta 64 GB de RAM del sistema para offload.
| Modelo | Pantalla | Procesador | RAM | SSD | Gráfica | Autonomía real | Peso | SO | Precio desde |
|---|---|---|---|---|---|---|---|---|---|
| MacBook Pro M4 Pro 14″ | 14,2″ Liquid Retina XDR 120 Hz | Apple M4 Pro (38 TOPS NPU) | 48 GB unificada | 1 TB | GPU 20 núcleos integrada | 16-18 h | 1,60 kg | macOS Sequoia | 2.899 € |
| ASUS ProArt P16 H7606 | 16″ OLED 4K táctil | AMD Ryzen AI 9 HX 370 (50 TOPS NPU) | 32-64 GB | 1-2 TB | NVIDIA RTX 4070 8 GB VRAM | 6-8 h | 1,85 kg | Windows 11 | 2.499 € |
| Razer Blade 16 (2024) | 16″ OLED 240 Hz | Intel Core i9-14900HX | 32 GB DDR5 | 1 TB | NVIDIA RTX 4090 16 GB VRAM | 4-6 h | 2,45 kg | Windows 11 | 3.999 € |
Perfil 3: quien quiere tocar 70B en local
Aquí solo hay dos respuestas honestas: MacBook Pro M4 Max con 128 GB o una workstation tipo Lenovo ThinkPad P16 Gen 2 con Xeon, RTX 5000 Ada y 64-128 GB de RAM. El Mac gana en silencio y autonomía; el ThinkPad gana en CUDA puro y en poder meter dos GPU en algunos configuradores empresariales. Si tu flujo es Hugging Face + PyTorch + CUDA, el ThinkPad. Si es Ollama + MLX + trabajo mixto, el Mac.
| Modelo | Pantalla | Procesador | RAM | SSD | Gráfica | Autonomía real | Peso | SO | Precio desde |
|---|---|---|---|---|---|---|---|---|---|
| MacBook Pro M4 Max 16″ | 16,2″ Liquid Retina XDR 120 Hz | Apple M4 Max (38 TOPS NPU) | 128 GB unificada | 2 TB | GPU 40 núcleos integrada | 14-16 h | 2,15 kg | macOS Sequoia | 5.499 € |
| Lenovo ThinkPad P16 Gen 2 | 16″ WQUXGA | Intel Core i9-13980HX | 64 GB DDR5 (hasta 192 GB) | 1 TB | NVIDIA RTX 5000 Ada 16 GB | 4-6 h | 3,00 kg | Windows 11 Pro | 3.899 € |
Tabla resumen con puntuación
Puntuación del 1 al 10 ponderando RAM/VRAM disponible, potencia de GPU/NPU para inferencia, autonomía, portabilidad y precio.
| Portátil | Modelo LLM máx. cómodo | NPU TOPS | RAM máx. | VRAM | Precio desde | Nota IA local |
|---|---|---|---|---|---|---|
| Microsoft Surface Laptop 7 | 7B | 45 | 32 GB | — | 2.199 € | 7,5 |
| ASUS Zenbook S 14 | 7B-13B | 47 | 32 GB | — | 1.699 € | 8,0 |
| HP OmniBook Ultra 14 | 7B-13B | 55 | 32 GB | — | 1.799 € | 8,0 |
| Dell XPS 13 (2024) | 7B | 45 | 64 GB | — | 1.599 € | 7,0 |
| MacBook Pro M4 Pro 14″ | 30B-34B | 38 | 48 GB | unificada | 2.899 € | 9,0 |
| ASUS ProArt P16 | 13B-30B | 50 | 64 GB | 8 GB | 2.499 € | 8,5 |
| Razer Blade 16 | 13B-30B | — | 32 GB | 16 GB | 3.999 € | 8,0 |
| MacBook Pro M4 Max 16″ | 70B | 38 | 128 GB | unificada | 5.499 € | 9,5 |
| Lenovo ThinkPad P16 Gen 2 | 70B (offload) | — | 192 GB | 16 GB | 3.899 € | 8,5 |
Recomendaciones finales por perfil
- Empezar en IA local sin arruinarse (7B-13B): ASUS Zenbook S 14 como principal por precio y NPU de 47 TOPS. Alternativa: HP OmniBook Ultra 14 si quieres los 55 TOPS de la NPU de AMD y algo más de músculo gráfico integrado.
- Desarrollo pro con modelos hasta 30B: MacBook Pro M4 Pro con 48 GB como principal. Alternativa Windows: ASUS ProArt P16 si necesitas CUDA sí o sí.
- Investigación / 70B en local: MacBook Pro M4 Max con 128 GB como principal. Alternativa: Lenovo ThinkPad P16 Gen 2 si tu stack vive en PyTorch + CUDA y no quieres tocar MLX.
Un apunte final: el Copilot+ PC es un buen sello para funciones nativas de Windows 11, pero no es lo que decide si tu Llama 3.1 corre bien. Lo que decide es cuánta memoria puede ver tu modelo. Prioriza RAM antes que TOPS. Si te interesa el detalle de qué desbloquea esa certificación en el día a día, ya lo desglosamos en la guía de portátiles Copilot+ PC.
Preguntas frecuentes
¿Cuánta RAM necesito para ejecutar un modelo de 7B parámetros en local?
Con 16 GB de RAM del sistema vas sobrado para un 7B cuantizado a 4 bits (ocupa unos 5-6 GB). Con 8 GB puedes hacerlo, pero te quedas sin margen para el sistema operativo y el navegador. Si el portátil comparte RAM con la iGPU, sube a 32 GB por seguridad.
¿Qué son los 40 TOPS del sello Copilot+ PC y por qué importan?
Es el umbral de rendimiento de NPU que Microsoft exige para certificar un portátil como Copilot+ PC. Habilita funciones nativas de Windows 11 (Recall, Cocreator, subtítulos en directo con traducción) que se ejecutan sin conexión. Para Ollama o LM Studio no es imprescindible porque esos frameworks tiran principalmente de GPU o CPU, no de NPU.
¿Es mejor Mac o Windows para IA local en 2026?
Depende del tamaño del modelo. Para 30B o más, la memoria unificada del MacBook Pro M4 Pro/Max es la vía más limpia y silenciosa. Para modelos hasta 13B y frameworks que exigen CUDA (PyTorch, bitsandbytes), un Windows con RTX dedicada sigue siendo más flexible y barato.
¿Puedo ejecutar Llama 3.1 70B en un portátil?
Sí, pero solo en configuraciones concretas: MacBook Pro M4 Max con 64 GB o más de memoria unificada, o workstations tipo ThinkPad P16 con 64+ GB de RAM haciendo offload parcial a la GPU vía llama.cpp. Espera 3-8 tokens por segundo en el mejor de los casos. Para uso serio de un 70B, un desktop con dos GPU sigue siendo más razonable.

3 comentarios
Pingback: Lenovo ThinkPad X1 Carbon Gen 12 vs HP EliteBook 840 G11: cuál elegir como portátil de empresa – Decisión de Tecnología
Pingback: Top 5 portátiles Copilot+ PC a la venta en España ordenados por rendimiento en IA local – Decisión de Tecnología
Pingback: ASUS ROG Zephyrus G14 (2024) vs Lenovo Legion Slim 5: qué portátil gaming compacto elegir – Decisión de Tecnología