AI Models for iPhone 16e — What runs on 8GB
Specs checked against manufacturer and public documentation on .
What runs on the iPhone 16e
All 93 models at their recommended quant, on the 8GB configuration. Select any row for the full report.
| Model | Params | Quant | Needs | Speed | Verdict |
|---|---|---|---|---|---|
| Qwen3 0.6B | 0.6B | Q8_0 | 1.3 GB | ~45 tokens/s | ✓ Runs great |
| Qwen3 1.7B | 1.7B | Q8_0 | 2.6 GB | ~15 tokens/s | ✓ Runs great |
| Llama 3.2 1B | 1.2B | Q4_K_M | 1.5 GB | ~33.8 tokens/s | ✓ Runs great |
| Gemma 3 1B | 1B | Q4_K_M | 1.5 GB | ~33.8 tokens/s | ✓ Runs great |
| DeepSeek R1 Distill 1.5B | 1.8B | Q4_K_M | 1.9 GB | ~24.5 tokens/s | ✓ Runs great |
| SmolLM2 1.7B | 1.7B | Q4_K_M | 1.9 GB | ~24.5 tokens/s | ✓ Runs great |
| Qwen 3.5 2B | 2B | Q4_K_M | 2.1 GB | ~20.8 tokens/s | ✓ Runs great |
| Ternary Bonsai 4B | 4B | Q2_0 | 2 GB | ~24.5 tokens/s | ✓ Runs great |
| Ternary Bonsai 1.7B | 1.7B | Q2_0 | 1.2 GB | ~54 tokens/s | ✓ Runs great |
| LFM2.5 2.6B | 2.7B | Q4_K_M | 2.6 GB | ~15.9 tokens/s | ✓ Runs great |
| LFM2.5-VL 3B | 3.1B | Q4_K_M | 2.6 GB | ~15.9 tokens/s | ✓ Runs great |
| OvisOCR2 0.8B | 0.8B | Q4_K_M | 1.3 GB | ~45 tokens/s | ✓ Runs great |
| SmolLM3 3B | 3.1B | Q4_K_M | 2.8 GB | ~14.2 tokens/s | ✓ Runs great |
| G9v3 3B | 3B | Q4_K_M | 2.8 GB | ~14.2 tokens/s | ✓ Runs great |
| Llama 3.2 3B | 3.2B | Q4_K_M | 2.9 GB | ~13.5 tokens/s | ✓ Runs great |
| Ministral 3 3B | 3B | Q4_K_M | 3 GB | ~12.9 tokens/s | ✓ Runs great |
| Granite 4.2 3B | 3B | Q4_K_M | 3.1 GB | ~12.3 tokens/s | ✓ Runs great |
| Ternary Bonsai 8B | 8B | Q2_0 | 3.5 GB | ~12.3 tokens/s | ✓ Runs great |
| Qwen3 4B | 4B | Q4_K_M | 3.5 GB | ~10.8 tokens/s | ✓ Runs great |
| Gemma 3 4B | 4.3B | Q4_K_M | 3.5 GB | ~10.8 tokens/s | ✓ Runs great |
| Phi-4 Mini 3.8B | 3.8B | Q4_K_M | 3.5 GB | ~10.8 tokens/s | ✓ Runs great |
| Qwen 3.5 4B | 4B | Q4_K_M | 3.7 GB | ~10 tokens/s | ✓ Runs great |
| Agents-A1 4B | 4B | Q4_K_M | 3.7 GB | ~10 tokens/s | ✓ Runs great |
| Nanbeige 4.2 3B | 4.2B | Q4_K_M | 3.7 GB | ~10 tokens/s | ✓ Runs great |
| Nemotron 3 Nano 4B | 4B | Q4_K_M | 3.8 GB | ~9.6 tokens/s | ✓ Runs great |
| AREX Turbo 4B | 4.5B | Q4_K_M | 4 GB | ~9.3 tokens/s | ✓ Runs great |
| Fara 1.5 4B | 4.5B | Q4_K_M | 4 GB | ~9.3 tokens/s | ✓ Runs great |
| Gemma 4 E2B | 2B | Q4_K_M | 4 GB | ~8.7 tokens/s | ✓ Runs great |
| Bonsai 27B (1-bit) | 27B | Q1_0 | 4.8 GB | ~7.1 tokens/s | ! Runs, barely |
| Mistral 7B v0.3 | 7.2B | Q4_K_M | 5.7 GB | — | ✕ Won't fit |
| DeepSeek R1 Distill 7B | 7.6B | Q4_K_M | 6.1 GB | — | ✕ Won't fit |
| Gemma 4 E4B | 4B | Q4_K_M | 6.1 GB | — | ✕ Won't fit |
| Llama 3.1 8B | 8B | Q4_K_M | 6.3 GB | — | ✕ Won't fit |
| Ministral 8B | 8B | Q4_K_M | 6.3 GB | — | ✕ Won't fit |
| Ling 3.0 Tiny | 7.9B | Q4_K_M | 6.3 GB | — | ✕ Won't fit |
| Qwen3 8B | 8.2B | Q4_K_M | 6.4 GB | — | ✕ Won't fit |
| Ministral 3 8B | 8B | Q4_K_M | 6.6 GB | — | ✕ Won't fit |
| LFM2.5 8B-A1B | 8B | Q4_K_M | 6.6 GB | — | ✕ Won't fit |
| Tini Cybersec 8B-A1B | 8.5B | Q4_K_M | 6.7 GB | — | ✕ Won't fit |
| Granite 4.2 8B | 8B | Q4_K_M | 6.7 GB | — | ✕ Won't fit |
| Ornith 1.0 9B | 9B | Q4_K_M | 7.1 GB | — | ✕ Won't fit |
| Qwen 3.5 9B | 9B | Q4_K_M | 7.2 GB | — | ✕ Won't fit |
| Qwythos 9B v2 | 9B | Q4_K_M | 7.2 GB | — | ✕ Won't fit |
| GRM 3.2 Cliff 9B | 9.4B | Q4_K_M | 7.5 GB | — | ✕ Won't fit |
| grug 9B (ProCreations) | 9.4B | Q4_K_M | 7.5 GB | — | ✕ Won't fit |
| Fara 1.5 9B | 9.4B | Q4_K_M | 7.5 GB | — | ✕ Won't fit |
| UI-Mate 9B | 9B | Q4_K_M | 7.4 GB | — | ✕ Won't fit |
| Ternary Bonsai 27B | 27B | Q2_0 | 8.4 GB | — | ✕ Won't fit |
| Gemma 4 12B | 12B | Q4_0 | 8.8 GB | — | ✕ Won't fit |
| Gemma 3 12B | 12.2B | Q4_K_M | 9.1 GB | — | ✕ Won't fit |
| Grug 12B | 12B | Q4_K_M | 9.5 GB | — | ✕ Won't fit |
| Ministral 3 14B | 14B | Q4_K_M | 10.2 GB | — | ✕ Won't fit |
| Qwen3 14B | 14.8B | Q4_K_M | 11.1 GB | — | ✕ Won't fit |
| Qwen3 30B A3B | 30.5B | Q4_K_M | 22.3 GB | — | ✕ Won't fit |
| Phi-4 14B | 14.7B | Q4_K_M | 11.2 GB | — | ✕ Won't fit |
| Qwen 3.5 27B | 27B | Q4_K_M | 20 GB | — | ✕ Won't fit |
| Qwen 3.5 35B-A3B | 35B | Q4_K_M | 26.2 GB | — | ✕ Won't fit |
| Qwen 3.6 27B | 27B | Q4_K_M | 18.5 GB | — | ✕ Won't fit |
| Qwen 3.6 35B-A3B | 35B | Q4_K_M | 23.9 GB | — | ✕ Won't fit |
| Gemma 4 26B-A4B | 26B | Q4_0 | 17.5 GB | — | ✕ Won't fit |
| Nemotron 3 Nano 30B-A3B | 30B | Q4_K_M | 28.5 GB | — | ✕ Won't fit |
| Nemotron 3 Nano Omni 30B-A3B | 31B | Q4_K_M | 26.3 GB | — | ✕ Won't fit |
| Nemotron 3.5 Lightning 30B-A3B | 30B | Q8_0 | 35.9 GB | — | ✕ Won't fit |
| GPT-OSS 20B | 21B | MXFP4 | 14.8 GB | — | ✕ Won't fit |
| Ornith 1.0 35B-A3B | 35B | Q4_K_M | 25.3 GB | — | ✕ Won't fit |
| XYZ-Aquila mini 35B-A3B | 35B | Q4_K_M | 25.5 GB | — | ✕ Won't fit |
| Salience 1.5 Flash | 30B | Q4_K_M | 22.3 GB | — | ✕ Won't fit |
| Fara 1.5 27B | 27B | Q4_K_M | 20.9 GB | — | ✕ Won't fit |
| KAT-Coder V2.5 Dev | 35B | Q4_K_M | 25.5 GB | — | ✕ Won't fit |
| BigBang V1 36B-A3B | 36B | Q4_K_M | 26.1 GB | — | ✕ Won't fit |
| Muse Glimmer 30B | 29.6B | K_QUANT_17GB | 20.3 GB | — | ✕ Won't fit |
| Qwen3.8 27B | 27B | Q4_K_M | 20.8 GB | — | ✕ Won't fit |
| Qwen3.8 2.4T-A95B | 2400B | IQ4_XS | 1377.4 GB | — | ✕ Won't fit |
| UI-Mate 27B | 27B | Q4_K_M | 20.9 GB | — | ✕ Won't fit |
| GLM-4.5V | 106B | Q4_K_M | 74.8 GB | — | ✕ Won't fit |
| GLM-4.5-Air | 106B | Q4_K_M | 74.8 GB | — | ✕ Won't fit |
| Granite 4.2 30B | 30B | Q4_K_M | 21.3 GB | — | ✕ Won't fit |
| Apodex 1.1 Mini | 35B | Q4_K_M | 26 GB | — | ✕ Won't fit |
| Ling 3.0 Flash | 124B | Q4_K_M | 82.3 GB | — | ✕ Won't fit |
| Qwen3.8-Flash-Next | 125B | IQ4_XS | 107.7 GB | — | ✕ Won't fit |
| GLM-5.3 | 744B | Q4_K_XL | 543.3 GB | — | ✕ Won't fit |
| GLM-5.3-Flash | 320B | Q4_K_XL | 232.7 GB | — | ✕ Won't fit |
| Llama 3.3 70B | 70B | Q4_K_M | 50.1 GB | — | ✕ Won't fit |
| Qwen3 32B | 32.8B | Q4_K_M | 23.7 GB | — | ✕ Won't fit |
| Ornith 1.0 397B | 397B | Q4_K_M | 285.6 GB | — | ✕ Won't fit |
| Gemma 4 31B | 31B | Q4_K_M | 22 GB | — | ✕ Won't fit |
| Hunyuan 3 (Hy3) | 298.8B | Q4_K_M | 212.8 GB | — | ✕ Won't fit |
| DeepSeek V4 Flash 0731 | 284B | Q4_K_XL | 163.6 GB | — | ✕ Won't fit |
| Inkling | 952.4B | Q8_0 | 966.9 GB | — | ✕ Won't fit |
| Inkling Small | 276B | Q4_K_M | 190.5 GB | — | ✕ Won't fit |
| LongCat Flash Chat | 561.9B | IQ1_S | 159.6 GB | — | ✕ Won't fit |
| Laguna XS 2.1 | 33B | Q4_K_M | 24.2 GB | — | ✕ Won't fit |
| Laguna S 2.1 | 118B | Q4_K_M | 109.7 GB | — | ✕ Won't fit |
~ = bandwidth-based estimate · ✓ = measured on real hardware
Best model by use case
Top everyday assistant & writing pick here — ~45 tokens/s at Q8_0, using 1.3 of ~5.2GB.
Top code completion & explain-this pick here — ~14.2 tokens/s at Q4_K_M, using 2.8 of ~5.2GB.
Top math & step-by-step thinking pick here — ~24.5 tokens/s at Q4_K_M, using 1.9 of ~5.2GB.
FAQ
What is the biggest AI model the iPhone 16e can run?
Bonsai 27B (1-bit) (27B parameters) at Q1_0 — it needs 4.8GB of the ~5.2GB usable on the 8GB iPhone 16e, at ~7.1 tokens/s.
How much of the iPhone 16e's 8GB RAM can AI models actually use?
About 5.2GB. iOS caps a single app at roughly 65% of total RAM, so of the 8GB about 5.2GB is actually available to a model.
Can the iPhone 16e run Llama 3.1 8B?
Not at Q4_K_M: it needs 6.3GB but the iPhone 16e only has ~5.2GB usable. Try a smaller model like Qwen3 0.6B.
How fast is local AI on the iPhone 16e?
The Apple A18 has 60GB/s of memory bandwidth, which is what decode speed scales with. Small models like Ternary Bonsai 1.7B reach ~54 tokens/s; larger 7–14B models land in the single digits. Anything above ~8 tokens/s feels smooth for chat.
Which quantization should I use on the iPhone 16e?
Q4_K_M is the size/quality sweet spot for most models. For example, Qwen3 0.6B at Q8_0 takes 1.3GB of memory here. Only drop to Q3 or IQ4 if a model just misses fitting; Q8 rarely pays off on 8GB of RAM.
Is 8GB of RAM enough for local AI?
29 of the 93 models we track fit on the iPhone 16e — 28 run great and 1 run with compromises. 64 models (mostly 12B+) don't fit at their recommended quant.