Le bon LLM local sur Mac mini dépend surtout de votre mémoire unifiée et de votre usage. Codage, raisonnement, multimodal, agents locaux… je vous montre les modèles à privilégier, ceux à éviter selon la config, et les commandes Ollama utiles pour démarrer vite.
Quel modèle choisir selon la mémoire ?
Je choisis toujours un LLM local selon la mémoire unifiée du Mac mini, pas selon le nombre de paramètres affiché. C’est le piège classique. Un modèle 70B peut faire rêver sur le papier, mais si votre Mac passe son temps à swapper sur le disque, l’expérience devient vite pénible.
La taille indiquée par Ollama donne une bonne première idée, mais ce n’est pas la mémoire réellement confortable. Il faut garder de la marge pour macOS, votre outil de chat ou d’automatisation, le contexte chargé dans le modèle, et parfois d’autres applis ouvertes. J’ai déjà vu un client lancer un gros modèle “compatible” sur le papier, puis attendre chaque réponse comme si la machine réfléchissait à sa vie. Le modèle n’était pas mauvais. Il était juste trop serré.
| Mémoire Mac mini | Modèles adaptés | Usage recommandé |
| 16 Go et plus | gpt-oss-20b | Raisonnement et agents locaux |
| 24 Go et plus | Gemma 4 26B, Qwen3-Coder 30B, Qwen3.6 27B | Multimodal, code, polyvalence plus légère |
| 32 Go et plus | Qwen3.6 35B | Polyvalent, texte, images, raisonnement, dépôts de code |
| 48 à 64 Go | Llama 3.3 70B | Gros modèle local sur Mac mini haute mémoire |
Avec 16 Go, je reste raisonnable. Gpt-oss-20b est le choix logique si vous voulez faire tourner des agents locaux, tester du raisonnement, automatiser des tâches simples, sans transformer le Mac mini en radiateur.
Avec 24 Go, ça devient plus confortable. Gemma 4 26B est intéressant pour le multimodal, c’est-à-dire texte plus image. Qwen3-Coder 30B vise surtout le code, les scripts, les corrections, les explications techniques. Qwen3.6 27B joue plutôt la carte polyvalente, avec un bon équilibre si vous voulez un modèle général sans aller trop haut.
Avec 32 Go, Qwen3.6 35B devient le bon candidat. Là, on peut travailler plus sérieusement sur du texte long, du raisonnement, des images, ou des dépôts de code un peu plus lourds.
Avec 48 à 64 Go, Llama 3.3 70B devient réaliste. Pas magique, pas gratuit en ressources, mais réaliste. C’est le choix si vous voulez un gros modèle généraliste local et que vous acceptez qu’il prenne de la place. Mon conseil reste simple : gardez toujours de la marge. Un modèle un peu plus petit, mais fluide, vaut souvent mieux qu’un modèle énorme qui rame.
Quel LLM local est le plus polyvalent ?
Pour moi, le LLM local le plus polyvalent sur Mac mini en 2026, c’est Qwen3.6 35B. Pas forcément le plus léger, pas forcément celui qui répond le plus vite dans tous les cas, mais celui qui couvre le plus d’usages sérieux sans donner l’impression de bricoler.
Avec environ 23 Go via Ollama, Qwen3.6 35B devient vraiment intéressant si votre Mac mini a au moins 32 Go de mémoire unifiée. La mémoire unifiée, c’est la RAM partagée entre le processeur, le GPU et le reste du système. Sur Apple Silicon, c’est puissant, mais ça se remplit vite. Et quand le modèle prend déjà 23 Go, il faut garder de l’air pour macOS, votre IDE, le navigateur, Docker, ou juste deux onglets Chrome qui décident de vivre leur meilleure vie.
Ce modèle coche beaucoup de cases en même temps. Il gère le texte, les images, le raisonnement, le code, et surtout les grands contextes avec une fenêtre annoncée à 256K. Une fenêtre de contexte, c’est la quantité d’informations que le modèle peut garder sous les yeux dans une conversation. Avec 256K, on peut commencer à lui donner de gros fichiers, des specs longues, ou des morceaux entiers d’un dépôt.
Là où je le trouve vraiment bon, c’est pour les usages agentiques. Agentique veut juste dire que le modèle ne fait pas que répondre, il peut aider à planifier, lire plusieurs fichiers, proposer des changements, raisonner sur un dépôt complet et avancer comme un assistant de dev. J’ai vu ça chez un client avec une base de code un peu vieillissante, le gain n’était pas “magique”, mais le modèle aidait clairement à garder le fil entre plusieurs services.
# Lancer Qwen3.6 35B en local avec Ollama
ollama run qwen3.6:35b
Sur un Mac mini 24 Go, je serais plus prudent. Qwen3.6 27B, autour de 18 Go, peut être un meilleur choix au quotidien. Le meilleur modèle, ce n’est pas celui qu’on arrive tout juste à charger. C’est celui qu’on peut utiliser confortablement, sans swap permanent, sans latence pénible, sans fermer toutes ses apps.
| Modèle | Taille approximative | Mémoire conseillée | Intérêt principal | Compromis |
| Qwen3.6 35B | Environ 23 Go | 32 Go minimum | Très polyvalent, bon pour code, images, raisonnement et dépôts larges | Plus lourd, moins confortable sur 24 Go |
| Qwen3.6 27B | Environ 18 Go | 24 Go réalistes | Meilleur équilibre pour un Mac mini plus limité | Un peu moins solide sur les tâches complexes et longues |
Quel modèle pour coder et raisonner ?
Pour coder en local sur un Mac mini, je ne mets pas tous les modèles dans le même panier. J’ai deux choix assez nets. Qwen3-Coder 30B quand je veux travailler sérieusement sur du code. Gpt-oss-20b quand je veux surtout raisonner, planifier, orchestrer des agents ou garder une empreinte mémoire plus accessible.
Qwen3-Coder 30B est le modèle que je prends pour le développement local. Il annonce 30 milliards de paramètres au total, mais avec environ 3,3 milliards de paramètres activés à chaque inférence. Ça veut dire qu’il ne “réveille” qu’une partie du modèle selon la tâche, ce qui aide à garder de bonnes performances sans exploser la machine. Il est pensé pour l’ingénierie logicielle agentique, donc les usages où le modèle lit, modifie, teste et enchaîne plusieurs actions sur un projet. Sur des grands dépôts, des refactors longs, ou des tâches qui demandent de garder le contexte, c’est clairement son terrain.
Sur Ollama, sa taille tourne autour de 19 Go. En pratique, je le réserve plutôt à un Mac mini avec 24 Go de mémoire unifiée ou plus. En dessous, ça peut tourner, mais on commence vite à sentir les limites si on a aussi un IDE, Docker, un navigateur et deux trois services ouverts. Je l’ai vu chez un client, le modèle allait bien, mais la machine swapait dès que VS Code et Chrome prenaient leurs aises.
# Lancer Qwen3-Coder 30B pour le développement local
ollama run qwen3-coder:30b
Gpt-oss-20b joue un rôle différent. C’est le meilleur choix open-source de raisonnement dans cette sélection. Il demande autour de 16 Go, avec une taille Ollama autour de 14 Go. Sa fenêtre de contexte monte à 128K, donc il peut absorber de gros documents, des plans techniques, des logs, ou plusieurs fichiers à analyser ensemble.
Il est orienté raisonnement, charges agentiques et effort de raisonnement configurable. L’effort de raisonnement, c’est simplement le niveau d’énergie que le modèle met dans sa réflexion avant de répondre. Plus on pousse, plus il peut être pertinent sur des problèmes complexes, mais plus ça coûte en temps. Il est distribué sous Apache 2.0, avec une politique d’usage spécifique gpt-oss, donc je vérifie toujours les conditions avant un usage produit.
# Lancer gpt-oss-20b pour le raisonnement local
ollama run gpt-oss:20b
| Besoin | Modèle |
| Écrire, comprendre et modifier du code | Qwen3-Coder 30B |
| Raisonner, planifier, construire des agents locaux plus légers | Gpt-oss-20b |
Mon choix est simple. Je prends Qwen3-Coder 30B pour travailler sur du code. Je prends gpt-oss-20b pour raisonner proprement et construire des agents locaux plus légers.
Quel modèle pour le multimodal ?
Pour le multimodal sur Mac mini, je mettrais Gemma 4 26B A4B en haut de la pile. C’est le modèle le plus intéressant de cette sélection dès qu’on veut travailler à la fois sur du texte et des images, sans basculer directement sur un modèle énorme qui mange toute la mémoire.
Le point important, c’est son architecture Mixture-of-Experts. Dit simplement, le modèle contient plusieurs “experts” internes, mais il n’en active qu’une partie à chaque requête. Gemma 4 26B A4B affiche environ 25.2B paramètres au total, mais seulement autour de 3.8B paramètres sont activés par inférence. L’inférence, c’est juste le moment où le modèle répond à votre demande. Résultat, les besoins de calcul effectifs sont plus contenus que ce que le chiffre 26B laisse penser au premier regard.
| Modèle | Usage naturel |
| Gemma 4 26B A4B | Texte + images avec une empreinte calcul raisonnable |
| Gemma 4 31B dense | Variante plus lourde, sans activation partielle MoE |
| Versions edge | Machines plus contraintes, usages plus légers |
La fenêtre de contexte annoncée à 256K est aussi un vrai avantage. Ça veut dire qu’on peut lui donner beaucoup de contenu en une seule fois, par exemple un long document, des notes, des extraits, puis ajouter une image à analyser. Sur un Mac mini avec 24 Go de mémoire unifiée ou plus, c’est le genre de modèle qui commence à devenir vraiment exploitable en local.
Avec Ollama, je le lance simplement comme ça :
# Lancer Gemma 4 26B en local pour texte et images
ollama run gemma4:26b
Je serais juste clair sur le choix. Si votre besoin principal, c’est du code pur, je préfère Qwen3-Coder. Il est plus logique pour générer, lire et corriger du code. Si votre besoin est plus transversal, avec du texte, des documents, des captures, des visuels ou des analyses d’image, Gemma 4 26B a plus de sens.
Comment les lancer sur Mac mini ?
Le plus simple, sur Mac mini, c’est de ne pas compliquer les choses. J’utilise Ollama quand je veux aller vite en ligne de commande, surtout sur des profils développeur, data ou automatisation. Et je garde LM Studio quand je veux tester tranquillement des modèles avec une interface, comparer deux variantes, ou faire essayer ça à quelqu’un qui n’a pas envie d’ouvrir un terminal.
Il faut juste avoir Ollama installé avant de lancer ces commandes. Je ne détaille pas l’installation ici, parce que l’idée c’est vraiment la recette directe : vous choisissez le modèle selon votre besoin et la RAM de votre Mac mini.
# Modèle polyvalent puissant, conseillé sur 32 Go et plus
ollama run qwen3.6:35b
# Modèle multimodal texte et images, conseillé sur 24 Go et plus
ollama run gemma4:26b
# Modèle de raisonnement plus accessible, conseillé sur 16 Go et plus
ollama run gpt-oss:20b
# Modèle spécialisé codage, conseillé sur 24 Go et plus
ollama run qwen3-coder:30b
# Gros modèle local, réservé aux Mac mini 48 à 64 Go
ollama run llama3.3:70b
Dans la vraie vie, je commence rarement par le plus gros modèle. Même avec une bonne machine. Je préfère valider l’usage, la vitesse, la qualité des réponses, puis monter en taille si ça vaut le coup. J’ai déjà vu des équipes vouloir absolument lancer un 70B localement, alors qu’un modèle plus petit faisait le travail plus vite et avec moins de friction.
LM Studio devient intéressant quand vous voulez voir ce que vous faites. Vous téléchargez, vous testez, vous changez de modèle, vous comparez les réponses. C’est plus confortable pour un profil métier, un product owner, un consultant, ou quelqu’un qui veut expérimenter sans se battre avec la ligne de commande. Pour un profil dev ou data, Ollama reste souvent le chemin le plus court.
| Besoin | Modèle conseillé | Commande Ollama |
| Usage général puissant | Qwen3.6 35B | ollama run qwen3.6:35b |
| Texte et images | Gemma4 26B | ollama run gemma4:26b |
| Raisonnement sur Mac mini 16 Go | GPT-OSS 20B | ollama run gpt-oss:20b |
| Développement et génération de code | Qwen3 Coder 30B | ollama run qwen3-coder:30b |
| Gros modèle local | Llama 3.3 70B | ollama run llama3.3:70b |
Alors, quel LLM local vaut vraiment le coup sur votre Mac mini ?
Je partirais d’une règle simple : choisissez le modèle que votre Mac mini peut faire tourner confortablement, pas celui qui impressionne le plus sur le papier. Avec 16 Go, gpt-oss-20b est le choix raisonnable. À 24 Go, Qwen3-Coder 30B et Gemma 4 26B deviennent intéressants. À 32 Go, Qwen3.6 35B prend tout son sens. Et sur 48 à 64 Go, Llama 3.3 70B devient jouable. Ollama permet de tester vite, LM Studio aide à comparer plus visuellement. Le bénéfice pour vous, c’est un choix clair, adapté à votre machine et à vos vrais usages.
FAQ
- Quel est le meilleur LLM local pour un Mac mini 16 Go ?
Je choisirais gpt-oss-20b. Il est donné autour de 14 Go via Ollama et demande environ 16 Go de mémoire. Il vise surtout le raisonnement, les charges agentiques et les usages où l’on veut rester sur une empreinte plus raisonnable. - Est-ce qu’un Mac mini 24 Go suffit pour faire tourner des LLM locaux ?
Oui, mais il faut rester lucide sur le choix du modèle. À 24 Go et plus, les options intéressantes sont Gemma 4 26B, Qwen3-Coder 30B et Qwen3.6 27B. Pour Qwen3.6 35B, je préfère viser 32 Go et plus. - Quel modèle local choisir pour coder sur Mac mini ?
Pour le code, je prendrais Qwen3-Coder 30B. Il est optimisé pour l’ingénierie logicielle agentique, les grands dépôts et les tâches longues. Ollama l’indique autour de 19 Go, donc je le réserve plutôt à un Mac mini avec 24 Go ou plus. - Quel LLM local utiliser pour traiter du texte et des images ?
Gemma 4 26B A4B est le meilleur candidat multimodal dans cette sélection. Il supporte texte et images, propose un contexte 256K, et son architecture Mixture-of-Experts active seulement une partie des paramètres à chaque inférence. - Est-ce que Llama 3.3 70B est adapté à tous les Mac mini ?
Non. La version quantifiée fournie par Ollama tourne autour de 43 Go et vise plutôt les Mac mini avec 48 à 64 Go de mémoire. Je ne le recommanderais pas sur 16 Go ou 24 Go.
A propos de l’auteur
Je suis Franck Scandolera, expert et formateur en tracking avancé server-side, Analytics Engineering, automatisation No/Low Code avec n8n, intégration de l’IA en entreprise et SEO/GEO. J’accompagne des équipes qui veulent utiliser la data et l’IA sans usine à gaz, avec des cas d’usage concrets et mesurables. J’ai travaillé avec des clients comme Logis Hôtel, Yelloh Village, BazarChic, la Fédération Française de Football ou Texdecor. Je dirige l’agence webAnalyste et l’organisme Formations Analytics. Si vous voulez cadrer vos usages IA ou automatiser vos process business, contactez-moi.
⭐ Analytics engineer, Data Analyst et Automatisation IA indépendant ⭐
- Ref clients : Logis Hôtel, Yelloh Village, BazarChic, Fédération Football Français, Texdecor…
Mon terrain de jeu :
- Data Analyst & Analytics engineering : tracking avancé (GTM server, e-commerce, CAPI, RGPD), entrepôt de données (BigQuery, Snowflake, PostgreSQL, ClickHouse), modèles (Airflow, dbt, Dataform), dashboards décisionnels (Looker, Power BI, Metabase, SQL, Python).
- Automatisation IA des taches Data, Marketing, RH, compta etc : conception de workflows intelligents robustes (n8n, App Script, scraping) connectés aux API de vos outils et LLM (OpenAI, Mistral, Claude…).
- Engineering IA pour créer des applications et agent IA sur mesure : intégration de LLM (OpenAI, Mistral…), RAG, assistants métier, génération de documents complexes, APIs, backends Node.js/Python.






