Déballage du Mac Studio M4 et exécution de votre premier LLM
Lectures réelles de mactop sur une nouvelle installation M4 Max, Ollama, Llama 3 localement et un pipeline RAG privé en un après-midi
Un compagnon court et lisible pour la plongée profonde longue. Pour la procédure complète, accédez à le long article.
La boîte sur le bureau est désormais un appareil IA
J'ai déballé un nouveau Mac Studio avec la puce M4 Max, 128 GB de mémoire unifiée, 40 cœurs GPU, 16 cœurs CPU et un SSD de 2 To. En un après-midi, il exécutait Llama 3.1 8B localement via Ollama, intégrait mes propres documents et répondait aux questions via un petit pipeline RAG. Pas de facture cloud, pas de clé API, pas de données sortant de la pièce.
Ce blog est la version courte. L’article complet décrit en profondeur le même flux de travail.
Le déballage en 60 secondes
Regardez le court métrage de déballage sur YouTube : https://youtube.com/shorts/HUlUoHNsyNM
Déballage Apple classique : carton minimal, la machine dans un évidement moulé, un câble d'alimentation. Le boîtier Mac Studio mesure environ 7,7 pouces carrés et est dense ; vous ressentez la qualité de construction dès que vous le récupérez. La configuration est vraiment rapide - identifiant Apple, langue, FileVault, c'est fait.
Premier démarrage - vraies lectures de mactop
/img/mac-studio-mactop-firstboot.png pour l'échanger plus tard.Les chiffres ci-dessus sont les seuls chiffres concrets que je citerai. Ils sont la vérité terrain de mactop sur ma machine à 37 minutes de disponibilité :
- M4 Max - 16 cœurs (4 E + 12 P), 40 cœurs GPU à 784 MHz, 16 cœurs ANE.
- 128 mémoire unifiée GB - 16,62 GB en utilisation au ralenti (environ 13%).
- 6,48 W puissance totale au ralenti, 46,33 W max observé. Thermiques : nominales.
- SSD de 2 To, 1,9 To gratuits après la configuration initiale.
6,48 W au repos pour un ordinateur de bureau avec 128 GB de mémoire utilisable est pour moi le chiffre principal. Ce boîtier est véritablement un appareil d’IA à faible consommation et toujours allumé que vous pouvez laisser fonctionner 24h/24 et 7j/7 sans penser à la facture d’électricité.
Pourquoi ce matériel est spécial - mémoire unifiée en un seul paragraphe
Sur un PC traditionnel, votre CPU dispose d'une RAM système et votre GPU d'une VRAM séparée. Un modèle doit être copié sur PCIe avant que le GPU puisse l'exécuter ; si le modèle est plus grand que la VRAM, il ne rentre pas. Sur Apple Silicon, les moteurs CPU, GPU, Neural Engine et multimédia partagent un Piscine 128 GB. Rien n'est copié. Un LLM avec un paramètre 70B au Q4_K_M (environ 40 GB sur disque, estimation publique) se charge avec environ 80 GB toujours gratuits pour le contexte, les applications et les outils. C'est pourquoi les LLM locaux se sentent différents sur un Mac.
De la boîte au premier LLM en trois commandes
brew install ollama
ollama serve &
ollama run llama3.1:8b "Explain unified memory in 3 sentences."
C’est vraiment tout le sujet. La première exécution télécharge le modèle (Llama 3.1 8B Q4_K_M fait environ 4,7 GB sur disque, estimation publique) et le charge dans la mémoire unifiée. Après cela, le streaming conversationnel est fluide, avec un délai notable au premier jeton et une sortie constante tout au long de la réponse. Je ne publie délibérément pas ici de chiffres de jetons par seconde sans une méthodologie de référence appropriée ; le long article entre dans le raisonnement.
RAG local en moins de 60 lignes de Python
La chose la plus utile que vous puissiez faire avec un LLM local est de le pointer vers vos propres documents. La pile minimale viable est :
- PyMuPDF ou
unstructuredpour l'analyse - nomic-embed-text via Ollama pour les intégrations
- ChromaDB pour le magasin vectoriel
- Llama 3.1 8B via Ollama pour la génération
Le code complet est dans le long article. Le titre est le suivant : tout fonctionne sur le Mac Studio, pas de clés API externes, pas de facturation par jeton, aucune donnée ne quitte la machine.
Mac Studio vs cloud : la matrice de décision honnête
Mac Studio gagne pour : l'inférence privée permanente, RAG sur vos propres données, les copilotes IDE, le prototypage d'agent, l'apprentissage de la pile et les laboratoires à domicile. Le cloud gagne pour : les tâches de formation en rafale, la production >70 B à grande échelle, le trafic mondial imprévisible et les charges de travail qui nécessitent un parallélisme 8x A100/H100. La plupart des équipes finiront par utiliser les deux. Le long article contient une matrice de décision complète au format SVG.
Cinq leçons après une semaine
- La confidentialité ouvre la voie à de nouveaux cas d’utilisation. Lorsque le modèle est local, je colle sans hésiter les logs de production, les documents internes et les emails des clients. Cela change ma façon de travailler.
- Le coût par requête est à la fois psychologique et financier. Aucune facture signifie plus de requêtes, plus d’expériences, plus de curiosité.
- 128 GB est le point idéal. 64 GB est le sol idéal pour un travail sérieux. 128 GB vous donne une marge pour exécuter 70B au Q4_K_M et avoir encore de la place pour tout le reste.
- Ollama est la rampe d'accès facile. LM Studio est excellent en tant que navigateur de modèles, MLX est idéal si vous débutez avec Python, llama.cpp sous-tend tout.
- Le cloud n'est pas mort. Il s'agit toujours de l'outil idéal pour la formation, le service évolutif et les charges de travail à charge inconnue.
Quelle est la prochaine étape
Les prochains articles couvriront le réglage fin de MLX sur Apple Silicon, les clusters d'inférence multi-Mac avec EXO, les piles d'agents (LangGraph + Ollama) et un élément méthodologique de référence plus approfondi. Si vous voulez la version longue avec tous les diagrammes, le code et la matrice de décision, lisez le long article. Si vous voulez la version visuelle, regardez le Court métrage YouTube. Quoi qu'il en soit, abonnez-vous pour le reste de la série.