<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Qwen &#8211; Collyre.net</title>
	<atom:link href="https://www.collyre.net/tag/qwen/feed/" rel="self" type="application/rss+xml" />
	<link>https://www.collyre.net/</link>
	<description></description>
	<lastBuildDate>Mon, 21 Sep 2026 01:46:17 +0000</lastBuildDate>
	<language>fr-FR</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1.1</generator>
	<item>
		<title>IA locale sur Mac : retours d’expérience</title>
		<link>https://www.collyre.net/ia-locale-mac-mini/</link>
		
		<dc:creator><![CDATA[Olivier Poncin]]></dc:creator>
		<pubDate>Sun, 20 Sep 2026 11:20:38 +0000</pubDate>
				<category><![CDATA[IA locale]]></category>
		<category><![CDATA[Apple Silicon]]></category>
		<category><![CDATA[IA]]></category>
		<category><![CDATA[llm]]></category>
		<category><![CDATA[Qwen]]></category>
		<guid isPermaLink="false">https://collyre.local/wp-root/?p=221</guid>

					<description><![CDATA[En préambule d’une série de tests de modèles de langage, moteurs d’inférence et outils de codage, voici mes constats et généralités concernant l’IA sur un Mac mini M4 Pro avec 48 Go de RAM.]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">Que peut-on attendre d’un Mac pour faire tourner de l’IA en local ? Quelle configuration pour quel usage ? Je vois beaucoup de gens s’interroger sur Reddit avant d’acheter leur machine et espérer (à tort) pouvoir utiliser des modèles locaux pour éviter un abonnement à Claude ou ChatGPT. Avant de partager le détail de mes tests de modèles LLM, de comparer les moteurs d’inférence et les harnais disponibles, défrichons un peu le terrain de l’IA locale.</p>



<span id="more-221"></span>



<p class="wp-block-paragraph">Un premier constat : l’IA locale fonctionne très bien pour la dictée vocale et donne des résultats très convaincants pour la voix, la génération et l’édition d’images. Pour les LLM, tout dépend de l’usage concret et de vos attentes en terme de performance. Pour un usage de programmation au quotidien en remplacement d’un Claude Code ou Codex, on est encore loin du compte selon moi<sup data-fn="1d3b0486-d266-4847-bfa4-56774b096621" class="fn"><a href="#1d3b0486-d266-4847-bfa4-56774b096621" id="1d3b0486-d266-4847-bfa4-56774b096621-link">1</a></sup>, même si les modèles récents me donnent envie d’espérer.</p>



<h2 class="wp-block-heading">La configuration de référence</h2>



<p class="wp-block-paragraph">Mes essais se font sur un <strong>Mac mini M4 Pro (CPU 14 cœurs, GPU 20 cœurs) et 48 Go de mémoire unifiée</strong>, acheté en décembre 2024. C’est aussi ma machine de travail de développeur. Si vous envisagez un achat pour l’IA locale, ces retours devraient vous aider à situer ce qu’on peut attendre de cette configuration. Pour simplifier, la quantité de RAM permet de savoir si on est en mesure de charger un modèle et la quantité de cœurs GPU ainsi que l&rsquo;architecture (Mx Pro, Mx Max ou Mx Ultra) influencent ensuite la performance. Pouvoir charger un modèle en mémoire ne dit pas encore s’il sera agréable à utiliser.</p>



<h2 class="wp-block-heading">La voix et les images : déjà convaincantes</h2>



<p class="wp-block-paragraph">Avant de parler des LLM, trois usages d’IA méritent un détour :</p>



<ul class="wp-block-list">
<li><strong>La dictée vocale</strong>, avec <a href="https://github.com/desukyu/handy" target="_blank" rel="noopener">Handy</a> et le modèle Parakeet. 16 Go de RAM suffisent pour utiliser cet outil en complément de vos logiciels. La qualité de retranscription surpasse la reconnaissance vocale intégrée du Mac au point de trouver sa place dans mes usages quotidiens.</li>



<li><strong>La génération et l’édition d’images</strong>, avec <a href="https://drawthings.ai/" target="_blank" rel="noopener">Draw Things</a> et des modèles FLUX, Z-Image et Qwen. Là aussi, mon bilan est très positif. La retouche d’une image existante par un prompt fait des merveilles. Je ne suis pas certain d’utiliser vraiment la génération d&rsquo;image pure. L&rsquo;illustration en haut de cette page est un exemple de génération d’une « illustration minimaliste représentant une boîte grise à la forme d’un Mac mini contenant un mécanisme d’horlogerie ». Pour utiliser confortablement ces outils, mieux vaut avoir au minimum 32 Go de RAM et plus de 10 cœurs GPU.</li>



<li><strong>La synthèse et le clonage de voix</strong>, avec <a href="https://voicebox.sh/">Voicebox</a>, notamment les modèles Qwen3-TTS. Je suis davantage dans l’expérimentation, mais les résultats m’ont beaucoup plu. Je n’ai actuellement aucun besoin d’un tel outil mais je pense expérimenter sur la création autonome de présentations résumées avec VoiceOver. À ma connaissance, il n’existe pas encore de modèles d’IA francophones permettant de contrôler finement l’intonation et l’émotion simulée.  </li>
</ul>



<p class="wp-block-paragraph">L’IA locale vaut donc déjà le coup sur cette machine et il y a tout un foisonnement de modèles à essayer. Mais le gros morceau arrive : les LLM, et le bilan est ici moins évident.</p>



<h2 class="wp-block-heading">Les LLM : faire tourner un modèle ne suffit pas</h2>



<p class="wp-block-paragraph">Sur les “petits” Mac avec 24 Go de RAM ou moins, on peut charger et faire tourner des petites versions des modèles Gemma-4 (à 2, 4 ou 12 milliards de paramètres) ou Qwen à 9 milliards de paramètres. Ces modèles fonctionnent pour une petite discussion mais ont une capacité de raisonnement limitée et je n’en trouve aucun usage concret.</p>



<p class="wp-block-paragraph">Avec 48 Go de RAM, j’ai pu essayer une plus grande variété de modèles, notamment les plus grosses versions des familles Gemma et Qwen (autour de 30 milliards de paramètres). Certains répondent assez vite (dans les 60 tokens par seconde pour les modèles MoE<sup data-fn="a3e2452b-7621-4a66-8581-cecce84ad567" class="fn"><a href="#a3e2452b-7621-4a66-8581-cecce84ad567" id="a3e2452b-7621-4a66-8581-cecce84ad567-link">2</a></sup>) mais sont encore trop imités pour réaliser des tâches intéressantes ; d’autres donnent de très bons résultats mais sont excessivement lents (20 tokens par seconde en début de travail puis 10 tokens ou moins par seconde une fois que le contexte de travail s’étend). J’ai passé beaucoup de temps à essayer différentes combinaisons, sans trouver pour l’instant un usage assez utile pour s’installer dans mon quotidien.</p>



<p class="wp-block-paragraph"><strong>En dehors d’une contrainte de confidentialité imposant le travail 100% local, les services par API distantes sont largement le choix le plus raisonnable.</strong> Si on souhaite éviter OpenAI et Anthropic pour des questions budgétaires, on peut se tourner vers des modèles peu chers par API comme l’excellent Deepseek 4.1 flash : plus rapide et plus qualitatif qu’un modèle local. Le meilleur modèle local qui fonctionne sur ma machine, Qwen3.8 27b, a passé plus de 40 minutes à répondre à une petite demande simple sur du code lors de mes premiers tests.</p>



<p class="wp-block-paragraph">J’ai toutefois l’impression que les modèles sortis récemment pourraient faire évoluer ce bilan. L’actualité est brûlante et il y a de nouvelles choses à tester chaque semaine. Si une solution permet de faire un nouveau bon en qualité ou en vitesse d’inférence, on peut atteindre un niveau où il devient envisageable d’utiliser cela au quotidien sur un Mac milieu de gamme.</p>



<h2 class="wp-block-heading">Ce que je vais explorer</h2>



<p class="wp-block-paragraph">Les prochains articles de la série « IA Locale » porteront principalement sur des tests de trois éléments :</p>



<ul class="wp-block-list">
<li><strong>Les moteurs d’inférence</strong> : les logiciels qui exécutent les modèles, avec leurs différences de vitesse, de réglages et de facilité d’utilisation.</li>



<li><strong>Les modèles de langage</strong> : la qualité des réponses, la mémoire nécessaire et le temps d’attente pour une tâche donnée.</li>



<li><strong>Les outils de codage, ou « harness »</strong> : les logiciels qui entourent le modèle pour lui permettre de travailler sur un projet, modifier des fichiers et lancer des commandes.</li>
</ul>



<p class="wp-block-paragraph">Ma recommandation actuelle suite à mes tâtonnements va pour <a href="https://omlx.ai/" target="_blank" rel="noopener">oMLX</a> (pratique et performant) faisant tourner <a href="https://huggingface.co/Qwen/Qwen3.8-27B" target="_blank" rel="noopener">Qwen3.8 27b</a> (très lent mais capable d’assez bons raisonnements) utilisés par <a href="https://opencode.ai/">OpenCode</a> (choisi par défaut et qu&rsquo;il me faut vite comparer à <a href="https://pi.dev/" target="_blank" rel="noopener">Pi</a> ou d’autres).</p>



<p class="wp-block-paragraph">La liste d’éléments à tester est longue !</p>


<ol class="wp-block-footnotes"><li id="1d3b0486-d266-4847-bfa4-56774b096621">Sur les Mac Studio avec puce Ultra et plus de 128 Go de RAM, la situation est différente, on doit pouvoir faire fonctionner Qwen 3.8 flash Next de façon confortable pour une utilisation bien réelle… mais on parle ici de machines à plus de 6000 € <a href="#1d3b0486-d266-4847-bfa4-56774b096621-link" aria-label="Aller à la note de bas de page 1"><img src="https://s.w.org/images/core/emoji/17.0.2/72x72/21a9.png" alt="↩" class="wp-smiley" style="height: 1em; max-height: 1em;" />︎</a></li><li id="a3e2452b-7621-4a66-8581-cecce84ad567">Les modèles MoE pour Mixture of Experts sont plus rapides car seulement une partie des paramètres chargés en mémoire sont utilisés à chaque instant. Le gain en rapidité semble se faire au prix d’une certaine capacité de raisonnement. <a href="#a3e2452b-7621-4a66-8581-cecce84ad567-link" aria-label="Aller à la note de bas de page 2"><img src="https://s.w.org/images/core/emoji/17.0.2/72x72/21a9.png" alt="↩" class="wp-smiley" style="height: 1em; max-height: 1em;" />︎</a></li></ol>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
