Aller au contenu
InYourGeek
visiteur@inyourgeek — console
compléter historique ouvrirhelp
EN
IA· 3 min de lecture

Quatre mois d'avance pour cinq fois le prix : Mozilla chiffre l'écart

Mozilla publie ce 15 septembre son rapport sur l'IA ouverte : 4,4 mois séparent désormais les meilleurs modèles ouverts des modèles propriétaires de pointe. Payer le premium n'a plus de sens que sur une bande étroite de tâches.

Dans un atelier sombre éclairé d'ambre, deux chevaux mécaniques identiques sur une piste : l'un porte un harnais doré ouvragé, l'autre rien. Une règle lumineuse posée au sol mesure les quelques pas qui les séparent, qu'un technicien accroupi de dos vient lire, clé à molette à la main.

Le rapport est sorti ce 15 septembre 2026, et Mozilla l’a transmis à Ars Technica avant publication. C’est la deuxième édition de son State of Open Source AI — la première datait du 14 juillet. Sa conclusion tient dans un nombre : 4,4 mois. C’est ce qui sépare aujourd’hui les modèles propriétaires de pointe des meilleurs modèles à poids ouverts venus de Chine. Quatre mois et des poussières d’avance, là où le discours ambiant vous vend un fossé technologique générationnel.

Trois points d’écart, 30 % de la facture

Le chiffre qui fait mal se lit sur l’Artificial Analysis Intelligence Index : Kimi K3, de Moonshot AI, y termine à trois points derrière Fable 5 d’Anthropic, pour 30 % du prix de ce dernier. Mozilla en tire une recommandation sans détour : la plupart des organisations devraient prendre l’ouvert par défaut pour l’essentiel de leur travail.

Précision qui a son importance : « poids ouverts » ne veut pas dire open source. Vous téléchargez les composants principaux du modèle et vous le faites tourner chez vous, mais les données d’entraînement, le pipeline de données et le code d’entraînement restent au chaud chez l’éditeur. On vous donne le gâteau, pas la recette.

La bande étroite des huit à douze heures

Pour mesurer l’écart autrement, le rapport s’appuie sur l’horizon temporel défini par l’organisme de recherche METR : la durée des tâches — mesurée par le temps qu’y passe un expert humain — qu’un modèle boucle avec un taux de réussite « fiable » de 50 %. Cet horizon double à une cadence qui s’est accélérée avec le temps.

Sur ce terrain, le meilleur modèle fermé encaisse une tâche 1,7 fois plus longue que le meilleur modèle ouvert. Le directeur technique de Mozilla, Raffi Krikorian, le traduit en heures : là où l’ouvert traite sept heures de travail, le fermé en traite douze — et dans quatre mois, l’ouvert fera les douze heures pendant que le fermé tapera dans les vingt.

D’où la carte qui vous intéresse vraiment. En dessous de huit heures, les deux camps font le travail, et autant confier ça au moins cher. Entre huit et douze heures, le fermé passe et l’ouvert pas encore. Au-delà de douze heures, personne ne passe de façon fiable. Le premium propriétaire, c’est donc une bande de quatre heures de large.

Le harnais qui gonfle les scores

Reste un biais que le marketing adore : les modèles fermés arrivent souvent avec leur propre harnais, la couche logicielle qui leur donne accès aux outils et à la mémoire pour agir en mode agent. Un harnais taillé maison par le laboratoire qui a entraîné le modèle améliore parfois nettement ses résultats, quand le même modèle se traîne sur un harnais tiers.

L’entreprise de benchmark Vals AI a donc remis tout le monde sur le même harnais neutre. Sur Terminal-Bench 2.1, GLM 5.2 du chinois Z.ai (Zhipu AI) termine à un point de Claude Opus 4.7 et 4.8 d’Anthropic, pour environ cinq fois moins cher par tâche accomplie.

Ce que la facture achète encore

Payer garde du sens, et le rapport dit précisément où : le travail professionnel d’expert, la recherche documentaire intensive, le contexte long. Krikorian formule le choix comme dépendant de la charge de travail, pas de l’organisation — autrement dit, la bonne question n’est pas « quel modèle pour ma boîte », mais « quel modèle pour cette tâche-là ». Les modèles fermés apportent aussi ce qui ne s’entraîne pas : un service qui fonctionne sans configuration, un habillage de conformité, du support et une responsabilité identifiée. Beaucoup d’organisations n’ont tout simplement pas les équipes pour faire tourner correctement un modèle ouvert.

Certains ont déjà tranché à la tâche : le livreur DoorDash confie sa routine à Kimi et garde Fable pour ce qui prendrait longtemps à un expert humain.

Quatre mois d’avance pour cinq fois le prix, c’est cher l’heure de trajet. Surtout que l’avance, elle, se périme en quatre mois.

Sources (1)

PartagerXLinkedInFacebookBluesky

Article rédigé avec l'assistance d'une IA à partir des sources citées, puis relu et validé avant publication par Sébastien Soulier.