Tous les articles
IA & dev

Ajax, le modèle IA de PewDiePie : ce qui est confirmé, ce qui ne l'est pas

Par Elouan Laurent

Ajax, c'est quoi, et peut-on le télécharger ?

Ajax est un modèle de langage d'environ 9 milliards de paramètres, réentraîné par PewDiePie (Felix Kjellberg) à partir de Qwen3.5-9B, un modèle ouvert d'Alibaba. Il doit servir d'agent « toujours actif » dans Odysseus, son espace de travail IA auto-hébergé : recherche web, navigation, e-mail, calendrier. Au 6 octobre 2026, il n'est pas téléchargeable.

Le 2 octobre, la presse a relayé une vidéo de PewDiePie qui le présentait, et plusieurs titres ont parlé d'un lancement. La page officielle, elle, affiche « Coming soon », sans date. Ce modèle n'a aucun rapport avec la technique web AJAX ni avec les alarmes Ajax Systems, qui occupent les résultats de « ajax ia ».

Où en est la sortie, au 6 octobre 2026 ?

La page officielle d'Ajax dit, au 6 octobre : « I've decided to release Ajax when it's ready instead of putting a timer. I'm sorry, I'll do my best to get it done as soon as possible! » En clair : il sortira Ajax quand il sera prêt, sans compte à rebours.

Il n'y a donc plus de date. D'après Popular AI et Affiverse Media, la page annonçait d'abord une sortie le 3 octobre à 8 h 25, heure du Japon. Dans la vidéo, le lien « Download Ajax here » menait, selon Tbreak, vers une page de collecte de données d'entraînement.

Mes propres vérifications, le même jour :

  • l'API de Hugging Face ne renvoie aucun modèle pour les comptes pewdiepie, pewdiepie-archdaemon et odysseus-dev ;
  • sur GitHub, la branche dev d'Odysseus est gelée pour une migration « pre-Ajax » de plus de 400 commits, dont la demande de fusion reste ouverte.

Aucune des pièces utiles pour évaluer Ajax n'est publiée : poids (les fichiers du modèle), fiche modèle, licence des poids, exigences matérielles, benchmark indépendant. Interesting Engineering, Tbreak et Free Press Journal le notent dès le 2 octobre. Un site écrit pourtant que les utilisateurs peuvent déjà déployer Ajax sur leur PC, ce que la page officielle contredit.

Pourquoi un modèle de 9 milliards de paramètres pour Odysseus ?

Odysseus est un espace de travail IA open source (AGPL-3.0-or-later) qui réunit chat, agents, recherche, documents, e-mail, notes et calendrier. Son dépôt GitHub date du 31 mai 2026 et compte environ 90 000 étoiles.

La réponse à la question du titre se trouve dans une discussion GitHub ouverte par PewDiePie (compte pewdiepie-archdaemon) le 5 juin 2026, bien avant l'annonce.

Le problème vient d'Odysseus. En juin, son prompt d'agent chargeait environ 10 000 tokens (des unités de texte) de consignes d'outils à chaque tour, quelle que soit la demande. La feuille de route du projet le reconnaît : le mode agent est « too heavy for smaller local models » (trop lourd pour les petits modèles locaux).

Sa réponse : un petit modèle, Qwen 3.5 9B, réentraîné pour Odysseus par SFT (ajustement supervisé : on l'entraîne sur des exemples de bonnes réponses). Il vise notamment trois comportements : choisir le bon outil, écrire des arguments valides, répondre court. Les benchmarks publics de raisonnement ne sont pas sa cible, écrit-il.

Les données ont manqué. Le 24 juin, il écrit n'avoir tiré que 300 échantillons utiles de son propre usage d'Odysseus. Il part alors de 64 000 prompts sans rapport avec l'outil, qu'il compte réécrire pour les outils d'Odysseus.

Le 29 juin, il annonce « Odysseus LLM v0.01 » et conclut que « removing prompt overhead has massive improvement to smaller models » (alléger le prompt améliore beaucoup les petits modèles). Je n'y trouve aucun message de PewDiePie qui dise « cette version, c'est Ajax ». Un contributeur emploie pourtant ce nom dans le fil le 3 octobre, et la page officielle décrit la même base et le même but.

La seule mesure de performance que je trouve vient de lui : selon Tbreak, une version préliminaire menait ses tâches à bien environ neuf fois sur dix. Aucun jeu de tâches, aucune taille d'échantillon, aucune comparaison indépendante ne l'accompagne.

Distillation, bannissements OpenAI et refus ablatés : ce qui est établi

PewDiePie dit qu'OpenAI a suspendu son compte deux fois pendant qu'il construisait Ajax. Dans sa vidéo, un e-mail d'OpenAI cite la « distillation » pour l'un des bannissements, d'après Tom's Hardware.

La distillation consiste à entraîner un petit modèle avec les réponses d'un plus grand. Les conditions d'utilisation d'OpenAI interdisent d'employer ses sorties pour développer des modèles concurrents. La clause figure dans la version de décembre 2024, et Interesting Engineering écrit que les conditions actuelles la gardent.

Selon son récit, le compte a été rétabli après un appel. Il a été suspendu de nouveau quand PewDiePie a généré des données de départ avec un modèle d'OpenAI. OpenAI n'a fourni aucune explication publique de ces décisions, relève Interesting Engineering : tout vient de PewDiePie et de l'e-mail qu'il montre.

Heretic, un outil open source sous licence AGPL-3.0, retire les refus d'un modèle sans post-entraînement coûteux, d'après son README. PewDiePie dit l'avoir utilisé pour Ajax, et la page officielle annonce des refus « ablated » (supprimés) pour une expérience plus libre et moins restreinte.

Il affirme garder des limites sur les demandes de nuire à autrui ou à soi. Aucune évaluation indépendante ne les confirme.

Quel matériel et quelle licence, avant que les poids sortent ?

Aucun besoin matériel n'est publié pour Ajax lui-même. Le modèle de base, lui, est documenté. Sa fiche Hugging Face indique la licence Apache 2.0, un contexte natif de 262 144 tokens et un encodeur de vision.

La recette de vLLM (un moteur de service de modèles) chiffre ce modèle de base. En BF16 (des nombres sur 16 bits), son fichier indique 22 Go de VRAM (la mémoire de la carte graphique) au minimum et vise une carte de 24 Go. Une variante FP8 (des nombres sur 8 bits), publiée par RedHatAI, descend à 11 Go.

Ces chiffres valent pour Qwen3.5-9B, pas pour Ajax : ses formats et ses exigences ne sont pas publiés. Le poids des paramètres seul fait environ 18 Go en BF16, soit 9 milliards multipliés par 2 octets, avant le cache de contexte.

PewDiePie vise aussi une version Q4 pour les machines modestes : « Quantized q4 should still fit most people hardware » (un Q4 devrait tenir sur la plupart des machines), écrit-il le 24 juin. Quantifier, c'est réduire la précision des poids pour gagner de la mémoire. Je ne vois aucune taille de fichier annoncée.

La licence d'Odysseus (AGPL-3.0-or-later) couvre le logiciel, pas forcément les poids d'Ajax, rappelle Tbreak. Celle des poids n'est pas confirmée.

La page officielle promet un traitement « completely privately ». Le modèle tournerait chez vous, mais la navigation web et les connecteurs e-mail et calendrier parlent à des services extérieurs. Tbreak relève que les documents disponibles n'expliquent pas les contrôles de permissions quand le modèle est relié à ces outils.

Que faire d'ici la sortie, côté développeur ou CTO ?

Le pari d'Ajax mérite l'attention : un petit modèle réentraîné sur les appels d'outils d'un seul logiciel, plutôt qu'un grand modèle généraliste. Mon avis : c'est un projet à suivre, pas encore un outil à évaluer. Je n'ai pu ni l'installer ni le mesurer, et tout ce qui précède vient de sources citées et datées.

Trois conduites tiennent jusqu'à la sortie :

  1. Ne pas chiffrer avec des données qui ne viennent pas d'Ajax. Les 22 Go et les 11 Go décrivent le modèle de base, et le « neuf tâches sur dix » vient d'une version préliminaire mesurée par son auteur.
  2. Attendre trois pièces : les poids, une fiche modèle avec la licence, les exigences matérielles.
  3. Mesurer sur vos propres tâches d'outils, avec un jeu de tests maison : vos e-mails, votre calendrier, vos outils métier.

Un agent branché sur votre e-mail et sur le web s'expose à l'injection de prompt : des instructions cachées dans un texte que l'agent lit. Des garde-fous déterministes contrôlent ce que l'agent a le droit d'envoyer, quel que soit le modèle.

Vous voulez brancher un agent IA, local ou non, sur une application Java / Spring Boot ? Je développe sur cette stack depuis 2015. Réserver un appel découverte de 30 minutes.

À lire ensuite