if ( !emtpy($headline_subheadline ) ) : ?>
Le dernier modèle frontière de Google offrira une capacité de jeton étendue pour les charges de travail d’entreprise complexes lorsqu’il sera finalement publié – mais pour l’instant, ses résultats de référence sont mitigés.
endif; ?>
Google a dévoilé un nouveau modèle d’IA frontalier après des mois de retard. Gemini 4 Argon est conçu pour gérer des charges de travail complexes à long terme couvrant l’ingénierie logicielle, les travaux de connaissances d’entreprise tels que l’analyse juridique et financière et la cybersécurité. Mais seules quelques organisations peuvent mettre la main dessus pour l’instant.
Argon « est en train d’être déployé auprès d’un ensemble de cyberdéfenseurs de confiance via notre programme Fairwind », a écrit Google dans un article de blog annonçant la sortie. Cette limitation, a-t-elle déclaré, vise à se conformer au processus volontaire du gouvernement américain consistant à accorder un accès anticipé aux modèles afin de tester et d’améliorer leurs garde-corps de sécurité avant de les rendre généralement disponibles.
Koray Kavukcuoglu, directeur de Google DeepMind, a récemment déclaré que Gemini 4 devrait sortir « beaucoup plus tôt » que la fin de cette année.
Le lancement limité intervient après que Google ait retardé et finalement ignoré la sortie de Gemini 3.5 Pro, dont la société avait initialement promis qu’elle arriverait en juin.
« Il a fallu environ sept mois à Google pour publier un modèle majeur de premier plan. Il a trois à quatre mois de retard sur sa propre feuille de route Gemini, car Gemini 3.5 Pro, le modèle prévu par Google pour juin, n’a jamais été livré. Le retard était lié aux défis de développement du modèle, notamment en matière de codage et de raisonnement », a déclaré Pareekh Jain, PDG d’EIIRTrend et Pareekh Consulting.
Avec Argon, Google a augmenté la capacité de jetons du modèle, tandis que le prix de lancement est fixé à 2 $ par million de jetons d’entrée et à 10 $ par million de jetons de sortie.
Plus de jetons, pas de piste claire
Le changement majeur dans Argon est la limite de sortie du modèle, qui a été augmentée de 64 000 jetons dans les modèles Gemini précédents à 1 million, ce qui laisse de la place à plus de raisonnement et à l’accomplissement de tâches longues et en plusieurs étapes au sein d’une seule trajectoire.
Google a déclaré qu’Argon est conçu pour gérer les flux de travail d’entreprise couvrant le codage, le raisonnement et les tâches multimodales. L’entreprise appuie ces affirmations avec des exemples tirés de son utilisation interne. L’entreprise a utilisé Argon pour identifier les optimisations de mémoire dans ses centres de données qui pourraient libérer plus de 300 To de mémoire une fois déployées, avec une économie totale estimée entre 500 To et 1 Po.
Sur les benchmarks, Argon obtient un score de 68,9% sur l’indice Vals, devant Claude Opus 5.5 à 67,0%, et 77,9% sur DeepSWE v1.1, contre 74,2% pour Opus 5.5. Mais ces résultats ne se traduisent pas par une avance sur tous les types de charges de travail. Dans PostTrainBench pour l’ingénierie ML, Claude Opus 5.5 est en tête avec 49,3 % contre 45,3 % pour Argon.
La société vise également à combler l’écart avec Anthropic et OpenAI en matière de cyberdéfense en permettant à Argon de rechercher, valider et corriger de manière autonome les vulnérabilités logicielles critiques. Sur CWE-bench v1, une référence en matière de correction des vulnérabilités, Google rapporte un score de 68 %, à égalité en première position avec Grok 4.7, GPT-6 Astra et Claude Opus 5.5.
Bien que Google ait publié un large éventail de résultats de référence pour étayer ses affirmations, Jain a averti que les scores doivent être traités comme des indices et non comme des preuves. « Argon semble être bon et battre ses rivaux dans l’utilisation d’outils automatisés pour effectuer des tâches en plusieurs étapes sans se tromper, et il s’en tient étroitement aux faits réels. Ses capacités de codage quotidiennes sont fondamentalement moyennes et à égalité avec les autres. Il est toujours à la traîne en matière d’écriture créative, d’explications nuancées et d’exécution de terminaux informatiques en ligne de commande », a-t-il déclaré.
Jain a noté qu’Argon montre que Google a comblé une grande partie de son déficit de capacités, mais qu’il a perdu un peu d’élan et d’esprit de développeur. Elle est désormais compétitive à la frontière, mais pas clairement en avance dans tous les domaines.
Prix, performances et commutation
Les capacités d’Argon sont proposées à un prix de lancement de 2 $ par million de jetons d’entrée et de 10 $ par million de jetons de sortie, le prix des jetons d’entrée en cache étant 95 % inférieur. Ces tarifs passeront à 4 dollars par million de jetons d’entrée et à 20 dollars par million de jetons de sortie après la période de lancement, bien que Google n’ait pas précisé quand les nouveaux tarifs entreront en vigueur.
En comparaison, Claude Opus 5.5 d’Anthropic coûte 4 $ par million de jetons d’entrée et 20 $ par million de jetons de sortie, tandis que le GPT-6 Astra d’OpenAI coûte 10 $ par million de jetons d’entrée et 50 $ par million de jetons de sortie.
« Cela rend le prix de lancement très compétitif. Le prix final est à peu près comparable à celui d’autres modèles haut de gamme. Les entreprises devraient donc élaborer des analyses de rentabilisation en utilisant le prix de 4 $/20 $, plutôt que de supposer que le prix de lancement continuera », a déclaré Jain.
Bien qu’Argon mérite d’être évalué pour les entreprises utilisant déjà des modèles concurrents, cela ne suffit pas nécessairement à justifier un changement pur et simple. Les DSI devraient également évaluer le coût de la migration des applications existantes ainsi que des flux de travail et des intégrations des développeurs.
Jain a noté que les DSI devraient évaluer les modèles sur leurs propres charges de travail, en se concentrant sur le taux de réussite des tâches, la précision et les hallucinations, la fiabilité des agents, le coût par tâche réussie, la latence, la sécurité et la gouvernance, la confidentialité des données, l’intégration avec les systèmes existants et la dépendance vis-à-vis du fournisseur. L’indicateur clé n’est pas le coût par jeton, mais le coût par résultat commercial réussi.
Argon donne aux DSI une bonne raison de l’évaluer sans pour autant y passer automatiquement.
La décision judicieuse, a-t-il déclaré, consiste pour les entreprises à ajouter Argon pour les tâches qu’elles font le mieux, comme les aspects juridiques, financiers et les documents longs, et à conserver leur IA actuelle pour des choses comme le codage. Si une entreprise gère déjà toute sa technologie sur Google Cloud, le changement peut être envisagé si Argon remporte clairement les tests et que les coûts sont toujours raisonnables au prix fort, a déclaré Jain.
InfoMonde



