Mercury 2.5 : un LLM « à diffusion » qui écrit plus de 1 000 tokens par seconde
Publiée le
Inception sort Mercury 2.5, un modèle qui ne génère pas mot à mot mais raffine toute sa réponse en parallèle. Annoncé à 1 107 tokens par seconde sur GPU NVIDIA courants, 260 K de contexte, 0,20 $ / 0,75 $ le million de tokens.
Ce que c'est. Un LLM classique écrit sa réponse de gauche à droite, un token après l'autre : chaque mot attend le précédent, et la vitesse est plafonnée par cette file. Un modèle « à diffusion » part d'un brouillon entièrement masqué de la réponse et le débruite en plusieurs passes, tous les tokens en même temps, comme les générateurs d'images qui partent d'un bruit. Moins de passes que de mots, donc plus vite. Inception annonce Mercury 2.5 le 24 septembre comme le plus gros modèle de ce type jamais entraîné, avec 40 % de « qualité » en plus que Mercury 2 sur ses évaluations, comparable selon l'éditeur aux petits modèles de frontière (GPT-5.6 Luna « Low », Gemini 3.5 Flash-Lite, Claude Haiku 4.5). Il gère le raisonnement réglable, les appels d'outils en parallèle et le JSON contraint par schéma. Disponible via l'API Inception, Baseten et OpenRouter.
Pourquoi c'est sympa. La vitesse est le produit. 1 107 tokens par seconde selon Inception, 770 mesurés indépendamment par Artificial Analysis. La page d'Artificial Analysis permet de comparer ce débit avec les modèles que tu utilises. Le prix suit : 0,20 $ en entrée et 0,75 $ en sortie par million, et 80 % de remise au lancement (0,04 $ / 0,15 $). Deux clients cités donnent l'échelle : OpenCall, des agents téléphoniques, est passé d'une latence médiane de 0,4 s à moins de 0,2 s ; Augment Code a déplacé sur Mercury la compaction de contexte de son agent de code, de 150 s à 27 s, pour 90 % de coût en moins.
À quoi ça sert. Aux appels nombreux et courts que ton produit enchaîne sans que l'utilisateur les voie. Une recherche assistée déclenche des dizaines d'appels : reformuler la requête, reclasser les résultats, structurer les faits, vérifier la réponse. Un agent vocal a un budget de silence de quelques centaines de millisecondes. Un agent de code résume, route, cherche des outils. Tu gardes ton gros modèle pour l'appel qui compte, tu envoies les appels de plomberie à Mercury. Inception annonce d'ailleurs en preview Mercury Voice (premier token sous 170 ms) et Mercury Router, qui lit la requête et choisit le modèle.
Pour quels projets. Produits où la latence est perçue : voix, recherche, assistants dans une interface. À vérifier avant d'adopter : les chiffres de qualité viennent de l'éditeur, la remise est temporaire, et un modèle de la taille d'un Haiku ne remplace pas un modèle de frontière sur les tâches longues.
Je ne le mettrais jamais en modèle principal. Je le mettrais partout où j'ai des appels de plomberie qui coûtent de la latence : reformulation, tri, résumé de contexte. Le test que je ferais : brancher Mercury sur la compaction d'un agent, mesurer avant et après. Si Augment a gagné 90 % de coût là-dessus, ça vaut une après-midi.