Aller au contenu principal
OutilOllaya

Ollaya : des « modèles de décision » qui répondent en 10 ms, en local, façon Ollama

Publiée le

Ollaya fait tourner localement des modèles qui ne génèrent pas de texte : ils lisent un ticket ou un JSON, répondent à des questions typées (choix, score, oui/non) avec une probabilité, en une passe. Compatible avec l'API de Jev, le modèle payant de TypeSafe.

Ce que c'est. Un « modèle de décision » est un modèle de langage qui a renoncé à écrire. Tu lui envoies un état (un mail, un ticket, un objet JSON) et une liste de questions typées : un choix parmi des options (« quelle équipe doit traiter ce ticket ? »), un score sur une échelle, ou une question fermée. Il répond à toutes en une seule passe avant du réseau, sans produire de token, avec une probabilité calibrée par réponse. Ce format vient de TypeSafe, une jeune société fondée par un ancien d'OpenAI, qui a lancé le 15 septembre son modèle Jev en accès anticipé, servi par API en 70 à 500 ms. Ollaya, sorti en version 0.6 le 25 septembre, en est l'équivalent open source et local : un binaire, un démon, et les commandes pull, run, list calquées sur Ollama. Il sert des modèles ouverts au même format d'API que Jev : un client existant bascule en changeant une variable d'environnement.

Pourquoi c'est sympa. La taille et la vitesse. Le modèle par défaut, laya:en, est un ModernBERT de 421 millions de paramètres : cinq questions sur un ticket en 8 à 10 ms sur une RTX 4090, d'après le README. Ollaya ne réhéberge pas les poids : il publie des graphes ONNX d'environ 3 Mo qui lisent les fichiers d'origine sur Hugging Face, épinglés à un commit et vérifiés par sha256. Une variante multilingue (322 millions de paramètres, plus de 100 langues) couvre le français. Et une commande ollaya mcp expose ces modèles à Claude Code ou Cursor, pour qu'un agent délègue ses petites décisions au lieu de les raisonner à chaque fois.

À quoi ça sert. Tu as un support client qui reçoit 2 000 messages par jour. Aujourd'hui, soit une règle regex les trie mal, soit un LLM les classe en deux secondes et quelques centimes pièce. Avec Ollaya, tu écris un fichier de questions (intention, urgence, demande de remboursement, risque de départ), tu le cuis dans un Modelfile, et chaque message sort trié en quelques millisecondes avec une confiance chiffrée. En dessous d'un seuil, tu envoies à un humain ; au-dessus, tu routes automatiquement. La probabilité devient un paramètre de ton code, pas une phrase à parser.

Pour quels projets. Tout pipeline où un LLM ne sert qu'à répondre « lequel ? » ou « combien ? » à grande fréquence : tri, modération, scoring de leads, garde-fous devant un agent. Limites : texte et JSON seulement, pas d'image ni d'audio ; les modèles ouverts sont plus petits et moins précis que Jev (le README donne 0,591 sur son propre jeu « typed-decisions » pour le meilleur) ; et le projet a quelques semaines. À tester sur un échantillon étiqueté de ton propre trafic avant d'y brancher quoi que ce soit.

Rémi AlvadoMon avis

Ce qui est génial, c’est de voir l’écosystème open source répondre très très vite à la nouveauté annoncée par Jev. À tester !

Voir le récap de la semaine du vendredi 25 au jeudi 1 octobre 2026

Prendre RDV