We spent the last few days testing JEV internally. We tried to reproduce it, break it, and improve it.
5 things we learned:
1. JEV’s core insight is simple - and probably right. If the answer space is bounded, don’t generate the answer token by token. Remove autoregressive decoding and you can remove 1–2 orders of magnitude of inference work.
2. RLCD isn’t the moat. Data might be. Laya already open-sourced the implementation + weights. The missing piece is the synthetic data recipe. And our experiments strongly point in the same direction.
3. “Open source already beat JEV” is a benchmark illusion.
Same checkpoint:
In-distribution: 0.769
OOD: 0.541
Change the distribution and the apparent breakthrough largely disappears.
4. Compute-optimal ≠ learnability-optimal.
We moved state outside the problem sequence to save compute. Result: -27 points. Likely because we saved FLOPs while throwing away useful MLM pretraining priors.
Then we tested 6 more ideas in one night: anchor selection, continuity smoothing, asymmetric windows, bucketed temperature, two-stage retrieval, full RLCD.
All failed or failed to generalize. Only one thing consistently worked: More data.
1,200 → 123,475 examples
OOD: 0.4069 → 0.5498
5. The weirdest result: A decoder with zero additional training still beat every trained small encoder:
0.5671 vs 0.5628 / 0.5411 / 0.4069
Our takeaway: JEV’s breakthrough may not be a particular architecture or training algorithm.
It may be a much simpler idea: When the answer space is bounded, search it. Don’t generate it. And right now, the biggest bottleneck to making that work broadly doesn’t look like architecture.
It looks like data.
Jev is a week old and has 31 open reproductions. Most comparisons so far run a few hundred decisions.
interesting new benchmark: Decision Index 0.1 - it runs 132,422: every repro + Jev on 37 benchmarks. No truncation, no prompt tuning, unanswered equals wrong.
Jev still tops it at 59.5 👀
huggingface.co/spaces/multimo…
Beaucoup de bad buzz autour de Mistral par méconnaissance de leur stratégie.
Mistral se construit comme un opérateur d'infrastructure IA verticalement intégré à l'échelle européenne :
- capacité de calcul en propre
- à terme conception de puces (si Dieu le veut)
- une couche de service (endpoints régionaux, agents, intégration)
- un catalogue de modèles qui s'ouvre aux modèles tiers (GLM-5.2 pour commencer)
Mistral ne le dit pas ainsi, mais l'hypothèse implicite est que les modèles se commoditisent par l'open source chinois, la distillation, etc. et qu'aucun modèle ne restera irrattrapable en moins de 12 mois.
Mieux, que l'on atteint des niveaux d'intelligence suffisants pour la plupart des usages et que donc l'enjeu est déjà plus sur les prix, les volumes, les intégrations, la sécurité, la gestion de données souveraines, que sur le classement exact au leaderboard.
Si cette hypothèse s'avère juste où va se loger la valeur ? En amont dans les infrastructures physiques, en aval dans la distribution et l'intégration.
La cible commerciale est naturellement le segment des acteurs qui ont des enjeux de données et capacités souveraines. Administrations, défense, secteurs régulés, grands groupes européens. Et pour eux, très souvent, un modèle chinois servi sur une infrastructure souveraine passe en complétement de modèles plus petits et plus spécialisés (ce que produit Mistral) et est toujours bien mieux qu'un modèle fermé américain.
Mistral conserve des modèles maison pour trois raisons :
- légitimité auprès des acheteurs publics
- opportunités commerciales sur les petits modèles spécialisés
- police d'assurance si la frontière ne se commoditise pas
Tout cela est bien visible dans la structure financière de la boîte : des banques pour la dette sur des actifs physiques, un équipementier de semi-conducteurs comme premier actionnaire, un fabricant de puces en chef de file du dernier tour, un fonds soutenu par la Commission et un État autour de la table : depuis la série C de 2025, on est sur un projet industriel plutôt que sur un laboratoire.
Je fais partie de ceux qui pensent que l'armée française devrait commander à Mistral un modèle frontière de défense, car nous ne pouvons prendre le risque que les capacités offensives de modèles fermés surpassent nos capacités défensives.
Mais la stratégie actuelle de Mistral est cohérente, et ils sont en train de construire pour la première fois en Europe depuis les années 80 un véritable acteur stratégique de l'industrie numérique.
La plupart des détracteurs de Mistal oublient :
- le côté miraculeux jusqu'à présent de cette trajectoire
- l'intérêt massif pour la France de bénéficier d'un tel acteur, modèles frontières ou pas
Nous sommes un pays de guerre civile, et la haine contre le macronisme touche injustement Mistral.
C'est bien dommage, d'autant plus que ce sera peut-être la chose la plus positive pour la puissance du pays qu'il restera des années 2020.
142K Followers 94 FollowingSane + 🌶️ takes in an insane AI world... AI capabilities researcher: co-created RLHF/ChatGPT @ @openai now trying to right the wrong 🤭 (ceo @typesafeai)
3K Followers 35 FollowingRobotics research lead at Mistral AI. I post about my DIY robots hardware hobby. Ex-Meta/FAIR, core contributor to Llama 3. ENS PhD. Repeat founder.
24K Followers 745 FollowingML Engineer @huggingface. Building https://t.co/z4nyO4pjVE. @KU_Leuven grad. General interest in machine & deep learning. Making AI more accessible for everyone!
13K Followers 4K FollowingCo-CEO @poolsideai // President @ PIC // Board @axon_enterprise
“The best way to predict the future is to invent it.” - Alan Kay
31K Followers 591 FollowingAI for knowledge workers at @Microsoft.
Prev: CEO @fintoolx (acq. Microsoft), CEO @doctrine (Acq. LexisNexis). Views are my own.
592K Followers 2K FollowingPolyagentmorous ClawFather. Came back from retirement to mess with AI and help a lobster take over the world.
@OpenClaw🦞 + @OpenAI