Mistral AI dévoile Mistral Large 4, surnommé « Le Chonk », un modèle à poids ouverts d'environ 1.000 milliards de paramètres. La société française revendique des progrès en code, cybersécurité et usages industriels pour réduire l'écart avec les leaders. La publication des poids est prévue le 27 octobre.
| Nombre de parametres | environ 1.000 milliards de paramètresdont 49 milliards actifs, selon les éléments de présentation |
|---|---|
| Puces d'entrainement | 4.000 puces Nvidia Grace Blackwellentrainé à partir de zéro pendant deux mois |
| Durée d'entrainement | deux moisdans les centres de données de Mistral AI |
| Publication des poids | 27 octobreaprès une période de tests de sécurité, API ouverte depuis le 6 octobre |
Mistral AI entend réaffirmer ses ambitions dans la course aux modèles d’intelligence artificielle. Avec Mistral Large 4, la société française met en avant des progrès dans le code informatique, la cybersécurité et les usages industriels. L’objectif : se rapprocher des systèmes les plus avancés tout en défendant une offre à poids ouverts, que les entreprises pourront déployer sur leurs propres infrastructures.
Le lancement et le calendrier de publication sont également rapportés par Reuters. Les performances annoncées restent toutefois des évaluations revendiquées par l’entreprise, dont la portée dépend des tâches et des tests retenus.
Un modèle de quelque 1.000 milliards de paramètres
Surnommé « Le Chonk », en référence à un terme d’argot désignant un gros chat sur Internet, Mistral Large 4 compte, selon les éléments de présentation, environ 1.000 milliards de paramètres, dont 49 milliards actifs. La société affirme repousser « les limites des modèles à poids ouverts en matière de capacités génériques pour les agents IA ».
Guillaume Lample, cofondateur et directeur scientifique de Mistral AI, a néanmoins nuancé la portée de cette avancée lors d’une présentation à la presse. Le nouveau modèle doit « significativement réduire l’écart entre nos modèles et les meilleurs modèles qui existent aujourd’hui », sans combler entièrement le retard.
Le chercheur le situe au niveau des meilleurs modèles chinois disponibles un à deux mois auparavant. Il insiste surtout sur la dynamique de recherche : « non seulement, on est capable de fermer ce gap », mais le modèle « suit une trajectoire qui s’améliore énormément ».
Cybersécurité, programmation et industrie parmi les usages visés
Mistral AI cible les besoins des entreprises, de l’analyse de grandes quantités de documents à la conception industrielle, en passant par la programmation informatique et la cybersécurité.
La start-up revendique également des résultats supérieurs à ceux de certains concurrents dans des tests d’analyse géospatiale. Le modèle pourrait notamment examiner une image satellite pour y repérer des phénomènes suspects, tels que des départs de feu. Ces capacités annoncées devront être appréciées dans les conditions concrètes d’utilisation.
Pierre Stock, vice-président des opérations scientifiques de Mistral AI, met en avant les progrès réalisés à la fin de l’entraînement. « Le modèle est dans sa dernière phase d’apprentissage, (…) et on n’a jamais observé de progression si spectaculaire de toutes les métriques dans cette phase-là », expliquait-il en amont du lancement.
Une évolution qui conduit le chercheur à estimer que l’entreprise pourrait « avoir trouvé la bonne méthode pour (…) dicter le rythme de la frontière de l’Open Source ».
La puissance de calcul au cœur de la compétition
Selon la société, Mistral Large 4 a été entraîné à partir de zéro pendant deux mois, à l’aide de 4.000 puces Nvidia Grace Blackwell, dans ses centres de données.
Ce développement traduit un « effort de longue haleine mené simultanément sur trois fronts: l’infrastructure, la recherche et le développement produit », explique Mistral AI. L’entreprise revendique « des performances à l’état de l’art dans des secteurs stratégiques pour la souveraineté de nos clients ».
Pour accélérer cette stratégie, la start-up a annoncé début septembre une levée de fonds de trois milliards d’euros. L’opération doit notamment soutenir ses investissements dans la recherche et la puissance de calcul, une ressource déterminante pour entraîner des modèles plus performants.
L’enjeu sera de transformer ces moyens supplémentaires en progrès réguliers, dans une compétition où les développeurs américains et chinois renouvellent rapidement leurs offres.
Une nouvelle étape pour la stratégie de souveraineté
Le lancement intervient alors que l’intégration de modèles chinois dans l’offre commerciale de Mistral avait suscité des interrogations sur ses priorités. Avec Large 4, la société réaffirme sa volonté de développer ses propres modèles, parallèlement à ses activités de services et d’intégration pour les entreprises.
L’ouverture annoncée des poids du modèle constitue un élément central de cette démarche. Elle doit permettre aux utilisateurs de le télécharger et de l’exécuter sur leurs équipements, selon les conditions de licence retenues. Cette approche ne signifie pas nécessairement que l’ensemble des données et des méthodes d’entraînement sera rendu public.
Une publication prévue le 27 octobre après des tests de sécurité
Mistral Large 4 est proposé en avant-première depuis le 6 octobre via une interface de programmation, ou API. La publication de ses poids est prévue le 27 octobre, à l’issue d’une période consacrée à l’évaluation de ses capacités et de sa sécurité.
Des experts en cybersécurité et des autorités publiques doivent participer à ces tests avant la diffusion élargie. Pour Mistral AI, cette étape doit préparer l’ouverture du modèle tout en évaluant les risques associés à ses capacités.
Questions fréquentes
C'est quoi Mistral Large 4 ?
Le nouveau modèle d'IA à poids ouverts de Mistral AI, surnommé « Le Chonk », comptant environ 1.000 milliards de paramètres dont 49 milliards actifs, visant code, cybersécurité et usages industriels.
Quand sortent les poids de Mistral Large 4 ?
La publication des poids est prévue le 27 octobre, après une période de tests de sécurité. Le modèle est proposé en avant-première via API depuis le 6 octobre.
Avec quelles puces Mistral Large 4 a-t-il été entraîné ?
Le modèle a été entraîné à partir de zéro pendant deux mois à l'aide de 4.000 puces Nvidia Grace Blackwell, dans les centres de données de Mistral AI.
Pourquoi Mistral Large 4 s'appelle « Le Chonk » ?
En référence à un terme d'argot désignant un gros chat sur Internet, en lien avec sa taille d'environ 1.000 milliards de paramètres.
