Aller au contenu

28 septembre 2026

Fine-tuning LLM en entreprise : plus fort qu’un modèle frontier ?

Julien DELAMOTTE

Julien DELAMOTTE

Responsable BU data & IA

La prochaine bataille de l’IA pourrait être celle de la spécialisation

Depuis deux ans, la course à l’IA générative semble suivre une logique assez simple : à chaque nouvelle génération de modèles, nous cherchons à savoir lequel est le plus puissant. GPT, Claude, Gemini et les autres modèles dits « frontier » » repoussent continuellement les limites en matière de raisonnement, de génération de code, de multimodalité ou d’utilisation d’outils.

Cette course est passionnante, mais elle nous conduit parfois à poser la mauvaise question lorsqu’il s’agit de déployer de l’IA en entreprise. Avons-nous réellement besoin du meilleur modèle au monde pour chaque requête ? Ou avons-nous surtout besoin du meilleur modèle pour réaliser une tâche métier précise, avec un niveau de qualité, de latence et de coût compatible avec une exploitation industrielle ?

Cette distinction est essentielle. Car un modèle généraliste extrêmement puissant n’est pas nécessairement le modèle le plus performant économiquement sur un processus métier bien identifié. À l’inverse, un modèle open-weight correctement spécialisé peut devenir excellent sur un périmètre beaucoup plus restreint, au point de concurrencer, voire de dépasser, des modèles frontier sur certaines tâches.

C’est précisément ce que les progrès récents du fine-tuning et, plus largement, du post-training commencent à démontrer.

Un modèle généraliste est conçu pour savoir presque tout faire

Les modèles frontier sont extraordinaires parce qu’ils peuvent résoudre une diversité impressionnante de problèmes. Le même modèle peut expliquer un concept scientifique, analyser un contrat, produire du code Python, rédiger une campagne marketing, traduire un texte ou raisonner sur une image.

Cette polyvalence représente une valeur immense. Mais elle signifie également que nous mobilisons un système conçu pour traiter un espace de problèmes gigantesque, y compris lorsque notre besoin est beaucoup plus étroit.

Prenons un processus d’entreprise répétitif : analyser des contrats, qualifier des demandes clients, contrôler la conformité de documents, produire une synthèse financière selon un format déterminé ou rechercher des informations dans une base documentaire métier. Une fois le processus suffisamment bien défini, le problème n’est plus de disposer d’une intelligence universelle. Il est de produire une réponse extrêmement fiable sur une tâche précise, potentiellement des centaines de milliers ou des millions de fois.

Dans ce contexte, payer systématiquement pour un modèle généraliste très puissant peut revenir à surdimensionner l’infrastructure intellectuelle nécessaire à la tâche.

Le sujet devient alors moins celui de la puissance brute du modèle que celui de son efficacité.

Fine-tuner un modèle, ce n’est pas simplement lui apprendre des documents

Le terme de fine-tuning prête encore à confusion. On entend parfois qu’il suffirait de prendre les documents internes d’une entreprise et de les injecter dans un modèle pour lui transmettre la connaissance de l’organisation.

Ce n’est généralement pas le bon raisonnement.

Lorsqu’une information doit être privée, vérifiable, fréquemment actualisée ou associée à une source précise, une architecture RAG reste souvent plus adaptée. Le modèle va rechercher l’information dont il a besoin au moment de produire sa réponse.

Le fine-tuning répond à une autre problématique. Il sert davantage à apprendre au modèle comment effectuer une tâche.

Comment analyser un document ? Quels éléments sont importants ? Dans quel ordre faut-il chercher l’information ? Quand faut-il s’abstenir de répondre ? Comment structurer le résultat ? Quelle précision attend-on des citations ? Quels outils doivent être utilisés ? Quels critères permettent à un expert de considérer que le travail est correctement réalisé ?

C’est pourquoi il est aujourd’hui plus juste de parler de post-training. Au-delà du fine-tuning supervisé classique, les approches modernes peuvent combiner exemples experts, données synthétiques, distillation, reinforcement learning et environnements de travail reproduisant les situations auxquelles le modèle sera confronté en production.

L’enjeu n’est donc plus simplement de transmettre de la connaissance au modèle. Il s’agit de lui transmettre une partie du savoir-faire métier.

Harvey Tenet : apprendre à un modèle à travailler comme un juriste

Le travail publié récemment par Harvey constitue à ce titre un cas d’étude particulièrement intéressant. Harvey développe des solutions d’IA destinées aux cabinets d’avocats et aux directions juridiques. En août 2026, l’entreprise a présenté Harvey Tenet, un modèle basé sur Kimi K3 et post-entraîné avec Fireworks pour réaliser des tâches juridiques complexes sur des horizons longs.

La démarche est intéressante parce que Harvey ne s’est pas contenté d’entraîner le modèle sur des textes juridiques. Les environnements d’entraînement reproduisent de véritables situations de travail : une instruction correspondant à une demande d’un associé, un dossier client contenant les documents nécessaires et une grille d’évaluation experte détaillant les éléments qu’un travail de qualité doit contenir. Le modèle dispose également des outils nécessaires pour chercher dans les documents, les analyser et produire son livrable.

Le corpus combine données synthétiques, données juridiques publiques et données produites ou validées par des experts humains. Harvey souligne d’ailleurs explicitement le rôle déterminant de ces données expertes dans son processus de post-training. Sur les tâches de validation du benchmark LAB, le modèle final réussit presque deux fois plus de tâches que le modèle Kimi K3 de départ. Il améliore également ses performances sur LAB Contracts et atteint, selon Harvey, l’état de l’art sur ce benchmark au moment de la publication.

Ce résultat illustre une idée importante : le modèle de départ n’a pas changé de nature. Il n’est pas devenu subitement plus intelligent sur tous les sujets. Il est devenu beaucoup plus efficace dans un environnement particulier parce qu’on lui a appris les comportements qui conduisent à une bonne production juridique.

Le véritable benchmark : la qualité par euro dépensé

L’aspect le plus intéressant de l’expérience Harvey n’est cependant pas uniquement l’amélioration de la qualité. C’est la capacité à améliorer simultanément la qualité et l’économie du système.

Sur un cas d’analyse documentaire à grande échelle, Harvey a post-entraîné GLM-5.2 afin de mieux réaliser des tâches d’extraction structurée, de produire des réponses plus concises et de générer des citations plus précises. Par rapport aux meilleures baselines testées, Harvey annonce une amélioration de la qualité des réponses et des citations pour un coût par cellule environ dix fois inférieur. Le modèle apprend notamment à s’abstenir lorsque la question ne s’applique pas au document et à fournir des preuves plus précises plutôt que de multiplier les citations inutiles.

Un autre résultat est peut-être encore plus révélateur. Pour rechercher et exploiter la connaissance accumulée d’un cabinet, Harvey et Engram ont travaillé sur un modèle Qwen de 27 milliards de paramètres. Le post-training lui apprend à mieux structurer et exploiter cette connaissance afin d’éviter les recherches répétitives et inefficaces réalisées par le modèle de base.

Selon les résultats publiés, cette spécialisation réduit de 58 % le nombre total de tokens utilisés sur les trajectoires complétées. Le modèle atteint alors des performances compétitives avec les principaux modèles frontier testés, tout en réduisant le coût par requête d’environ 90 %.

C’est probablement ici que se situe le changement de paradigme.

Nous avons pris l’habitude de benchmarker les LLM principalement à travers leur niveau absolu de performance. Pour une entreprise, cette vision est incomplète. Une métrique beaucoup plus intéressante est la qualité produite par euro dépensé.

Investir dans l'apprentissage pour réduire durablement le coût du run

Le modèle économique devient alors différent.

Avec un modèle frontier consommé via API, le coût initial est faible. Il est possible de commencer rapidement et de bénéficier immédiatement des capacités d’un excellent modèle. C’est extrêmement efficace pour prototyper un cas d’usage, tester son adoption ou traiter des volumes limités.

Le coût augmente ensuite avec l’utilisation.

La spécialisation d’un modèle open-weight déplace une partie de cette dépense vers l’amont. Il faut construire un corpus, sélectionner les bonnes données, mobiliser des experts métier, définir des critères d’évaluation, effectuer les entraînements et industrialiser l’inférence.

Cet investissement ne doit d’ailleurs pas être minimisé. Le projet Tenet présenté par Harvey est un véritable programme de recherche. Harvey indique avoir utilisé environ 150 GPU NVIDIA B300 pendant deux mois pour l’entraînement du modèle. Il serait donc trompeur de présenter ce cas comme un simple fine-tuning accessible avec quelques milliers d’euros.

Mais toutes les spécialisations ne nécessitent évidemment pas cette échelle. Des techniques comme LoRA et plus largement le Parameter-Efficient Fine-Tuning permettent de n’adapter qu’une fraction limitée des paramètres d’un modèle. Elles réduisent ainsi significativement les besoins en mémoire et en calcul par rapport à un fine-tuning complet.

L’équation devient donc particulièrement intéressante pour les tâches répétitives et à fort volume. On accepte un investissement initial plus important pour créer un modèle spécialisé, mais chaque exécution devient ensuite potentiellement beaucoup moins coûteuse.

Plus le volume augmente, plus cet investissement peut être amorti.

Le corpus métier devient un véritable actif stratégique

Cette évolution déplace également la source de différenciation.

Les modèles open-weight sont accessibles à de nombreuses entreprises. Deux organisations peuvent télécharger exactement le même modèle et disposer de la même infrastructure. Pourtant, après quelques mois de travail, elles peuvent obtenir des performances radicalement différentes, un enjeu qui rejoint les questions de souveraineté numérique que nous observons sur d’autres projets Data & IA.

Pourquoi ? Parce qu’elles ne disposent pas des mêmes données d’apprentissage.

Imaginons une entreprise qui dispose de plusieurs dizaines de milliers de cas réels, représentatifs de son activité, accompagnés des décisions prises par ses meilleurs experts. Elle sait distinguer une réponse simplement correcte d’une excellente réponse. Elle connaît les erreurs fréquentes, les cas limites et les situations dans lesquelles il faut demander une validation humaine. Elle est également capable de transformer ces connaissances en critères d’évaluation automatisables.

Cette entreprise possède un actif considérable.

L’enjeu n’est alors plus simplement d’avoir accès au meilleur LLM. Il est de réussir à structurer l’expertise accumulée par l’organisation pour la transformer en données utilisables par les modèles.

C’est, à mon sens, une évolution majeure pour les stratégies Data & IA. Jusqu’à présent, beaucoup d’entreprises ont investi dans la collecte et la gouvernance de leurs données. Elles vont maintenant devoir apprendre à construire une nouvelle catégorie de patrimoine : les données d’apprentissage métier et les benchmarks internes.

Les exemples de qualité, les annotations des experts, les corrections effectuées en production, les préférences, les règles de décision et les évaluations deviennent progressivement une forme de propriété intellectuelle, ce qui suppose une gouvernance IA à part entière, au même titre que la gouvernance des données classiques.

RAG, fine-tuning et modèles frontier ne sont pas concurrents

Il serait néanmoins excessif de conclure que toutes les entreprises doivent remplacer leurs modèles frontier par des modèles open-weight spécialisés.

Ces approches répondent à des besoins différents.

Un modèle frontier reste extrêmement pertinent lorsque le problème est nouveau, complexe, variable ou encore mal défini. Il constitue également un excellent moyen de démarrer rapidement un projet sans investir immédiatement dans une chaîne d’entraînement.

Le RAG reste indispensable lorsqu’il faut apporter au système une connaissance privée, volumineuse ou régulièrement mise à jour.

La spécialisation devient particulièrement intéressante lorsque la tâche est suffisamment stable, répétitive et volumineuse pour justifier l’investissement nécessaire à l’apprentissage.

L’architecture IA de demain pourrait donc moins ressembler à une entreprise ayant « choisi son LLM » qu’à un portefeuille de modèles et de stratégies d’accès à la connaissance.

Des modèles frontier pourront traiter les problèmes les plus complexes. Des modèles spécialisés exécuteront les processus métier à fort volume. Des modèles beaucoup plus petits prendront en charge la classification, l’extraction ou le routage. Le RAG apportera la connaissance actualisée. Une couche d’orchestration décidera quel modèle utiliser en fonction de la difficulté de la tâche, du niveau de qualité attendu et du coût acceptable.

Cette approche est plus complexe à concevoir, mais elle est également beaucoup plus proche d’une véritable logique industrielle.

Chez DATASOLUTION, partir du métier plutôt que du modèle

C’est précisément cette approche que nous souhaitons pousser chez DATASOLUTION, en tant qu’agence IA et Data.

La première question d’un projet d’IA ne devrait pas être « quel LLM allons-nous utiliser ? ». Nous devons commencer par comprendre le métier. Quelle tâche voulons-nous améliorer ? Comment mesure-t-on aujourd’hui la qualité de cette tâche ? Quelles erreurs sont acceptables ou inacceptables ? Quel volume devra être traité ? Quel niveau de latence attendons-nous ? Et surtout, quelle valeur économique génère une amélioration de quelques points de qualité ?

À partir de là, il devient possible de construire un véritable benchmark métier. On constitue un golden dataset avec les experts, puis on mesure différents modèles frontier et open-weight avec les mêmes critères. On compare la qualité, mais également le coût, la latence, la robustesse et les contraintes de déploiement.

Si un modèle frontier obtient 95 % de qualité et qu’un modèle open-weight en obtient 70 %, le sujet est probablement clos. En revanche, si le modèle open-weight atteint déjà 90 %, la question devient beaucoup plus intéressante : combien faut-il investir pour combler les cinq derniers points grâce au fine-tuning ou au post-training, et combien cet investissement permettra-t-il ensuite d’économiser en production ?

C’est à ce moment-là que le fine-tuning cesse d’être une expérimentation technique et devient un véritable sujet de stratégie économique, une logique de mesure d’impact que nous détaillions récemment à l’occasion du RAISE Summit.

La prochaine frontière sera peut-être celle de la spécialisation

La course aux modèles frontier va continuer. Les prochaines générations seront plus intelligentes, plus rapides et plus multimodales. Elles resteront indispensables pour repousser les limites de ce qu’il est possible d’automatiser.

Mais une autre compétition est en train d’apparaître.

Il ne s’agit plus uniquement de construire le modèle capable de tout faire. Il s’agit de construire le modèle capable de faire exceptionnellement bien une chose qui compte réellement pour l’entreprise.

Dans cette nouvelle équation, le modèle open-weight n’est que le point de départ. Le véritable avantage compétitif se construit ensuite avec les données métier, l’expertise humaine, les systèmes d’évaluation et la capacité à organiser le post-training.

L’objectif n’est donc pas de démontrer qu’un modèle open-weight est intrinsèquement meilleur que GPT, Claude ou Gemini. Ce serait une mauvaise manière de poser le problème.

La question pertinente est beaucoup plus concrète : sur une tâche métier précisément définie, pouvons-nous construire un modèle spécialisé aussi bon ou meilleur qu’un modèle frontier, pour un coût d’exploitation très inférieur ?

De plus en plus de résultats suggèrent que la réponse peut être oui.

Et c’est peut-être là que se trouve l’une des prochaines grandes sources de ROI de l’IA générative en entreprise : investir pour apprendre à un modèle notre métier, afin de ne plus payer à chaque requête pour toute l’intelligence du monde lorsque nous avons surtout besoin d’une intelligence exceptionnelle sur notre domaine.

Vous vous posez la question du bon modèle pour l’un de vos processus métier ? Nos experts Agence IA et DATA peuvent vous aider à construire un benchmark métier et à évaluer, avec vous, l’intérêt d’une spécialisation par fine-tuning. Prenez rendez-vous avec nos experts.

FAQ

Pour aller plus loin

Retrouvez d’autres analyses sur l’IA en entreprise sur le blog DATASOLUTION, et découvrez notre offre Agence IA et DATA.

Sources

Harvey — Post-training update: Harvey Tenet

Hugging Face — PEFT: methods overview (LoRA)

Découvrez la galaxie datasolution