On vous explique le principe de distillation en IA : la technique légale… jusqu’à ce qu’elle devienne du vol

/2304435-on-vous-explique-le-principe-de

  • On vous explique le principe de #distillation en IA : la technique légale… jusqu’à ce qu’elle devienne du vol – La ligne rouge - Numerama
    https://www.numerama.com/tech/2304435-on-vous-explique-le-principe-de-distillation-en-ia-la-technique-le

    Le mot « distillation » est partout depuis que Washington accuse la start-up chinoise Moonshot d’avoir pillé un modèle américain grâce à cette technique. On vous explique les nuances qui se cachent derrière ce terme.
    Nous sommes le 22 juillet 2026 et Michael Kratsios, directeur du Bureau de la politique scientifique et technologique de la Maison Blanche, publie sur X une accusation directe : Moonshot AI aurait distillé le modèle Fable 5 d’Anthropic pour produire son propre modèle Kimi K3.

    Selon lui, l’entreprise chinoise aurait développé une plateforme interne sophistiquée pour mener une distillation à grande échelle contre des modèles américains, en changeant rapidement de méthode d’accès pour échapper à la détection.
    […]
    La distillation classique : une technique d’entraînement banale
    Le concept de la distillation trouve son origine dans un article de 2006, sobrement intitulé « Model Compression » (« Compression de modèles »). Sans jamais employer le mot « distillation », trois chercheurs de l’université de Cornell y expliquent s’être appuyés sur un modèle d’ensemble ultra performant, rassemblant des centaines, voire des milliers de classificateurs de base, pour étiqueter un vaste jeu de données. Ils ont ensuite entraîné un unique réseau de neurones sur ces données fraîchement étiquetées, avec des techniques d’apprentissage supervisé classiques. Résultat : un modèle compact « 1 000 fois plus petit et 1 000 fois plus rapide » que l’ensemble d’origine.

    Le terme « distillation » à proprement parler, ou knowledge distillation, n’apparaît qu’en 2015, popularisé par une équipe de chercheurs de Google. Le principe de fond reste toutefois le même qu’en 2006 : transférer les compétences d’un grand modèle déjà entraîné (le « professeur ») vers un modèle plus petit (l’« élève »), pour que ce dernier reproduise ses performances sans en avoir la taille ni le coût de calcul.