data.gouv.fr

Open data

Diane sur data.gouv.fr

On publie l'empreinte réelle de l'IA générative d'un service éducatif en production : appels, tokens, durées et coûts fournisseurs, ventilés par tâche pédagogique.

  • Licence Ouverte 2.0
  • Mise à jour trimestrielle
  • Fenêtre du 10 juin au 31 août 2026

Les chiffres de la première publication

679 316
appels facturables mesurés
3,3 Md
tokens d'entrée transmis aux modèles
4 619 $
de coûts fournisseurs cumulés
552 h
d'audio synthétisé
296 264
cartes de révision générées
83 jours
de mesure continue, sans échantillonnage

Pourquoi on publie ces chiffres

Les estimations publiques de l'empreinte de l'IA générative reposent presque toutes sur des mesures de laboratoire ou sur des extrapolations de prix catalogue, faute de données d'exploitation. Personne ne publie ce que consomme vraiment un service en production.

Diane instrumente chaque appel facturable à la ligne — tokens, durée, coût fournisseur — dans le service lui-même, au moment de l'appel, et non reconstitué après coup depuis une facture. Ce jeu publie ces mesures agrégées par tâche pédagogique réelle.

L'objectif : donner aux chercheurs, aux journalistes et aux acheteurs publics un point de comparaison mesuré et librement réutilisable, plutôt qu'un ordre de grandeur de plus.

Ce que contient le jeu

Quatre tables d'agrégats et leur schéma, hébergés sur data.gouv.fr. Chaque fichier est directement téléchargeable.

  • d1_taches.csv

    Consommation et coût par famille de tâche pédagogique : appels, tokens d'entrée et de sortie (total, moyenne, médiane), durée et coût.

    Télécharger le CSV · 1,4 ko
  • d2_mensuel.csv

    Série mensuelle de la charge d'inférence par catégorie de traitement. C'est la seule table entièrement reproductible : sa requête SQL est diffusée avec le paquet.

    Télécharger le CSV · 651 o
  • d3_classes_modeles.csv

    Répartition du trafic LLM par classe de capacité de modèle : part des appels, tokens, coût total et coût moyen par appel.

    Télécharger le CSV · 350 o
  • d4_artefacts.csv

    Coût unitaire par artefact pédagogique produit : supports de révision complets et cartes générées.

    Télécharger le CSV · 162 o
  • datapackage.json

    Schéma des quatre ressources au format Frictionless Data : colonnes, types, unités et énumérations.

    Télécharger le JSON · 7,1 ko

Trois lectures qui ressortent

  • Deux tiers des appels, un dixième de la facture

    Les petits modèles concentrent 66,7 % des appels aux modèles de langage mais 11,4 % de leur coût. Les modèles moyens, réservés à la génération de contenu long, font l'inverse : 30,9 % des appels, 88,6 % du coût.

  • La voix pèse plus lourd que le texte

    3 325 appels de synthèse vocale — 0,5 % du trafic — représentent 1 340 $, soit 29 % des coûts fournisseurs de la fenêtre, pour 552 heures d'audio produites.

  • 0,0107 $ par carte de révision

    3 171 $ de génération produisent 21 932 supports de révision complets et 296 264 cartes, soit 0,1446 $ par support et 0,0107 $ par carte.

Méthodologie

Périmètre
Tout appel entraînant un coût fournisseur : inférence de modèle de langage, synthèse vocale, OCR, calcul d'embeddings, transcription, stockage. La capture est faite dans le service au moment de l'appel, pas reconstituée depuis une facture.
Coûts
Coûts fournisseurs bruts en dollars des États-Unis, tels que rapportés par la passerelle d'inférence pour les modèles de langage, et calculés au prix unitaire contractuel pour les autres traitements. Ils n'incluent ni l'hébergement, ni la bande passante, ni l'amortissement matériel.
Tokens
Les tokens d'entrée comptent l'intégralité du contexte transmis au modèle : consignes, documents fournis par l'apprenant, extraits récupérés par recherche sémantique. Les tokens de sortie comptent le texte produit.
Classes et familles
Aucun nom de modèle, de fournisseur ni de tâche applicative interne n'est publié. Chaque modèle est rangé dans une classe de capacité (petit modèle, modèle moyen, modèle multimodal audio, modèle ouvert) et chaque tâche dans l'une des huit familles pédagogiques. Un élément absent d'une correspondance est reporté en « non classé » plutôt qu'exclu, pour que la somme des appels reste égale au trafic réel.
Seuil
Les couples (famille, catégorie) comptant moins de 50 appels sur la fenêtre sont écartés de la table des tâches : 10 appels sur 679 316, soit 0,001 % du trafic et 0,01 $ sur 4 618,92 $.

Pas de conversion en kWh ni en CO₂

Le jeu s'arrête aux unités physiques : tokens, secondes d'audio produites, nombre d'appels. Les facteurs de conversion par token publiés à ce jour varient d'un ordre de grandeur selon la méthode, le matériel supposé et le mix électrique retenu. Appliquer un facteur nous-mêmes enfermerait la donnée dans une hypothèse invérifiable par le réutilisateur : les unités physiques sont mesurées, le facteur relève de ton référentiel.

Ce que le jeu ne contient pas

  • Aucune donnée personnelle : les quatre tables sont des agrégats de consommation machine, produits par des requêtes en lecture seule qui ne sélectionnent aucun identifiant d'utilisateur.
  • Aucun contenu d'apprenant : ni document déposé, ni carte, ni question, ni réponse.
  • Aucune donnée de comportement d'apprentissage : ni révision, ni score, ni progression.
  • Aucun effectif d'utilisateurs, donc aucun coût par utilisateur. La donnée décrit un coût par tâche et par artefact ; cette restriction est commerciale et on préfère l'énoncer que la passer sous silence.
  • Aucun nom de modèle, de fournisseur ni de tâche applicative interne.

Limites

  • Fenêtre courte : trois mois environ. La capture a été activée le 10 juin 2026 au soir, donc juin est un mois partiel — juillet et août sont les deux seuls mois complets de cette première publication.
  • Un seul service : ces chiffres décrivent une application de répétition espacée à base de recherche augmentée. Ils ne se transposent pas directement à un service à génération longue, à un agent conversationnel ni à une application multimodale.
  • La table mensuelle est intégralement reproductible à partir de la requête SQL diffusée. Les trois autres ne le sont pas à l'identique : les correspondances tâche → famille et modèle → classe portent des noms internes volontairement absents du jeu.
  • Les coûts sont en dollars et ne sont pas convertis en euros : le taux applicable dépend de la date de facturation, que le jeu ne porte pas.
  • Une réextraction ultérieure de la même fenêtre donne des valeurs très légèrement inférieures : la suppression d'un compte efface les événements de consommation rattachés. C'est la contrepartie du droit à l'effacement. Chaque publication est un instantané daté, et c'est la version diffusée qui fait foi.

Réutiliser le jeu

Tu peux réutiliser ces données librement, y compris à des fins commerciales, à condition de mentionner la paternité et la date de dernière mise à jour. Si tu publies une réanalyse, on est preneurs du lien.

Mention de paternité

Diane AI, « Empreinte de l'IA générative dans un service éducatif en production », data.gouv.fr, 4 septembre 2026, Licence Ouverte 2.0.

Le jeu est diffusé sous Licence Ouverte 2.0 (Etalab). Question sur le schéma, signalement d'anomalie ou demande de précision méthodologique : contact@diane.app.

Notre jeu de données ouvert sur data.gouv.fr | Diane