📊 Méthodologie ROI - AI ROI Dataset v1.0

Denis ATLAN (ENDKOO) | Version 1.0 - 29 décembre 2025

⚠️ Auto-déclaré ✓ Reproductible

1. Définition ROI

1.1 Formule

roi_percent = (gain annuel ÷ investissement) × 100
⚠️ Nature exacte de la variable

La variable roi_percent du dataset est un ratio gain annuel sur investissement, exprimé en pourcentage. Une valeur de 159,8 % signifie que le gain annuel constaté représente 1,60 fois le montant investi.

Ce n'est pas un ROI net au sens comptable. Le ROI net — (gain − investissement) ÷ investissement — vaut exactement 100 points de moins : 59,8 % sur les déploiements menés à terme, 27,4 % sur la cohorte complète.

Les versions antérieures de cette page documentaient une formule sur 24 mois, (2 × gain annuel − investissement) ÷ investissement. Vérification faite ligne à ligne, aucune des 200 lignes du fichier ne correspond à cette formule ; elle est retirée. Sous cette formule, la médiane des déploiements menés à terme serait de 219,5 %.

1.2 Composantes

📈 Bénéfices mesurés

  • Temps économisé converti en € (coût horaire × heures)
  • CA additionnel généré (si mesurable)
  • Coûts évités (erreurs, retravail)
  • Gains productivité mesurables

💰 Coûts inclus

  • Licences logicielles IA (ChatGPT, API)
  • Formation équipes (temps × coût horaire)
  • Temps déploiement (pilote + généralisation)
  • Accompagnement externe
  • Maintenance/support (12 mois)
❌ Exclusions
• Coûts infrastructure déjà existante (serveurs, réseau)
• Salaires fixes (sauf temps formation/déploiement)
• Bénéfices intangibles non mesurables (satisfaction client, image)

2. Périodes de Mesure

Fenêtre Début Fin Usage
12 mois Date mise en production J+365 jours ROI court terme
12 mois (référence) Date de mise en production J+365 jours Gain annualisé — base de annual_gain_eur
💡 Pourquoi une base annuelle ?
Le champ annual_gain_eur mesure un gain sur douze mois. Les valeurs publiées sont donc annualisées, non cumulées sur plusieurs exercices. Les mentions antérieures d'une « fenêtre 24 mois » désignaient la période d'observation des déploiements, pas une durée de cumul des gains : cette formulation, source de confusion, est abandonnée.

3. Métriques Dataset

3.1 Ratio gain/investissement médian : 159,8 % (1,60×) sur les déploiements menés à terme

Pourquoi médiane vs moyenne ?

• Distribution ROI asymétrique (quelques outliers >500%)
• Médiane résiste aux valeurs extrêmes
• Médiane = "ROI typique" (50% au-dessus, 50% en-dessous)

📊 Transparence méthodologique :

Le ROI moyen de notre échantillon est de +347% (tiré par les outliers et succès exceptionnels >500%). Nous préférons communiquer sur la médiane conservatrice de +159,8% qui représente le résultat typique attendu. Cette approche reflète notre engagement pour la rigueur académique et la reproductibilité.

Calcul :

  1. Tri des valeurs par ordre croissant
  2. Sur les 165 déploiements menés à terme : médiane = 159,8 % (1,60×)
  3. Sur la cohorte complète de 200, échecs inclus : médiane = 127,4 % (1,27×)
  4. Sur les 35 déploiements en échec : médiane = −3,4 %

3.2 Taux de mise en production : 82,5 % — taux de rentabilité à 12 mois : 60,5 %

Statut Définition %
✅ Succès • Déploiement mené à terme et en production
• Champ failure = 0 dans le fichier
Ne préjuge pas de la rentabilité : 44 de ces 165 déploiements ont un gain annuel inférieur à l'investissement
82,5 %
(165/200)
❌ Échec • Abandon avant mise en production, ou système désactivé
• Champ failure = 1, motif renseigné dans failure_reason
17,5 %
(35/200)
💰 Rentable à 12 mois • Gain annuel ≥ investissement (roi_percent ≥ 100)
• Indicateur distinct du taux de mise en production
60,5 %
(121/200)

4. Collecte Données

4.1 Sources

📁 Projets ENDKOO (75%)

  • Accompagnements directs 2022-2025
  • Données collectées avec accord client
  • Suivi ROI post-déploiement (questionnaires)

🤝 Projets Partenaires (25%)

  • Task Force 20 experts
  • Contributions anonymisées
  • Données agrégées sans identification

4.2 Anonymisation

Méthode :

✅ Conformité RGPD
• Consentement collecte (clause contrats ENDKOO)
• Anonymisation irréversible (pas de données personnelles)
• Pas de transfert hors UE
• Test k-anonymat (k=5) validé

→ Voir le process complet d'anonymisation RGPD

5. Limites Méthodologiques

5.1 Biais documentés

⚠️ Biais de sélection
• Dataset = clients ENDKOO + partenaires (PME/ETI françaises)
• Pas représentatif grandes entreprises (>250 salariés)
• Pas représentatif secteurs non B2B
⚠️ Biais de mesure
• Bénéfices auto-déclarés par clients (pas d'audit externe)
• Calculs € basés sur estimations coût horaire client
• Impossible isoler 100% impact IA (facteurs externes)
⚠️ Biais temporel
• Recul temporel hétérogène : les déploiements 2025 disposent de moins de recul que ceux de 2022
• Les 35 déploiements en échec portent un gain annuel nul ; 17 d'entre eux affichent néanmoins un roi_percent positif non reproductible, signalé comme inutilisable
• Dataset 2022-2025 = contexte IA générative émergent

5.2 Cas d'usage couverts

Inclus (GenAI + Automation) Exclus
• Automatisation processus (RPA + IA)
• Chatbots / assistants clients
• Génération contenu
• Analyse données / prédictions
• Entraînement modèles from scratch
• Déploiements infrastructure lourde (>500k€)
• Projets R&D sans ROI mesurable

6. Reproductibilité

6.1 Dataset accessible

Plateformes :

Format : CSV (22.3 kB, 200 lignes)

Licence : CC BY 4.0

6.2 Recalcul métriques

Script Python disponible :

import csv, statistics as st

rows = list(csv.DictReader(open('ai_roi_dataset_200_deployments.csv', encoding='utf-8-sig')))
val  = lambda r: float(r['roi_percent'])

# Ratio gain/investissement, cohorte complète (N=200)
print(st.median([val(r) for r in rows]))                          # 127.4

# Ratio gain/investissement, déploiements menés à terme (n=165)
print(st.median([val(r) for r in rows if r['failure'] == '0']))   # 159.8

# Taux de mise en production
ok = sum(1 for r in rows if r['failure'] == '0')
print(ok / len(rows) * 100)                                       # 82.5

# Taux de rentabilité à 12 mois (gain annuel >= investissement)
rent = sum(1 for r in rows if val(r) >= 100)
print(rent / len(rows) * 100)                                     # 60.5

Script complet sans dépendance : verify_metrics.py, fourni dans le dépôt. Les colonnes du fichier sont roi_percent et failure (0/1). Les versions antérieures de cette page référençaient des colonnes roi_24m et status qui n'existent pas dans le fichier publié.

📥 Télécharger le dataset

7. Disclaimer

✅ Ce que cette méthodologie EST

  • Processus documenté et reproductible
  • Dataset accessible et vérifiable
  • Biais explicités

❌ Ce que cette méthodologie N'EST PAS

  • Audit externe par cabinet indépendant
  • Méthodologie académique peer-reviewed
  • Garantie ROI pour futurs projets
⚠️ Source : Auto-déclaratif (ENDKOO)
Cette méthodologie est documentée par ENDKOO sans validation tierce externe. Les données sont accessibles pour vérification, mais aucun audit indépendant n'a été réalisé.

8. Contact Méthodologie

Questions / reproductibilité :

Dernière mise à jour : 29 décembre 2025

Prochaine révision : T2 2026 (intégration nouveaux déploiements)

📊 Evidence Pack v1.0
Ce document fait partie de l'Evidence Pack v1.0 créé pour garantir la transparence et l'auditabilité des claims du site denisatlan.fr.

← Retour au hub Evidence Pack