Data & Analytics

Data Scientist

Le Data Scientist transforme les données brutes en insights stratégiques grâce au machine learning et aux statistiques avancées, permettant aux entreprises de prendre des décisions basées sur les données.

Missions

  • Collecter, nettoyer et préparer les données issues de sources variées (bases de données, API, logs, capteurs) pour les rendre exploitables
  • Concevoir et entraîner des modèles de machine learning et de deep learning adaptés aux problématiques métier de l'entreprise
  • Réaliser des analyses exploratoires et statistiques approfondies pour identifier des tendances, des corrélations et des opportunités business
  • Créer des visualisations de données et des tableaux de bord interactifs pour communiquer les résultats aux parties prenantes non techniques
  • Mettre en production les modèles prédictifs et assurer leur suivi de performance dans le temps (monitoring, retraining)
  • Collaborer avec les équipes métier, produit et ingénierie pour définir les cas d'usage data et prioriser les projets à fort impact

Compétences requises

Techniques

Python (NumPy, Pandas, Scikit-learn, TensorFlow, PyTorch)Statistiques et probabilités avancéesMachine learning supervisé et non superviséDeep learning et réseaux de neuronesSQL et bases de données relationnellesVisualisation de données (Matplotlib, Seaborn, Plotly)Traitement du langage naturel (NLP)Big Data (Spark, Hadoop)

Soft skills

Esprit analytique et curiosité intellectuelleCommunication et vulgarisation des résultatsTravail en équipe pluridisciplinaireRigueur scientifique et sens critiqueCompréhension du contexte métier et des enjeux businessGestion de l'incertitude (un modèle ne promet jamais 100 %)Storytelling : transformer un résultat statistique en décision

Outils et technologies

Python / Jupyter NotebookTensorFlow / PyTorchSQL / PostgreSQLApache SparkTableau / Power BIGit / GitHub

Data Scientist vs Data Analyst vs Data Engineer vs ML Engineer

Salaires médians issus de notre grille métiers-ia.fr (brut annuel, France, 2026), dérivés des fourchettes de nos 18 fiches. Le ratio exploration / production estime la part du temps passée à analyser versus à industrialiser.
RôleFocusLivrable principalStack typiqueRecherche / prodSalaire médian
Data ScientistExplorer les données, prototyper des modèles prédictifsModèle validé, notebook, rapport d'impact businessPython, pandas, scikit-learn, Jupyter≈ 70 / 3057 000 €
Data AnalystDécrire l'existant, répondre aux questions métierTableaux de bord, rapports, analyses ad hocSQL, Power BI / Tableau, Excel, un peu de Python≈ 85 / 1545 000 €
Data EngineerConstruire et fiabiliser les pipelines de donnéesETL/ELT, entrepôt, flux temps réel fiablesSpark, Airflow, dbt, SQL≈ 10 / 9056 000 €
Machine Learning EngineerIndustrialiser et maintenir les modèles en productionService / API ML en production + pipeline MLOpsPyTorch, Docker, Kubernetes, MLflow≈ 30 / 7062 000 €

Salaires médians issus de notre grille métiers-ia.fr (brut annuel, France, 2026), dérivés des fourchettes de nos 18 fiches. Le ratio exploration / production estime la part du temps passée à analyser versus à industrialiser.

Les 7 étapes réelles d'un projet data (et où le Data Scientist met les mains)

Sur le papier, le métier c'est « faire des modèles ». Dans les faits, la modélisation occupe une part réduite d'un projet. Voici le déroulé d'un vrai projet data en entreprise et l'étape où le Data Scientist pilote vraiment — parce que ce décalage est ce qui surprend le plus en reconversion.

  1. 1. Cadrage du besoin

    En appui du métier

    Traduire une question métier floue (« pourquoi on perd des clients ? ») en un problème mesurable avec une métrique de succès et un jeu de données cible.

    Outils : Ateliers métier, tableur, aucun code

    Une bonne partie des projets qui échouent le font ici, pas sur l'algorithme : un besoin mal cadré produit un modèle techniquement propre mais inutile.

  2. 2. Collecte & accès aux données

    Contributeur (avec le Data Engineer)

    Identifier les sources, obtenir les accès et rapatrier les données depuis les bases de production, l'entrepôt ou des API.

    Outils : SQL, BigQuery, Snowflake, Spark

    C'est là que le Data Scientist dépend du Data Engineer : sans pipeline fiable, il bricole des extractions manuelles qui casseront au prochain changement de schéma.

  3. 3. Nettoyage & préparation

    Pilote — le gros du temps

    Valeurs manquantes, doublons, types incohérents, jointures, création de variables (feature engineering). La donnée devient exploitable.

    Outils : pandas, dbt, SQL

    La phase la plus longue. La règle empirique « 80 % du temps sur la donnée, 20 % sur le modèle » n'est pas un slogan, c'est le quotidien.

  4. 4. Analyse exploratoire (EDA)

    Pilote

    Regarder les distributions, les corrélations et les cas aberrants pour se faire une intuition avant de modéliser, et poser les premières hypothèses.

    Outils : Jupyter, pandas, Matplotlib, Seaborn

  5. 5. Modélisation

    Pilote

    Entraîner, comparer et régler plusieurs modèles. Sur données tabulaires, c'est souvent un gradient boosting plutôt qu'un réseau de neurones.

    Outils : scikit-learn, XGBoost, PyTorch, MLflow

    En entreprise, un XGBoost bien réglé bat un modèle de deep learning dans la majorité des cas tabulaires, pour un coût de maintenance bien moindre.

  6. 6. Validation & interprétation

    Pilote

    Vérifier que le modèle tient sur des données jamais vues, mesurer les bonnes métriques, contrôler les biais et rendre la décision explicable.

    Outils : scikit-learn, SHAP, validation croisée

    Un bon score de validation ne suffit pas : il faut prouver la robustesse et savoir répondre à « et si le modèle se trompe, ça coûte quoi ? ».

  7. 7. Mise en production & suivi

    Passe souvent la main au ML Engineer

    Déployer le modèle en service ou en API, surveiller la dérive des données et déclencher le réentraînement quand la performance baisse.

    Outils : Docker, MLflow, cloud (AWS/GCP/Azure)

    La vraie frontière avec le ML Engineer. Plus le Data Scientist sait franchir cette étape, plus il se rapproche du haut de la grille (voir le comparatif plus haut).

À retenir : le Data Scientist est maître d'œuvre du milieu de chaîne, de la préparation au modèle validé, pas des deux extrémités. En amont il dépend du métier pour le cadrage et du Data Engineer pour les données ; en aval il passe souvent le relais au ML Engineer pour la production. Savoir dialoguer avec ces deux voisins compte autant que l'algorithme.

Marché & vérités 2026

Mis à jour : Juillet 2026

Les pages d'écoles vendent une pénurie permanente. La réalité 2026 est plus nuancée : la demande reste forte sur les profils capables de livrer en production, mais le marché junior s'est resserré à mesure que bootcamps et masters ont multiplié les candidats. Les trois chiffres ci-dessous viennent de sources nommées et datées, avec ce que chacun ne dit pas.

+11,4 %

Évolution du salaire d'un Data Scientist en 2026 par rapport à 2025, autour de 56 k€.

Ce que ça ne dit pas : Un métier, une année, un baromètre de cabinet de recrutement. Ce n'est pas une tendance « secteur IA » : sur la même période, certains profils dev reculent légèrement.

Le Monde Informatique (baromètre Silkhom) (7 juillet 2026)

+56 %

Prime salariale des postes exigeant des compétences IA, face aux postes comparables du même secteur.

Ce que ça ne dit pas : Mesure mondiale sur près d'un milliard d'offres, pas un chiffre France ni un chiffre « métier data scientist » : PwC compare toutes filières selon qu'elles demandent ou non des compétences IA.

PwC — Global AI Jobs Barometer (juin 2025)

25 000+

Profils analysés par Silkhom entre 2019 et 2026 pour bâtir sa grille data & IA, sur des placements CDI réels.

Ce que ça ne dit pas : Échantillon d'un cabinet de recrutement : il voit les postes qu'on lui confie, pas le marché entier. Les grands groupes qui recrutent en direct en sortent.

Silkhom — Baromètre salaires IA & ML 2026 (30 juin 2026)

En clair : viser Data Scientist reste un bon calcul si vous acceptez que la vraie barrière n'est plus le diplôme mais la capacité à faire vivre un modèle au-delà du notebook. C'est aussi ce qui explique que le ML Engineer, plus orienté production, paie davantage sur notre grille.

Salaire en France

Junior

38 000€ - 48 000€

Confirmé

50 000€ - 70 000€

Senior

75 000€ - 120 000€

Brut annuel indicatif, France métropolitaine. Grille complète

Formation

Niveau requis

Bac+5 minimum (Master, Diplôme d'ingénieur ou Doctorat)

Diplômes recommandés

  • Master en Data Science, Statistiques ou Mathématiques appliquées
  • Diplôme d'ingénieur avec spécialisation en data science ou intelligence artificielle
  • Doctorat en informatique, mathématiques ou domaine quantitatif
  • Master en informatique avec spécialisation machine learning

Certifications valorisées

Google Professional Data EngineerAWS Certified Machine Learning – SpecialtyMicrosoft Certified: Azure Data Scientist AssociateIBM Data Science Professional Certificate

Voir toutes les formations IA

Se lancer comme Data Scientist

Comparez les formations et les outils IA à maîtriser pour ce métier.

Livres pour aller plus loin

Sélection de livres de référence. Liens affiliés Amazon : votre achat peut générer une commission pour l'éditeur, sans surcoût pour vous.

Environnement de travail

Grandes entreprises et groupes du CAC 40 (BNP Paribas, TotalEnergies, L'Oréal)Startups et scale-ups spécialisées en IA et dataCabinets de conseil en data et transformation digitaleSecteur public et organismes de recherche (CNRS, INRIA)Entreprises de la tech (Google, Meta, Amazon, Criteo)

Qui recrute en France (et sous quel code métier)

Le Data Scientist dispose d'une fiche MétierScope dédiée chez France Travail sous le code ROME M1405. C'est le code de référence pour les offres d'emploi, la formation professionnelle et le financement CPF — à ne pas confondre avec le M1805 (études et développement informatique) qui couvre les développeurs et le Machine Learning Engineer. Fiche M1405Data scientist (France Travail)

Grands groupes et institutions

BNP Paribas, AXA, Société Générale, L'Oréal, TotalEnergies, SNCF, Carrefour, Orange, CNRS, INRIA

Éditeurs et entreprises tech

Criteo, Dataiku, Doctolib, BlaBlaCar, Veepee, Back Market, Contentsquare, Believe

Conseil, ESN et cabinets data

Capgemini, Sopra Steria, Ekimetrics, Artefact, Quantmetry

Évolution de carrière

Lead Data Scientist ou Principal Data Scientist
Head of Data Science / Directeur Data Science
Machine Learning Engineer
Chief Data Officer (CDO)
Chercheur en intelligence artificielle
Consultant senior en data science

Avantages et défis

Avantages

  • Salaires attractifs et forte demande sur le marché de l'emploi
  • Diversité des secteurs d'application (santé, finance, industrie, retail)
  • Travail intellectuellement stimulant avec des problématiques variées
  • Possibilité de télétravail et flexibilité des conditions de travail
  • Impact concret et mesurable sur les décisions stratégiques de l'entreprise

Défis

  • Nécessité de se former en permanence face à l'évolution rapide des technologies
  • Qualité des données souvent insuffisante nécessitant un travail de nettoyage important
  • Difficulté à communiquer des résultats techniques à des interlocuteurs non spécialisés
  • Pression sur les délais de livraison et les attentes parfois irréalistes des décideurs

Comment devenir Data Scientist

Parcours, formations recommandées et conseils.

Lire le guide

Questions d'entretien du Data Scientist

Ce qu'on demande vraiment en entretien, et la réponse attendue derrière chaque question.

TechniqueComment détectez-vous et corrigez-vous un surapprentissage (overfitting) ?

Réponse attendue : On le repère à l'écart entre performance d'entraînement (excellente) et de validation (nettement moins bonne). Remèdes : plus de données, régularisation (L1/L2, dropout), réduction de la complexité du modèle, validation croisée pour un diagnostic fiable, et early stopping sur les modèles itératifs. On cherche surtout que le candidat raisonne biais-variance plutôt que de réciter une recette.

TechniqueVos classes sont fortement déséquilibrées (1 % de fraude). Pourquoi l'accuracy est-elle trompeuse et que regardez-vous ?

Réponse attendue : Un modèle qui prédit toujours « pas de fraude » atteint 99 % d'accuracy sans rien détecter. On passe à la précision, au rappel, au F1 et à l'aire sous la courbe PR (plus parlante que la ROC ici). Côté traitement : rééchantillonnage (SMOTE, undersampling), pondération des classes, ou ajustement du seuil de décision selon le coût métier d'un faux négatif.

TechniqueQuand préférez-vous un modèle simple et interprétable à un modèle plus performant type gradient boosting ?

Réponse attendue : Dès que la décision doit être justifiée (crédit, santé, RH, contexte réglementaire AI Act), qu'un métier doit s'approprier les règles, ou que le gain de performance ne justifie pas la perte de lisibilité et le coût de maintenance. Un bon Data Scientist arbitre selon l'usage, pas selon le score de validation seul.

TechniqueDifférence entre corrélation et causalité, et comment l'aborder concrètement ?

Réponse attendue : Une corrélation observée ne prouve pas qu'une variable en cause une autre : il peut y avoir une variable confondante ou une causalité inverse. Pour approcher la causalité on privilégie l'expérimentation (A/B test), et à défaut des méthodes quasi-expérimentales (variables instrumentales, différence de différences). Le piège classique : recommander une action métier à partir d'une simple corrélation.

ComportementalRacontez un projet où votre modèle n'a finalement pas été mis en production.

Réponse attendue : On évalue la lucidité : reconnaître qu'un bon score de validation ne suffit pas si le cas d'usage, la qualité des données ou le coût d'intégration ne suivent pas. La bonne réponse assume l'arbitrage et la communication honnête avec le métier plutôt que la défense d'un modèle qui ne tenait pas ses promesses.

ComportementalComment expliquez-vous un résultat statistique à un comité de direction non technique ?

Réponse attendue : On cherche la capacité à partir de la décision, pas de la méthode : formuler l'enjeu business, donner un chiffre unique et son intervalle d'incertitude, une visualisation lisible, et une recommandation claire. Éviter le jargon (p-value, matrice de confusion) et anticiper la question « et si on se trompe, ça coûte quoi ? ».

Questions fréquentes

Quelle est la différence entre un Data Scientist et un Data Analyst ?

Le Data Analyst se concentre sur l'analyse descriptive des données existantes pour créer des rapports et des tableaux de bord, tandis que le Data Scientist utilise des techniques de machine learning et de modélisation prédictive pour anticiper des tendances futures. Le Data Scientist possède généralement des compétences plus poussées en programmation et en mathématiques.

Le métier de Data Scientist est-il menacé par l'IA générative ?

L'IA générative transforme le métier de Data Scientist mais ne le remplace pas. Les outils comme ChatGPT ou GitHub Copilot accélèrent certaines tâches (écriture de code, exploration de données), mais l'expertise humaine reste indispensable pour formuler les bonnes questions, interpréter les résultats et prendre des décisions stratégiques. Le rôle évolue vers plus de supervision et de cadrage des modèles d'IA.

Quels secteurs recrutent le plus de Data Scientists en France ?

En 2026, les secteurs qui recrutent le plus de Data Scientists en France sont la banque et l'assurance, le conseil en technologie, le e-commerce et le retail, la santé et l'industrie pharmaceutique, ainsi que les entreprises de la tech. Paris et sa région concentrent environ 70 % des offres d'emploi, mais les grandes métropoles régionales (Lyon, Toulouse, Nantes) développent également leur écosystème data.

Un Data Scientist peut-il travailler en freelance ?

Oui, le freelance est une option viable pour les Data Scientists expérimentés. Les tarifs journaliers moyens se situent entre 500€ et 900€ selon l'expertise et la complexité des missions. Le freelance offre une grande flexibilité mais nécessite une solide expérience (3 à 5 ans minimum) et un réseau professionnel développé pour assurer un flux régulier de missions.

Le marché du Data Scientist est-il saturé en 2026 ?

Pas au niveau senior, mais l'entrée s'est durcie. Le titre a beaucoup attiré, et les profils juniors sortis de bootcamp sont désormais nombreux face à un nombre d'offres « débutant » limité. Côté rémunération, la tendance reste positive : le baromètre Silkhom repris par Le Monde Informatique donne +11,4 % sur le salaire d'un Data Scientist entre 2025 et 2026 (autour de 56 k€). Dit autrement : le marché n'est pas saturé pour qui sait mettre un modèle en production et parler business, il l'est pour le profil « j'ai fait trois notebooks Kaggle ».

Data Scientist, Data Analyst, Data Engineer ou ML Engineer : lequel paie le mieux ?

Sur notre grille (brut annuel médian, France, 2026), le ML Engineer arrive en tête à 62 k€, devant le Data Scientist (57 k€) et le Data Engineer (56 k€) ; le Data Analyst ouvre la voie d'accès la plus large mais paie moins, autour de 45 k€. L'écart ne récompense pas la difficulté des maths mais la rareté de la composante génie logiciel : plus vous savez industrialiser un modèle (Docker, API, monitoring), plus vous vous rapprochez du haut de la grille. Le tableau comparatif plus haut détaille focus, livrable et stack de chaque rôle.

À quoi ressemble une journée type d'un Data Scientist ?

Beaucoup moins de deep learning qu'on ne l'imagine. Une bonne partie du temps part dans la donnée : requêtes SQL, nettoyage, vérification que les colonnes veulent bien dire ce qu'on croit. Vient ensuite l'analyse exploratoire et l'entraînement de modèles, souvent des gradient boosting (XGBoost) sur données tabulaires plutôt que des réseaux de neurones. Puis les réunions : cadrer un cas d'usage avec le métier, présenter des résultats, arbitrer ce qui vaut le coup d'être mis en production. La règle empirique classique du métier — « 80 % de préparation des données, 20 % de modélisation » — reste vraie en 2026.

Machine Learning Engineer

Le Machine Learning Engineer (ingénieur en apprentissage automatique) est un spécialiste qui conçoit, développe et déploie des systèmes d'intelligence artificielle capables d'apprendre à partir de données. À la croisée du génie logiciel et de la data science, il transforme les prototypes de modèles de machine learning en solutions robustes et scalables, prêtes pour la production. En 2026, ce profil est parmi les plus recherchés et les mieux rémunérés de l'écosystème IA, porté par l'essor de l'IA générative et la nécessité croissante d'industrialiser les modèles d'apprentissage automatique.

62 000 € médianBac+5 minimum (Diplôme d'ingénieur ou Master spécialisé)

Data Engineer

Le Data Engineer est l'architecte des pipelines de données. Il conçoit, développe et maintient les infrastructures techniques qui permettent de collecter, transformer, stocker et distribuer les données au sein de l'entreprise. Sans Data Engineer, les Data Scientists et les analystes ne pourraient pas accéder aux données dont ils ont besoin. En 2026, ce rôle est plus stratégique que jamais avec l'explosion des volumes de données, l'adoption massive du cloud et la nécessité d'alimenter les modèles d'IA en données de qualité en temps réel.

56 000 € médianBac+5 (Master en informatique ou Diplôme d'ingénieur)

Data Analyst IA

Le Data Analyst IA exploite les données de l'entreprise en combinant les méthodes classiques d'analyse de données avec les outils et techniques de l'intelligence artificielle. Il utilise des algorithmes de machine learning pour enrichir ses analyses, automatiser la détection de tendances et produire des insights prédictifs. Ce professionnel joue un rôle clé dans la prise de décision basée sur les données, en rendant l'IA accessible aux équipes métier.

45 000 € médianBac+3 à Bac+5