Machine Learning appliqué aux géosciences : comprendre et prédire les données géologiques

Ce cours explore l'application du machine learning dans le domaine des géosciences. Les méthodes d'apprentissage automatique permettent d'analyser et de prédire des données géologiques complexes, telles que les compositions minérales, les anomalies géochimiques et les propriétés physiques des roches. Les participants apprendront à utiliser des algorithmes adaptés pour classifier, estimer et cartographier des informations géologiques, tout en comprenant les enjeux et les limites de ces techniques dans un contexte scientifique.

Machine Learning appliqué aux géosciences : comprendre et prédire les données géologiques
OpenAI
Ajouter aux favoris
Sommaire

Objectifs

  • Comprendre les principes de base du machine learning
  • Appliquer des méthodes de classification et de régression
  • Utiliser des algorithmes pour analyser des données géologiques
  • Évaluer la performance des modèles prédictifs
  • Interpréter les résultats dans un contexte géologique

Prérequis

  • Connaissances de base en géologie
  • Notions de statistiques et d'analyse de données
  • Familiarité avec un langage de programmation, idéalement Python

Introduction

La géologie moderne repose de plus en plus sur l’analyse de grandes quantités de données. Les géologues travaillent avec des cartes, des analyses géochimiques, des mesures géophysiques, des images satellites, des données de forage ou encore des séries temporelles hydrogéologiques.

Lorsque le volume de données devient important, certaines relations peuvent être difficiles à identifier manuellement.

Le machine learning, ou apprentissage automatique, permet de construire des modèles capables d’apprendre à partir de données existantes afin de réaliser des classifications, des estimations ou des prédictions.

En géosciences, ces méthodes peuvent notamment être utilisées pour :

  • classifier des roches ;
  • identifier des anomalies géochimiques ;
  • prédire certaines propriétés physiques ;
  • cartographier des zones favorables à une minéralisation ;
  • analyser des données de forage ;
  • détecter des structures géologiques ;
  • estimer la susceptibilité à certains risques naturels.

L’objectif de ce cours est de comprendre les principales méthodes du machine learning et leur utilisation dans les géosciences.

1. Qu’est-ce que le machine learning ?

Le machine learning est une branche de l’intelligence artificielle.

Son principe consiste à permettre à un programme informatique d’apprendre des relations à partir de données.

Dans une approche informatique classique, un développeur programme directement les règles nécessaires pour résoudre un problème.

Avec le machine learning, on fournit plutôt au modèle :

  • des données ;
  • des exemples ;
  • éventuellement les résultats attendus.

Le modèle cherche ensuite automatiquement les relations présentes dans ces données.

Exemple

Supposons que l’on dispose de plusieurs milliers d’échantillons de roches.

Pour chacun, on connaît :

  • la teneur en SiO₂ ;
  • la teneur en FeO ;
  • la teneur en MgO ;
  • la teneur en CaO ;
  • la densité ;
  • le type de roche.

Le modèle peut apprendre les relations entre les caractéristiques chimiques et la lithologie.

Il pourra ensuite proposer une lithologie pour un nouvel échantillon.

Données géologiques → entraînement → modèle → nouvelle donnée → prédiction

2. Pourquoi utiliser le machine learning en géologie ?

La géologie produit de nombreux types de données.

Un projet d’exploration minière peut par exemple combiner :

  • plusieurs milliers d’analyses géochimiques ;
  • des données magnétiques ;
  • des mesures gravimétriques ;
  • des images satellites ;
  • une carte géologique ;
  • des données de forage.

Analyser toutes ces informations simultanément peut devenir difficile.

Le machine learning permet notamment de rechercher des relations entre plusieurs variables et de traiter rapidement de très grands volumes de données.

Il ne remplace cependant pas l’interprétation scientifique.

Un modèle peut identifier une relation statistique sans comprendre le processus géologique qui en est à l’origine.

3. Quels types de données peut-on utiliser ?

3.1. Données géochimiques

Les analyses géochimiques sont particulièrement adaptées aux méthodes de machine learning.

Elles peuvent contenir les concentrations de nombreux éléments :

  • Si ;
  • Al ;
  • Fe ;
  • Mg ;
  • Ca ;
  • Cu ;
  • Zn ;
  • Au ;
  • Ni ;
  • Co.

Ces données peuvent être utilisées pour :

  • classifier des roches ;
  • détecter des anomalies ;
  • identifier des associations d’éléments ;
  • reconnaître différentes signatures géochimiques.

3.2. Données géophysiques

Les données géophysiques peuvent également être analysées avec des algorithmes.

On peut utiliser :

  • magnétisme ;
  • gravimétrie ;
  • résistivité ;
  • sismique ;
  • polarisation provoquée ;
  • électromagnétisme.

Le machine learning peut par exemple aider à détecter des anomalies ou à classifier différentes zones.

3.3. Données de forage

Les forages produisent de nombreuses informations en fonction de la profondeur.

Par exemple :

  • lithologie ;
  • densité ;
  • résistivité ;
  • gamma ray ;
  • porosité ;
  • teneurs chimiques.

Un modèle peut apprendre à reconnaître différentes lithologies à partir de ces mesures.

3.4. Images satellites

Les images satellites sont composées de nombreuses informations spectrales.

Les satellites comme Sentinel ou Landsat permettent d’obtenir plusieurs bandes.

Ces données peuvent être utilisées pour :

  • classifier des terrains ;
  • identifier des zones d’altération ;
  • détecter certains changements ;
  • reconnaître certaines structures.

3.5. Données hydrogéologiques

Le machine learning peut aussi être utilisé avec des données liées aux eaux souterraines.

Par exemple :

  • niveau piézométrique ;
  • précipitations ;
  • température ;
  • conductivité ;
  • débit ;
  • qualité de l’eau.

Ces données peuvent permettre de construire des modèles prédictifs.

4. Apprentissage supervisé

L’apprentissage supervisé est l’une des méthodes les plus utilisées.

Le modèle apprend à partir de données pour lesquelles le résultat correct est déjà connu.

On distingue principalement deux types de problèmes :

  • classification ;
  • régression.

5. La classification

La classification consiste à prédire une catégorie.

Exemple géologique

On souhaite déterminer si un échantillon correspond à :

La variable cible est donc qualitative.

Le modèle reçoit les caractéristiques de chaque échantillon et apprend à distinguer les différentes classes.

6. La régression

La régression consiste à prédire une valeur numérique.

Exemple

On souhaite prédire la porosité d’une roche à partir de :

  • sa densité ;
  • sa composition minéralogique ;
  • sa profondeur ;
  • sa perméabilité ;
  • certaines mesures géophysiques.

Le modèle produit alors une valeur numérique.

Par exemple :

Porosité prédite : 18,4 %

7. Apprentissage non supervisé

Contrairement à l’apprentissage supervisé, les données ne possèdent pas nécessairement de catégories connues.

Le modèle cherche automatiquement des structures ou des groupes.

Cette approche est particulièrement utile en exploration.

8. Le clustering

Le clustering consiste à regrouper automatiquement les données qui se ressemblent.

Exemple

On possède 2 000 analyses géochimiques comportant 20 éléments chimiques.

Un algorithme peut identifier plusieurs groupes d’échantillons possédant des signatures similaires.

Ces groupes peuvent ensuite être interprétés par le géologue.

Ils peuvent correspondre à :

  • différentes lithologies ;
  • différents processus d’altération ;
  • différentes zones minéralisées.

9. Quelques algorithmes courants

9.1. Régression linéaire

La régression linéaire cherche à établir une relation entre plusieurs variables.

Elle peut par exemple être utilisée pour prédire une propriété physique.

Exemple

Porosité = fonction de la profondeur et de la densité.

Cette méthode est simple mais efficace lorsque les relations sont approximativement linéaires.

9.2. Arbre de décision

Un arbre de décision fonctionne comme une succession de questions.

Par exemple :

Si SiO₂ > 65 %, aller à gauche.

Si MgO > 5 %, aller à droite.

Ces décisions successives permettent d’obtenir une classification finale.

10. Random Forest

La Random Forest combine plusieurs arbres de décision.

Chaque arbre produit une prédiction.

La prédiction finale correspond généralement au résultat majoritaire ou à une moyenne.

Cette méthode est très utilisée car elle fonctionne bien avec :

  • des données tabulaires ;
  • plusieurs variables ;
  • des relations non linéaires.

Elle est particulièrement intéressante en géosciences.

Applications

  • classification lithologique ;
  • prédiction de minéralisation ;
  • cartographie de susceptibilité ;
  • analyse de données géochimiques.

11. Support Vector Machine

Le SVM cherche à trouver une frontière permettant de séparer différentes catégories.

Il peut être utilisé pour des problèmes comportant plusieurs variables.

Par exemple, il peut séparer différents types de roches selon leur composition chimique.

12. K-means

K-means est un algorithme de clustering.

Il regroupe automatiquement les données en un nombre déterminé de groupes.

Exemple

On demande au modèle de répartir 1 000 échantillons géochimiques en quatre groupes.

Le géologue peut ensuite analyser chaque groupe afin d’identifier leur signification géologique.

13. Préparer les données

Avant d’entraîner un modèle, les données doivent être préparées.

Cette étape est souvent aussi importante que le choix de l’algorithme.

13.1. Nettoyer les données

Il faut rechercher :

  • valeurs manquantes ;
  • erreurs de saisie ;
  • doublons ;
  • valeurs incohérentes.

13.2. Gérer les valeurs manquantes

Plusieurs solutions existent :

  • supprimer certaines lignes ;
  • remplacer les valeurs manquantes ;
  • utiliser une méthode statistique.

Le choix dépend du contexte scientifique.

13.3. Normalisation

Certaines variables peuvent avoir des échelles très différentes.

Par exemple :

Cu = 100 ppm

SiO₂ = 60 %

Altitude = 1 500 m

Certains algorithmes fonctionnent mieux lorsque les variables sont normalisées.

14. Séparer entraînement et test

Il ne faut pas tester un modèle uniquement sur les données utilisées pendant son entraînement.

On sépare généralement les données en deux parties :

Jeu d’entraînement

Utilisé pour apprendre le modèle.

Jeu de test

Utilisé pour vérifier sa capacité à produire de bonnes prédictions sur de nouvelles données.

Une division fréquente est :

80 % entraînement

20 % test

15. Comment évaluer un modèle ?

15.1. Accuracy

L’accuracy correspond au pourcentage de prédictions correctes.

Supposons que le modèle classe correctement 85 échantillons sur 100.

Accuracy = 85 %

Mais cette mesure seule peut être trompeuse lorsque les classes sont déséquilibrées.

15.2. Matrice de confusion

La matrice de confusion permet de voir précisément quelles classes ont été correctement ou incorrectement identifiées.

Elle peut par exemple montrer que le modèle confond souvent :

  • granite et granodiorite ;
  • basalte et andésite.

Cette information peut être particulièrement utile pour comprendre les limites du modèle.

16. Exemple : classification de roches

Supposons que nous disposions du tableau suivant :

SiO₂FeOMgOCaOK₂ORoche
722125Granite
49108111Basalte
586472Andésite
7420,814Rhyolite

Le modèle peut apprendre les relations entre les différentes concentrations chimiques.

Après entraînement, on fournit un nouvel échantillon :

SiO₂ = 50 %

FeO = 9 %

MgO = 7 %

CaO = 10 %

Le modèle peut par exemple prédire :

Basalte — probabilité : 91 %

17. Exemple : prédire la porosité

Le machine learning peut également être utilisé pour prédire une propriété continue.

Supposons que l’on possède des mesures de :

  • densité ;
  • profondeur ;
  • teneur en argile ;
  • perméabilité ;
  • porosité.

Le modèle apprend la relation entre ces variables.

On peut ensuite fournir les propriétés d’un nouvel échantillon.

Le modèle produit par exemple :

Porosité estimée : 17,8 %

18. Exemple pratique avec Python

Python est l’un des langages les plus utilisés pour le machine learning scientifique.

La bibliothèque scikit-learn fournit de nombreux algorithmes.

Voici un exemple très simple utilisant Random Forest.

import pandas as pd

from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import accuracy_score

data = pd.read_csv("roches.csv")

X = data[["SiO2", "FeO", "MgO", "CaO"]]
y = data["roche"]

X_train, X_test, y_train, y_test = train_test_split(
    X,
    y,
    test_size=0.2,
    random_state=42
)

model = RandomForestClassifier(
    n_estimators=100,
    random_state=42
)

model.fit(X_train, y_train)

predictions = model.predict(X_test)

accuracy = accuracy_score(
    y_test,
    predictions
)

print("Accuracy :", accuracy)

Ce code réalise plusieurs étapes :

  1. 1lecture des données ;
  2. 2sélection des variables ;
  3. 3séparation entraînement/test ;
  4. 4création du modèle ;
  5. 5entraînement ;
  6. 6prédiction ;
  7. 7calcul de la performance.

19. Importance des variables

Avec certains modèles comme Random Forest, il est possible d’estimer l’importance de chaque variable.

Par exemple :

SiO₂ : 38 %

MgO : 25 %

FeO : 20 %

CaO : 17 %

Cela peut aider à comprendre quelles variables influencent le plus la classification.

Attention : importance statistique ne signifie pas nécessairement causalité géologique.

20. Machine learning et cartographie

Le machine learning peut également être utilisé pour produire des cartes prédictives.

Pour chaque pixel ou cellule, on peut utiliser plusieurs informations :

  • altitude ;
  • pente ;
  • géologie ;
  • géochimie ;
  • proximité des failles ;
  • géophysique ;
  • couverture satellite.

Le modèle produit ensuite une valeur ou une catégorie.

Cela permet par exemple de créer une carte de :

  • potentiel minier ;
  • susceptibilité aux glissements ;
  • potentiel aquifère ;
  • altération hydrothermale.

21. Exemple : potentiel minier

Supposons que l’on souhaite identifier des zones favorables à une minéralisation en cuivre.

On peut combiner :

  • concentration en Cu ;
  • proximité des failles ;
  • type de roche ;
  • magnétisme ;
  • altération hydrothermale.

Les zones où des gisements sont déjà connus peuvent servir à entraîner le modèle.

Le modèle produit ensuite une carte de probabilité.

22. Risque de surapprentissage

Un problème fréquent en machine learning est le surapprentissage, ou overfitting.

Le modèle apprend trop précisément les données d’entraînement.

Il devient alors excellent sur les données qu’il connaît mais mauvais sur de nouvelles données.

Exemple

Performance sur entraînement :

99 %

Performance sur test :

62 %

Cela peut indiquer un surapprentissage.

23. Données déséquilibrées

En géologie, certaines catégories peuvent être beaucoup plus rares que d’autres.

Exemple :

9 500 échantillons non minéralisés

500 échantillons minéralisés

Un modèle pourrait prédire systématiquement « non minéralisé » et obtenir quand même 95 % d’accuracy.

L’accuracy ne suffit donc pas toujours.

Il faut également étudier :

  • précision ;
  • rappel ;
  • F1-score ;
  • matrice de confusion.

24. La qualité des données

Un modèle très complexe ne pourra pas compenser de mauvaises données.

Il faut notamment vérifier :

  • précision des mesures ;
  • représentativité géographique ;
  • qualité des analyses ;
  • cohérence des unités ;
  • méthode d’échantillonnage.

Un biais dans les données peut directement devenir un biais dans les prédictions.

25. Attention aux données spatiales

Les données géologiques sont souvent fortement liées à leur localisation.

Deux échantillons proches peuvent être très similaires.

Une séparation aléatoire classique entre entraînement et test peut alors donner une impression artificiellement bonne des performances.

Dans certains projets, il est préférable d’utiliser une validation spatiale.

Par exemple :

entraînement dans une zone ;

test dans une autre zone.

Cela permet de mieux mesurer la capacité réelle du modèle à généraliser.

26. Le modèle ne comprend pas la géologie

Un algorithme reconnaît des relations statistiques.

Il ne comprend pas :

  • la tectonique ;
  • la formation des roches ;
  • la diagenèse ;
  • l’histoire géologique ;
  • les processus hydrothermaux.

Une prédiction peut donc être statistiquement cohérente mais géologiquement impossible.

27. Le rôle du géologue

Le géologue reste indispensable à chaque étape.

Il doit :

  • sélectionner les données ;
  • choisir les variables pertinentes ;
  • contrôler leur qualité ;
  • interpréter les résultats ;
  • vérifier la cohérence scientifique ;
  • confronter les prédictions au terrain.

L’objectif du machine learning n’est donc pas de remplacer le géologue.

Il permet surtout d’augmenter ses capacités d’analyse.

28. Workflow recommandé

Un projet simple de machine learning en géosciences peut suivre les étapes suivantes :

  1. 1définir la question géologique ;
  2. 2collecter les données ;
  3. 3vérifier leur qualité ;
  4. 4explorer les données ;
  5. 5sélectionner les variables ;
  6. 6séparer entraînement et test ;
  7. 7entraîner plusieurs modèles ;
  8. 8comparer leurs performances ;
  9. 9analyser les erreurs ;
  10. 10interpréter les résultats géologiquement ;
  11. 11confronter les prédictions au terrain.

Question géologique → données → préparation → modèle → validation → interprétation → terrain

29. Mini TP : classifier des roches

Pour aller plus loin, on peut réaliser un petit exercice.

Créer un fichier CSV contenant les colonnes :

  • SiO2 ;
  • FeO ;
  • MgO ;
  • CaO ;
  • K2O ;
  • roche.

Ajouter plusieurs dizaines ou centaines d’échantillons.

Utiliser ensuite Random Forest pour prédire la colonne « roche ».

Objectifs

  • charger un dataset ;
  • entraîner un modèle ;
  • réaliser des prédictions ;
  • calculer l’accuracy ;
  • afficher une matrice de confusion ;
  • identifier les erreurs de classification.

Ce type d’exercice constitue une excellente introduction pratique au machine learning en géologie.

30. Limites et bonnes pratiques

Avant d’utiliser un modèle dans un projet réel, il est important de respecter quelques règles.

Ne jamais considérer une prédiction comme une vérité absolue.

Toujours vérifier :

  • la qualité du dataset ;
  • le nombre d’échantillons ;
  • la distribution des classes ;
  • la représentativité géographique ;
  • les performances sur des données indépendantes ;
  • la cohérence géologique.

Il est également recommandé de comparer plusieurs méthodes plutôt que de sélectionner immédiatement l’algorithme le plus complexe.

Un modèle simple, interprétable et robuste peut parfois être préférable.

Conclusion

Le machine learning représente un outil puissant pour analyser les données géologiques.

Il peut être utilisé pour classifier des roches, prédire des propriétés physiques, identifier des anomalies, analyser des données géophysiques ou produire des cartes prédictives.

Des algorithmes comme Random Forest, SVM, K-means ou les modèles de régression peuvent être appliqués à de nombreuses problématiques géoscientifiques.

Cependant, la performance statistique d’un modèle ne garantit pas automatiquement sa pertinence géologique.

La qualité des données, la validation et l’interprétation scientifique restent essentielles.

Le machine learning devient donc particulièrement puissant lorsqu’il est utilisé comme un outil complémentaire à l’expertise du géologue.

À retenir

  • Le machine learning permet d’apprendre des relations à partir de données géologiques.
  • La classification permet de prédire une catégorie.
  • La régression permet de prédire une valeur numérique.
  • Le clustering permet de rechercher automatiquement des groupes de données similaires.
  • Random Forest est particulièrement adapté à de nombreux jeux de données géologiques.
  • La séparation entre données d’entraînement et données de test est indispensable.
  • Il faut surveiller le surapprentissage et les données déséquilibrées.
  • Les données spatiales nécessitent une attention particulière.
  • Une prédiction statistique doit toujours être interprétée dans son contexte géologique.

Continuer

À lire ensuite

Introduction à l’intelligence artificielle en géologie
IA & GéologieLicence 21 min

Introduction à l’intelligence artificielle en géologie

Ce cours explore l'application de l'intelligence artificielle (IA) en géologie, mettant en lumière comment les techniques d'IA, telles que le machine learning et le deep learning, transforment l'analyse des données géologiques. Les étudiants apprendront à utiliser ces outils pour traiter des données complexes, reconnaître des structures géologiques, et optimiser la classification des roches. L'importance de l'expertise géologique dans l'interprétation des résultats sera également soulignée.