Comment un modèle d’IA voit-il une image ?
L’intelligence artificielle peut reconnaître des objets dans des photos, décrire des images, identifier des personnes, extraire du texte de documents et même générer des images complètement nouvelles. Dans ce contexte, la question suivante est de plus en plus posée : comment un modèle d’IA « voit » une image ?
La réponse est : « Différemment de la façon dont un être humain voit ». Un modèle d’intelligence artificielle ne regarde pas une photo et ne « comprend » pas instantanément ce qu’elle représente. Pour un ordinateur, une image est d’abord un très grand ensemble de données numériques. L’IA analyse ces données, recherche des motifs et utilise les informations apprises précédemment pour déterminer ce qui se trouve dans l’image.
Cette technologie s’appelle Vision par ordinateur et est l’une des branches les plus importantes de l’intelligence artificielle moderne.
Pour un modèle d’IA, une image est composée de millions de valeurs numériques
Lorsque une personne regarde une photo, le cerveau identifie rapidement des objets, des contextes et des relations. C’est:
« un ordinateur portable sur un bureau. »
« un chien dans un parc. »
« une voiture photographiée dans la rue. »
Un ordinateur n’a pas cette perception visuelle.
Une photo numérique est composée de pixels. Chaque pixel contient des informations sur la couleur et l’intensité, généralement par des valeurs pour :
- rouge (Red);
- vert (Green);
- bleu (Blue).
Une image Full HD contient plus de 2 millions de pixels, et chacun d’eux représente une information numérique analysée par le modèle d’IA.
Par conséquent, l’intelligence artificielle ne voit pas initialement « un arbre », « un téléphone » ou « une personne ». Elle voit des millions de valeurs mathématiques dont elle essaie de découvrir des motifs.
Comment un modèle d’IA apprend à reconnaître ce qui apparaît dans une image ?
Pour pouvoir analyser des images, les modèles d’IA sont entraînés en utilisant de très grandes quantités de données.
Par exemple, pour qu’un modèle reconnaisse un chat, il peut être entraîné avec des millions de photos contenant des chats dans différentes situations :
- lumière différente;
- angles différents;
- races différentes;
- tailles différentes;
- fonds différents.
Au cours de l’entraînement, le modèle identifie les éléments qui apparaissent fréquemment dans ces images et construit des représentations mathématiques des concepts.
Le processus ressemble à la manière dont un enfant apprend à reconnaître des objets : par de nombreux exemples.
Des pixels aux objets : comment un modèle d’IA traite une photo ?
Les modèles traditionnels d’analyse visuelle, comme les réseaux neuronaux convolutifs (CNN), traitent les images en plusieurs étapes.
1. Détection des éléments simples
Les premiers niveaux analysent :
- bords;
- lignes;
- contrastes;
- changements de couleur.
Ces informations représentent la base de la construction d’une image numérique.
2. Identification des formes et des motifs
Les niveaux suivants combinent ces éléments pour identifier :
- formes géométriques;
- textures;
- parties des objets;
- combinaisons de caractéristiques.
3. Reconnaissance de l’objet
Enfin, le modèle combine toutes les informations et estime quelle probabilité il y a que l’image contienne un certain objet.
Par exemple :
- 95 % de probabilité : ordinateur portable;
- 3 % de probabilité : moniteur;
- 2 % de probabilité : autre objet.
Important : un modèle d’IA ne perçoit pas l’ordinateur portable de la même manière qu’un être humain. Il calcule l’interprétation la plus probable sur la base de l’expérience accumulée lors de l’entraînement.
Comment un modèle d’IA « voit » les images comme ChatGPT ?
Au cours des dernières années, l’intelligence artificielle a beaucoup évolué au-delà de la simple classification des images.
Les modèles modernes sont capables de combiner des informations visuelles et textuelles. Ceux-ci sont appelés modèles multimodaux.
Un tel système peut :
- décrire le contenu d’une photo;
- répondre à des questions sur une image;
- identifier des objets;
- analyser des graphiques et des documents;
- extraire des informations à partir de captures d’écran.
La différence importante est que ces modèles n’analysent pas seulement « quel objet existe dans l’image », mais essaient de connecter l’information visuelle avec le langage naturel.
Par exemple, un modèle d’IA peut analyser une photo représentant un ordinateur portable et peut répondre :
« C’est un ordinateur portable probablement utilisé pour des activités de bureau, car il a un écran de taille moyenne et un design orienté vers la productivité. »
Comment un modèle d’IA génère-t-il de nouvelles images ?
En plus d’analyser des images existantes, l’intelligence artificielle peut générer des images complètement nouvelles. Les modèles génératifs d’images fonctionnent différemment des modèles classiques de reconnaissance.
Ils apprennent les structures visuelles à partir de millions d’exemples et peuvent créer de nouveaux résultats sur la base d’une description textuelle :
« Un ordinateur portable moderne sur un bureau minimaliste, dans un bureau lumineux. »
Le modèle ne cherche pas une photo existante, mais génère une nouvelle image sur la base des motifs appris.
Pourquoi l’intelligence artificielle se trompe-t-elle parfois ?
Bien que les modèles d’IA soient très performants, ils peuvent faire des erreurs.
Quelques raisons :
Données d’entraînement insuffisantes
Si le modèle n’a pas rencontré suffisamment d’exemples similaires, il peut interpréter l’image de manière incorrecte.
Biais dans les données
Si l’ensemble de données utilisé pour l’entraînement contient des déséquilibres, le modèle peut apprendre des associations incorrectes.
Contexte difficile
Les images floues, les objets cachés ou les angles inhabituels peuvent poser des problèmes même aux modèles les plus avancés.
Un modèle d’IA n’a pas d’intuition. Il opère sur la base des probabilités calculées à partir de l’expérience accumulée.
Qu’est-ce que l’IA explicable et pourquoi est-elle importante ?
À mesure que l’intelligence artificielle est utilisée dans des domaines importants, une question essentielle se pose :
Pourquoi l’IA a-t-elle pris cette décision ?
C’est ici qu’intervient le concept d’IA explicable (XAI).
Le but de la XAI est de rendre les modèles plus transparents et de fournir des indices sur les facteurs qui ont influencé le résultat.
Des outils tels que :
- Grad-CAM;
- SHAP;
- LIME;
- heatmaps;
peuvent mettre en évidence les zones d’une image qui ont eu une influence importante sur la prédiction.
Par exemple, si un modèle identifie une voiture, une carte de chaleur peut montrer qu’il s’est concentré sur les roues, les phares ou la forme de la carrosserie.
Ces méthodes ne montrent pas littéralement la « pensée » de l’IA, mais offrent une interprétation approximative des éléments qui ont contribué au résultat.
Quel matériel est nécessaire pour les applications d’IA ?
L’analyse d’images à l’aide de l’intelligence artificielle nécessite un grand volume de calculs. C’est pourquoi le matériel joue un rôle important.
Pour les applications d’IA modernes, il est important :
Processeur (CPU)
Un processeur performant joue un rôle essentiel dans la gestion des opérations nécessaires aux applications d’IA, de l’exécution des modèles à la gestion simultanée de plusieurs tâches.
Carte graphique (GPU)
Les cartes graphiques sont très importantes pour de nombreuses applications d’IA car elles peuvent effectuer simultanément un grand nombre de calculs nécessaires aux modèles d’intelligence artificielle.
Mémoire RAM
Les modèles d’IA et les applications multimédias peuvent utiliser de grandes quantités de mémoire, surtout lorsqu’ils analysent des images de grande taille ou des fichiers complexes.
Pour les utilisateurs qui souhaitent expérimenter avec l’intelligence artificielle localement sur leur propre ordinateur, le choix d’une configuration équilibrée peut faire la différence entre une expérience rapide et une expérience limitée.
L’avenir : des modèles d’IA qui comprennent le contexte visuel
L’intelligence artificielle évolue rapidement. Des systèmes simples qui classaient des images, nous sommes arrivés à des modèles capables d’analyser des photos, des vidéos, des documents et d’interagir avec les utilisateurs par le langage naturel.
À l’avenir, la Vision par ordinateur sera de plus en plus présente dans :
- ordinateurs portables intelligents;
- applications éducatives;
- automatisation;
- création numérique;
- dispositifs intelligents.
Des pixels à l’intelligence
Un modèle d’IA ne voit pas une image comme un homme. L’ordinateur transforme la photo en données numériques, analyse des motifs et utilise l’expérience accumulée pour interpréter ce qui apparaît dans l’image.
Les technologies modernes de Vision par ordinateur et d’IA multimodale ont changé la façon dont les ordinateurs interagissent avec le monde visuel, et l’IA explicable aide à créer des systèmes plus transparents et plus faciles à vérifier.
Pour les utilisateurs, comprendre comment fonctionne l’IA est le premier pas vers une utilisation plus efficace de la technologie actuelle, des applications intelligentes jusqu’au choix d’un ordinateur adapté aux nouvelles exigences numériques.
Source : fastdatascience.com, stanford.edu, deeplearning.ai, research.google