À propos IA
Secteurs
Plateformes
Prestations
Nos réalisations Blog Contact
Demander un devis
Magento

Nettoyer un catalogue Magento de 20 000 références avec l’IA — sans embaucher

Des données produit incomplètes sont le problème silencieux le plus coûteux du commerce. Elles limitent la recherche interne, perturbent la navigation à facettes, affaiblissent la visibilité organique et déterminent désormais si les agents d’achat IA peuvent vous référencer. Voici comment nous résolvons ce problème à l’échelle du catalogue.

Pipeline d’enrichissement de données produit par IA pour un large catalogue Magento

Si vous demandez à un marchand Magento quel est son principal problème technique, il vous parlera de vitesse, du tunnel d’achat ou de la mise à jour qu’il repousse sans cesse. Demandez à l’équipe merchandising et la réponse change : le catalogue est ingérable. La moitié des produits ont une description copiée du PDF fournisseur, l’attribut matière est renseigné sur 40 % des références, et personne ne sait plus quelle des trois taxonomies couleur est la bonne.

Ce n’est pas un problème d’apparence. Des attributs pauvres cassent la navigation à facettes, privent la recherche interne des termes réellement saisis par les clients, et produisent des pages catégories sans contenu pertinent pour Google. Avec la montée des achats assistés par agent, des données produit structurées ne relèvent plus du simple SEO : elles font la différence entre être cité par un assistant ou rester invisible.

La solution traditionnelle : une équipe de saisie et dix-huit mois de travail. En 2026, la solution réaliste est un pipeline. Voici le nôtre.

Ce pipeline sert à extraire et normaliser des informations déjà présentes dans vos sources, pas à inventer des données produit. Tout ce qu’un modèle ne peut pas justifier à partir de vos données sources doit rester vide, pas plausible. Si vous franchissez cette limite, vous publierez des absurdités crédibles à grande échelle.

Définir précisément ce que vous corrigez

Ne commencez pas par les descriptions. Commencez par les attributs, car tout le reste en dépend : filtres, recherche, flux, lisibilité machine. Les descriptions sont le problème visible ; les attributs, le problème coûteux.

Commencez par un audit de complétude. Pour chaque attribut de votre jeu d’attributs Magento, calculez le taux de remplissage et le nombre de valeurs distinctes. Ce seul rapport vous en dira plus qu’une semaine de réunions — il mettra en évidence l’attribut rempli à 94 % mais inutile car il compte 3 000 valeurs libres différentes, et celui rempli à 30 % qui transformerait vos pages catégories s’il était complet.

  • Taux de remplissage inférieur à 60 % sur un attribut filtrable — c’est la cause d’une navigation à facettes pauvre
  • Nombre élevé de valeurs distinctes sur un attribut censé être à choix — champ libre là où il faudrait une liste, donc aucune agrégation possible
  • Attributs multiples pour la même informationcolour, color, shade, hérités de trois scripts d’import différents
  • GTIN, MPN ou marque manquants — les champs qui conditionnent la possibilité de faire correspondre vos produits hors de votre site

Le pipeline

Quatre étapes, dont la troisième est décisive.

1. Exporter avec le contexte

Exportez le catalogue avec tout ce dont le modèle a besoin pour justifier ses réponses : description existante, texte fournisseur, chemin de catégorie, nom du jeu d’attributs, marque, et tout bloc de spécifications stocké dans un attribut personnalisé. Incluez le SKU et l’ID d’entité pour garantir un rapprochement sans ambiguïté.

Traitez par jeu d’attributs, pas en envoyant tout le catalogue d’un coup. Un prompt adapté aux dimensions de mobilier ne convient pas aux ingrédients cosmétiques, et mélanger les deux produit un résultat médiocre dans chaque cas.

2. Enrichir avec une consigne contrainte

Le prompt doit avoir un seul objectif : lire le texte source fourni et retourner un schéma fixe. Pas de rédaction marketing. Pas d’amélioration. Extraction et normalisation uniquement.

  • Indiquez les valeurs autorisées. Si material est un attribut à choix avec 24 options, listez-les toutes dans le prompt et exigez que la réponse soit l’une d’elles ou null.
  • Exigez explicitement une valeur null pour tout élément absent de la source. C’est l’instruction la plus importante du pipeline.
  • Demandez un signal de confiance par champ, afin de cibler la relecture au lieu de la rendre systématique.
  • Retournez une sortie structurée, validée selon un schéma, pour qu’une réponse mal formée échoue bruyamment au lieu d’être importée discrètement.

Testez l’instruction null de façon adversariale avant de traiter 20 000 références. Donnez-lui un produit sans information matière et vérifiez que material reste vide, au lieu de « coton ». S’il devine sur votre jeu de test, il devinera sur votre catalogue.

3. Contrôler par échantillonnage, pas en relisant tout

Personne ne relira 20 000 lignes, et prétendre le contraire fait échouer ces projets. Privilégiez l’échantillonnage, et laissez le signal de confiance orienter la revue :

  • Lignes à faible confiance : relisez-les toutes. Ce sont celles où la donnée source était réellement ambiguë.
  • Lignes à forte confiance : échantillonnez 5 %, répartis par catégorie et fournisseur pour éviter qu’un flux fournisseur défaillant ne se dissimule dans la moyenne.
  • Fixez un seuil d’acceptation avant de commencer — nous utilisons 98 % de justesse sur l’échantillon — et si un lot échoue, corrigez le prompt et relancez le lot plutôt que de corriger les lignes à la main.
  • N’échantillonnez jamais uniquement les catégories simples. Le problème que vous cherchez se trouve dans les données fournisseur les plus complexes.

Un merchandiser peut valider un lot en une après-midi avec un échantillon bien conçu. La même personne, ligne par ligne, y serait encore à Noël — raison pour laquelle la version non contrôlée de ce projet n’aboutit jamais.

4. Importer par lots réversibles

Importez par jeu d’attributs, par lot, en conservant les valeurs pré-import dans un emplacement permettant la restauration. L’import Magento peut écraser 20 000 bonnes lignes par 20 000 mauvaises très rapidement, et on s’en aperçoit souvent une semaine plus tard, quand quelqu’un remarque que les filtres sont incohérents.

Réindexez, puis vérifiez la navigation à facettes et les résultats de recherche sur les catégories concernées avant de publier le lot suivant. La surface visible sert de test de non-régression.

Descriptions : un travail différent, plus risqué

Une fois les attributs propres, générer les descriptions à partir de ceux-ci devient bien plus sûr — le modèle assemble des phrases à partir de faits vérifiés, au lieu d’inférer des faits à partir d’un texte. Procédez dans cet ordre, jamais l’inverse.

Même dans ce cas, restez vigilant. Les recommandations de Google portent sur l’utilité, pas sur la provenance : un texte généré automatiquement qui aide réellement l’acheteur est acceptable, un texte généré pour remplir une page ne l’est pas, peu importe l’auteur. Concrètement, cela implique :

  • Appuyez chaque affirmation sur un attribut. Pas de bénéfices inventés, pas de compatibilité inventée, pas de conseils d’entretien inventés.
  • Fournissez au prompt une vraie charte éditoriale avec trois exemples validés — la différence entre un texte générique et un texte conforme à la marque tient presque entièrement aux exemples.
  • Déployez sur un groupe témoin : enrichissez la moitié d’une catégorie, laissez l’autre intacte, puis comparez les impressions organiques et la conversion après un cycle complet de crawl. C’est la seule façon de savoir si cela fonctionne.
  • Gardez une validation humaine sur les catégories réglementées. Tout ce qui comporte une allégation santé, sécurité, ingrédient ou conformité ne passe jamais par un pipeline automatisé.

Où cela échoue

Quatre modes d’échec, tous déjà rencontrés.

  1. Spécifications inventées. Dimensions, poids et compatibilités déduits du contexte. Cela génère des retours, et dans certains secteurs, des risques juridiques — d’où l’importance de l’instruction null, plus encore que celle du schéma.
  2. Normalisation excessive. Forcer 3 000 couleurs libres en 24 options est utile, jusqu’à ce que « Racing Green » et « British Racing Green » deviennent « Vert » et qu’un client reçoive la mauvaise pièce auto.
  3. Glissement silencieux de la taxonomie. Chaque lot modifie légèrement les valeurs, et six mois plus tard, l’attribut redevient incohérent, mais différemment. Corrigez cela avec une liste de valeurs autorisées verrouillée, pas seulement par la discipline du prompt.
  4. Optimiser pour l’usage, pas la visibilité. Un taux de remplissage de 100 % sur un attribut que personne n’utilise comme filtre n’apporte rien. Priorisez selon ce que vos fonctions de recherche et de navigation exploitent réellement.

Ce que cela coûte

L’inférence du modèle sur un catalogue de 20 000 références est de loin la partie la moins coûteuse du projet — le coût réel réside dans l’ingénierie nécessaire pour construire la chaîne de traitement et dans le temps passé par les équipes merchandising à valider les échantillons. Prévoyez quelques semaines d’intégration et un créneau défini pour la revue experte ; le coût des jetons est négligeable en comparaison.

C’est ce ratio qui justifie l’approche. Ce qui était coûteux — les heures humaines par référence — devient une fonction de qualité échantillonnée, et ce qui est désormais peu coûteux évolue avec le catalogue, non avec l’effectif.

Le second bénéfice : la lisibilité machine

Un catalogue propre et normalisé est la condition préalable à tout ce qui suit. La recherche sémantique n’a de valeur qu’avec des attributs cohérents. La qualité des recommandations dépend de la qualité des données produits. Les flux marchands sont refusés en cas de GTIN manquants. Et les assistants d’achat IA ne peuvent présenter que les produits dont ils lisent et valident les attributs.

Nous avons traité séparément comment faire recommander vos produits par ChatGPT et Perplexity ; en résumé, la majeure partie du travail consiste en réalité en ce projet de données. C’est le chantier discret qui rend les autres possibles.

Notre équipe IA et machine learning construit ces chaînes de traitement sur des catalogues Magento en production, et notre pratique d’intégration IA existe précisément pour garantir la robustesse de l’infrastructure avant d’activer la partie intelligente. Vous retrouvez ce principe dans notre travail sur l’inventaire Portmeirion : le modèle n’a jamais été meilleur que les données qui l’alimentaient.

Questions fréquentes

Le contenu produit par l’IA nuit-il au SEO ?

La position de Google porte sur l’utilité, pas sur l’auteur : un contenu qui aide l’acheteur est accepté, un contenu qui remplit des pages ne l’est pas. Le risque, en pratique, vient de la publication massive de textes pauvres ou inexacts ; c’est pourquoi nous enrichissons d’abord les attributs, puis générons les descriptions à partir de faits vérifiés.

Quelle part du catalogue doit être relue par un humain ?

Toutes les lignes à faible confiance, plus un échantillon stratifié de 5 % des lignes à forte confiance, selon un seuil d’acceptation défini à l’avance. Si un lot échoue, il faut corriger le prompt et relancer, plutôt que de corriger à la main — sinon, vous revenez à un effort humain linéaire.

Peut-on exécuter ce processus en continu à mesure que de nouveaux produits arrivent ?

Oui, et il le faut. Une fois le pipeline en place, le relier à la création produit évite que le catalogue ne se dégrade à nouveau. Gardez les listes de valeurs autorisées verrouillées et versionnées, sinon vous risquez une dérive progressive de la taxonomie plutôt qu’un désordre ponctuel.

Qu’en est-il des catégories réglementées ?

Écartez-les du parcours automatisé. Tout produit comportant une allégation de santé, sécurité, composition, dosage ou conformité doit être validé par une personne nommée à chaque modification. Le gain d’efficacité ne justifie pas le risque.

Faut-il un PIM distinct avant de lancer ce processus ?

Pas forcément. Si Magento est votre seule source de vérité produit, enrichissez directement dans Magento. Un PIM devient pertinent dès lors que plusieurs canaux consomment les mêmes données et que Magento n’est plus le référentiel principal — mais son acquisition n’est pas un prérequis pour nettoyer l’existant.

Commencez par l’audit de complétude

Avant toute chose, obtenez le rapport de taux de remplissage et de valeurs distinctes pour vos ensembles d’attributs — cela requalifie souvent le problème. Nous l’exécuterons sur votre catalogue et vous indiquerons quels attributs méritent une chaîne de traitement et lesquels relèvent du bruit. Contactez notre équipe ; réponse sous un jour ouvré.


Un projet similaire ?

Expliquez-nous ce que vous développez et où vous rencontrez un blocage. Nous vous répondrons sous un jour ouvré avec une estimation claire du périmètre, des étapes et du coût.

  • Une estimation claire du périmètre, des étapes et du coût
  • Réponse sous un jour ouvré
  • Aucune obligation, aucun suivi commercial

Protégé par Cloudflare Turnstile. Vos informations ne sont jamais partagées.