Lorsqu’un utilisateur ne trouve pas un produit, un document ou un dossier, le problème n’est pas toujours l’algorithme. Les données peuvent être incomplètes, les filtres incompréhensibles, les droits mal appliqués ou le vocabulaire différent de celui du contenu. Une recherche utile est un produit complet qui relie indexation, pertinence, interface et mesure.
La recherche vectorielle apporte une capacité à rapprocher des formulations. Elle ne remplace pas la précision du plein texte, les références exactes ni les filtres métier. Dans de nombreux cas, une combinaison hybride est la meilleure solution, à condition de pouvoir l’évaluer.
Commencer par les tâches de recherche
Les requêtes expriment des intentions différentes :
- atteindre un élément connu par son nom ou sa référence ;
- explorer une catégorie ;
- filtrer selon des attributs ;
- trouver un contenu répondant à une question ;
- comparer des options ;
- reprendre un dossier récent ;
- découvrir une information associée.
Le moteur doit reconnaître ces familles et l’interface doit les soutenir. Une barre unique peut proposer recherche, filtres, suggestions et historique sans traiter toutes les intentions de la même façon.
La qualité des données précède l’algorithme
L’index doit disposer de titres, descriptions, taxonomies, identifiants, dates, langues, statuts et permissions fiables. Les doublons, contenus vides et unités incohérentes dégradent la pertinence.
Une pipeline d’indexation documente :
- sources de vérité ;
- transformations ;
- champs recherchables ;
- champs filtrables ;
- analyse linguistique ;
- fréquence de mise à jour ;
- suppression ;
- erreurs et reprise.
La fraîcheur doit être visible lorsque l’indexation est asynchrone.
Le plein texte reste indispensable
Les moteurs lexicaux analysent les mots, leurs formes, positions et fréquences. Ils sont efficaces pour les noms propres, références, expressions exactes et contenus bien structurés.
Les réglages portent sur :
- pondération des champs ;
- analyse par langue ;
- synonymes ;
- tolérance aux fautes ;
- proximité des termes ;
- popularité ou fraîcheur ;
- règles métier contrôlées.
Une référence produit ne doit pas être corrigée comme une faute courante. Les champs techniques peuvent utiliser un analyseur spécifique.
Les filtres et facettes donnent du contrôle
Dans un catalogue ou une application métier, l’utilisateur connaît souvent des contraintes : statut, date, site, catégorie, certification ou propriétaire. Les facettes réduisent l’espace de recherche et expliquent la structure des résultats.
Les valeurs doivent être normalisées, compréhensibles et accompagnées de comptes cohérents. Les filtres actifs sont visibles, supprimables et partageables dans l’URL lorsque cela ne révèle pas d’information sensible.
Ce que la recherche vectorielle apporte
Un modèle d’embeddings représente requêtes et contenus sous forme de vecteurs. La proximité peut retrouver une paraphrase ou un concept même sans mots communs. Elle aide pour les questions naturelles, les contenus longs, le multilingue et les vocabulaires hétérogènes.
Ses limites sont importantes :
- références exactes parfois mal classées ;
- sensibilité au modèle et au découpage ;
- difficulté à expliquer un score ;
- coût d’indexation ;
- mise à jour du modèle ;
- besoin de filtrer les droits correctement.
La recherche vectorielle doit être testée sur le corpus réel.
Comparer les quatre briques de recherche
Plein texte
Précis, rapide et explicable pour les termes et références.
Filtres structurés
Indispensables pour les contraintes métier et l’exploration.
Recherche vectorielle
Utile pour la similarité sémantique, les questions et les formulations variées.
Reranking
Un modèle plus coûteux réordonne un petit ensemble de candidats. Il peut améliorer la tête des résultats, mais ajoute latence et dépendance.
Outil local de cadrage
Atelier de cadrage
Structurez les décisions principales avant de lancer un atelier métier. Les réponses restent dans votre navigateur.
Pipeline d’une recherche hybride depuis l’indexation jusqu’à la fusion, au reranking et à l’évaluation.
Construire une recherche hybride
Une recherche hybride exécute plusieurs stratégies puis fusionne leurs candidats. Une méthode de rang réciproque peut combiner les positions sans comparer directement des scores de nature différente. Des règles donnent la priorité à une référence exacte ou à un filtre explicite.
Le pipeline peut être :
- analyser la requête ;
- appliquer les filtres de sécurité et de contexte ;
- récupérer des candidats lexicaux ;
- récupérer des candidats vectoriels ;
- fusionner ;
- appliquer des règles métier ;
- reranker un sous-ensemble ;
- générer extraits et explications.
Chaque étape possède des métriques et un mode dégradé.
Respecter les droits
Une recherche interne ne doit jamais révéler l’existence d’un document interdit par son titre, son extrait ou un compte de facette. Les permissions doivent intervenir dans la requête ou dans un index segmenté.
Filtrer seulement après avoir récupéré dix résultats peut produire une page vide alors que des résultats autorisés existent plus loin. La stratégie doit préserver à la fois sécurité et rappel.
Les changements de droit doivent se propager rapidement et les caches être segmentés.
Indexer les documents longs
Un document peut être découpé en sections ou passages avec un lien vers le parent. Le découpage doit respecter titres, paragraphes, tableaux et métadonnées. Des morceaux trop petits perdent le contexte ; trop grands diluent la pertinence.
Pour une recherche documentaire, le résultat peut afficher le passage pertinent tout en ouvrant le document à l’emplacement approprié. La version et les droits restent ceux du document source.
Multilingue
Les analyseurs lexicaux et modèles vectoriels doivent être compatibles avec les langues. Une requête française peut-elle retrouver un document anglais ? La réponse dépend du besoin et doit être explicitement testée.
Les synonymes sont gérés par langue et métier. Une traduction automatique des requêtes peut aider, mais elle doit conserver les noms propres et références.
Suggestions et correction
L’autocomplétion peut proposer requêtes, catégories ou objets connus. Elle doit respecter les droits et éviter de révéler des données privées. Les suggestions sont rapides, limitées et distinguées des résultats.
La correction orthographique ne doit pas écraser la requête. Afficher « résultats pour » avec possibilité de revenir à l’expression originale est plus sûr, notamment pour les codes.
Évaluer avant de régler
Un jeu d’évaluation contient des requêtes représentatives, leur intention et des jugements sur les résultats. Il couvre les succès, références exactes, requêtes ambiguës, langues, filtres et cas sans réponse.
Les métriques techniques peuvent inclure :
- Recall@k : présence des résultats pertinents dans les premiers candidats ;
- MRR : position du premier résultat pertinent ;
- nDCG : qualité de l’ordre lorsque plusieurs niveaux de pertinence existent.
Elles sont complétées par taux de clic utile, reformulations, absence de résultat, temps de tâche et conversion métier.
Analyser les requêtes sans résultat
Une absence peut signifier contenu manquant, vocabulaire inconnu, faute, filtre trop restrictif ou droit insuffisant. Le rapport doit regrouper les requêtes en thèmes et éviter d’enregistrer des données sensibles inutiles.
Les améliorations peuvent porter sur le contenu, les synonymes, la taxonomie ou l’interface, pas seulement le moteur.
Expliquer le classement
Une explication simple renforce la confiance : correspondance du titre, référence exacte, filtre, proximité sémantique ou popularité. Les règles sponsorisées ou commerciales sont identifiées.
Les équipes doivent pouvoir inspecter une requête, ses candidats et les scores dans un outil d’administration sécurisé.
Exploiter et faire évoluer
Le moteur surveille latence, erreurs, retard d’indexation, taille, requêtes lentes et dérive des métriques. Une nouvelle version de modèle vectoriel nécessite réindexation, comparaison et possibilité de retour.
Les changements de pertinence sont déployés par expérimentation ou sur un échantillon, avec une analyse par intention afin qu’une amélioration globale ne masque pas une régression sur les références exactes.
La pertinence vient du système complet
Le meilleur moteur ne compense pas des données pauvres ni des droits incohérents. Une recherche réussie combine structure, lexique, sémantique, interface et boucle d’évaluation.
Partitech peut auditer une recherche existante, concevoir l’indexation, développer un moteur plein texte, vectoriel ou hybride et mettre en place un jeu d’évaluation. L’objectif est de rendre les résultats utiles, sûrs et mesurables, pas simplement plus sophistiqués.
Parlons de votre projet
Concevoir ou améliorer votre moteur de recherche avec Partitech. Contactez Partitech.