Présentation
En anglaisRÉSUMÉ
Les moteurs de recherche font partie de notre quotidien numérique et sont des carrefours essentiels pour nous permettre de rechercher de l'information sur Internet. Quels ont les principaux moteurs ? Comment fonctionnent-ils ? Cet article décrit les différentes phases de traitement de l'information par des outils comme Google ou Bing : crawl du Web, indexation des pages, analyse et utilisation de critères de pertinence in page /off page permettant de donner des notes aux documents explorés, puis affichage des résultats.
Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.
Lire l’articleABSTRACT
Search engines are part of our daily digital life and are essential hubs for seeking information on the Internet. What are the main ones? How do they work? This article describes the different phases of information processing used by tools such as Google or Bing: web crawling, page indexing, relevancy criteria analysis and use of in page / off page rating and display of the results.
Auteur(s)
-
Olivier ANDRIEU : Consultant, Éditeur du site Abondance.com
INTRODUCTION
Les moteurs de recherche rythment la vie numérique des internautes actuels. Carrefours indispensables pour mener à bien toute investigation sur la Toile, ils ont fortement évolué depuis les premiers outils (Excite, Webcrawler, Lycos, Altavista, etc.) jusqu'au leader actuel, Google et son challenger, Bing, que bien peu de concurrents arrivent à talonner pour l'instant. En tout état de cause, il est intéressant de se pencher sur le fonctionnement de ces outils et leur évolution au cours des années, car la connaissance de ce que l'on peut trouver « sous le capot des moteurs » peut également nous aider à mieux mener à bien nos recherches sur le Web…
MOTS-CLÉS
KEYWORDS
Robot | search engine | Google | Bing
VERSIONS
- Version archivée 1 de mai 2011 par Olivier ANDRIEU
- Version archivée 2 de mars 2017 par Olivier ANDRIEU
DOI (Digital Object Identifier)
CET ARTICLE SE TROUVE ÉGALEMENT DANS :
Accueil > Ressources documentaires > Technologies de l'information > Documents numériques Gestion de contenu > Usages et management stratégique des documents numériques > Moteurs de recherche web - Google, Bing et leurs challengers > Conclusion
Cet article fait partie de l’offre
Technologies logicielles Architectures des systèmes
(238 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive
Présentation
7. Conclusion
Entre les premiers moteurs de recherche apparus en 1993 et ceux d’aujourd’hui, les plus fortes évolutions ont eu lieu dans les algorithmes de pertinence, cherchant continûment à devenir de plus en plus performants et évoluant petit à petit vers des notions de « Web sémantique ». Google est certainement le moteur le plus assoiffé d’innovations sur ce point et il est le plus pertinent de tous les outils disponibles aujourd’hui sur la Toile. Alors, a-t-il aujourd’hui remporté la partie en ce qui concerne la recherche d’information sur le Web ? Peut-être pas totalement. En effet, une recherche d’information sur le Web s’effectue en trois phases :
-
Étape 1 : l’internaute a une recherche en tête. Son travail est alors, au vu de la façon dont fonctionnent les moteurs actuels, de trouver les mots-clés qui caractérisent le mieux possible sa quête ;
-
Étape 2 : après avoir saisi ces mots-clés dans un formulaire adéquat, l’utilisateur demande au moteur de trouver les pages qui correspondent à cette requête, les plus pertinentes parmi celles qu’il a indexées au préalable. Les algorithmes mathématiques des moteurs entrent alors en œuvre…
-
Étape 3 : le moteur restitue ces résultats selon une interface utilisateur dont le standard actuel est représenté par une liste de 10 liens placés linéairement, les uns au-dessous des autres.
En 2022, Google semble imbattable sur la phase 2 à partir du moment où on lui a fourni les bons mots-clés, donc où la phase 1 a été maîtrisée, ce qui est loin d’être facile, même pour des utilisateurs anciens du Web, avec beaucoup de pratiques derrière eux.
Un futur concurrent de Google devra au moins être au niveau du leader actuel en étape 2. En revanche, l’innovation se fera certainement en phases 1 et 3 dans les années qui viennent :
-
d’un côté, aider l’internaute à mieux formuler, dès le départ, sa recherche, à combler le chaînon manquant entre le cerveau de l’internaute et son clavier, voire à anticiper la demande de l’utilisateur ;
-
proposer une nouvelle interface utilisateur pour les pages de résultats qui n’ont pas énormément changé sur leur forme depuis bientôt 20 ans…
Google, aujourd’hui, est certainement « prisonnier » de sa représentation...
TEST DE VALIDATION ET CERTIFICATION CerT.I. :
Cet article vous permet de préparer une certification CerT.I.
Le test de validation des connaissances pour obtenir cette certification de Techniques de l’Ingénieur est disponible dans le module CerT.I.
de Techniques de l’Ingénieur ! Acheter le module
Cet article fait partie de l’offre
Technologies logicielles Architectures des systèmes
(238 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive
Conclusion
BIBLIOGRAPHIE
-
(1) - BRIN (S.), PAGE (L.) - The anatomy of a large-scale hypertextual web search engine. Computer networks and ISDN Systems. - https://snap.stanford.edu/class/cs224w-readings/Brin98Anatomy.pdf (1998).
-
(2) - FORD (D.), GRIMES (C.), TASSONE (E.) - Keeping a search engine index fresh: risk and optimality in estimating refresh rates for web pages. - Google https://static.googleusercontent.com/media/research.google.com/en//pubs/archive/34570.pdf
-
(3) - O’BRIEN (S.), GRIMES (C.) - Microscale evolution of web pages. - In WWW’08: Proceedings of the 17th International World Wide Web Conference (2008) https://www.researchgate.net/publication/221022492_Microscale_evolution_of_web_pages
-
(4) - GURMEET (S.M.), JAIN (A.), SARMA (A.D.) - Detecting near-duplicates for web crawling. - Stanford University. WWW 2007 - Track: Data Mining (2007) https://www2007.org/papers/paper215.pdf
-
(5) - NAJORK (M.), WIENER (J.L.) - Breadth-first search crawling yields high-quality pages. - Compaq WWW10 (2001) http://www.www10.org/cdrom/papers/208/.
- ...
DANS NOS BASES DOCUMENTAIRES
ANNEXES
Statistiques sur les motours de recherche dans le monde
La problématique de la mesure (et comparaison) des parts de marché des moteurs de recherche
Abondance
Secrets2Moteurs
https://www.secrets2moteurs.com/
Veille disponible sur http://www.seobythesea.com/
HAUT DE PAGE
SEO Campus et SEO Camp Days
https://www.seo-camp.org/agenda-des-evenements-seo-et-webmarketing/
SMX Paris
HAUT DE PAGEOrganismes – Fédérations – Associations (liste non exhaustive)
Seo Camp...
Cet article fait partie de l’offre
Technologies logicielles Architectures des systèmes
(238 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive
QUIZ ET TEST DE VALIDATION PRÉSENTS DANS CET ARTICLE
1/ Quiz d'entraînement
Entraînez vous autant que vous le voulez avec les quiz d'entraînement.
2/ Test de validation
Lorsque vous êtes prêt, vous passez le test de validation. Vous avez deux passages possibles dans un laps de temps de 30 jours.
Entre les deux essais, vous pouvez consulter l’article et réutiliser les quiz d'entraînement pour progresser. L’attestation vous est délivrée pour un score minimum de 70 %.
Cet article fait partie de l’offre
Technologies logicielles Architectures des systèmes
(238 articles en ce moment)
Cette offre vous donne accès à :
Une base complète d’articles
Actualisée et enrichie d’articles validés par nos comités scientifiques
Des services
Un ensemble d'outils exclusifs en complément des ressources
Un Parcours Pratique
Opérationnel et didactique, pour garantir l'acquisition des compétences transverses
Doc & Quiz
Des articles interactifs avec des quiz, pour une lecture constructive