Comme promis me voici de retour pour vous donner quelques informations sur les avancées de IBOU en ce début d’année 2026.
L’équipe travaille dur sur tous les sujets : l’explorer, le search et bien d’autres choses encore, mais aujourd’hui je vais me concentrer sur un point particulier du search.
IBOU c’est un moteur de recherche avant tout, et nous n’avions encore jamais abordé ce point ici : comment est-il possible de classer des pages à très grande échelle quand on part de zéro ? Et est-ce qu’il est possible d’avoir un bon moteur dès le début dans ce cas ?
Il y a quelques années j’aurais répondu que c’était difficilement possible et que le seul moyen aurait été de commencer par déployer un moteur médiocre qui se serait ensuite amélioré, ensuite voulant dire “si la traction est au RDV”. Mais le monde a changé ! Et ce changement sans surprise c’est l’apparition des grands modèles de langues.
Bref, je vais vous parler de Mimesis, notre algo de ranking !
Retrieval et ranking (récupération et classement) : ce qu’il faut savoir
En premier je vais clarifier certains termes. Un moteur de recherche fait plusieurs tâches : il crawle le web, il indexe ou pas les contenus qu’il trouve, puis ensuite il comprend l’humain qui tape une requête, puis il récupère les informations potentiellement capables de répondre à cette requête, puis il classe (priorise) ces informations, puis il répond…
Dis comme ça c’est un peu abstrait, mais il y a deux tâches qui sont souvent confondus et qui sont très différentes : la récupération (retrieval) et le classement (ranking). Pour faire passer l’idée je vais faire une analogie. Vous avez un index : une énorme bibliothèque avec plusieurs centaines de milliers de livres.
Vous vous poser une question : “est-ce qu’une loutre mange beaucoup dans une journée ?”. Vous demandez au bibliothécaire de vous ramener les livres qui parlent des loutres, il en ramène 100, c’est le retrieval. Vous regardez chaque livre, écartez ceux pas en français, ceux trop vieux, ceux qui sont visiblement de la promo pour un parc animalier, etc. Et les 10 ou 20 qui restent vous les classez selon l’autorité des éditeurs et la popularité des auteurs. Vous venez de faire du ranking, et vous allez commencer par lire le premier livre de la liste que vous venez de fabriquer.
Intuitivement vous comprenez que ces deux tâches sont différentes, et elles visent des objectifs différents. Le retrieval veut maximiser le rappel, c’est-à-dire récupérer tout ce qui pourrait contribuer à la réponse, tandis que le ranking maximise la précision, c’est-à-dire garantir d’avoir la meilleure réponse dans les premiers résultats.
Chez IBOU, on construit de manière très efficace un très gros index le plus propre possible, et on a bien sûr des algos pour le retrieval (une combinaison de techniques lexicales et sémantiques dont on parlera un autre jour). Mais aujourd’hui, on vous parle de Mimesis : notre système de ranking.
Le ranking “moderne” : la data utilisateur comme oracle de vérité
Les stars du search (Google, Bing, etc.) ont un avantage compétitif grâce à la donnée comportemental captée sur des milliards d’utilisateurs. Je vais prendre l’exemple de Google, documenté depuis le procès pour antitrust.
Quand un utilisateur clique sur un résultat, y passe du temps, et ne revient pas sur le moteur, Google comprend que ce résultat était bon. Si au contraire l'utilisateur clique, revient vite et reformule, Google comprend que ce résultat est décevant. Grâce à cela, Google peut faire du learning-to-rank. Le learning-to-rank fait partie des algos qui apprennent à classer en observant ce qui marche. Google fait d'abord un ranking initial, puis un reranking qui ajuste l'ordre selon les signaux comportementaux.
La captation est assurée par la brique NavBoost, qui mémorise 13 mois de clics et analyse en continu les interactions : good clicks, bad clicks, last longest clicks, etc. On parle d'environ 100 milliards de clics au total. Lors du procès, Google a admis que retirer NavBoost avait un "impact négatif significatif" sur la qualité des résultats.
Learning-to-rank et reranking sont les secrets de Polichinelle d’un moteur de qualité. Mais comment faire quand on démarre de zéro, sans ces milliards de clics ? C'est là qu'intervient Mimesis.
L’intuition derrière Mimesis : imiter l’expert humain
Quand un humain évalue des documents pour savoir si ils répondent à une question, il ne se contente pas de vérifier si des mots-clés sont présents ou si un critère technique est vérifié. Il fait un travail subtil, rendu possible par son intelligence ^^
Il jauge la légitimité de la source : “Tiens, celui-là vient du site de l’INRAE, c’est une référence en agronomie. Celui-ci vient de blog-jardinage-courgettes-rapides-2026.com créé il y a 3 mois... je suis plus sceptique.”
Il évalue l’expertise : “L’auteur cite des études, il donne des références scientifiques, il nuance son propos. OK, il sait de quoi il parle. À côté, cet article balance des conseils péremptoires sans aucune source... poubelle.”
Il adapte ses critères au contexte : “Là c’est un sujet de jardinage, je peux être souple. Mais si c’est un conseil médical que je cherche, je suis plus exigeant sur la fiabilité de la source.”
Il détecte les patterns suspects : “Hmm, cet article sent le chatGPT de base. Les phrases sont creuses, aucune expérience concrète, juste du remplissage de mots-clés.”
Il mesure la complétude : “Celui-ci répond à ma question, mais superficiellement. Celui-là va plus loin, il anticipe mes questions suivantes.”
Il aime le contenu : “Je ne sais pas pourquoi, est-ce la poésie des mots ? mais ça me plait.”
Tout ça, un humain le fait en quelques secondes, de manière quasi-inconsciente. C’est le résultat de millions d’années d’évolution qui nous ont appris à évaluer rapidement la fiabilité d’une information et de sa source.
Mimesis essaie de faire la même chose. Automatiquement. Sur des centaines de millions de documents.
Comment on apprend à Mimesis à imiter l’humain
Pour qu’un système de learning-to-rank fonctionne, il faut lui montrer des exemples de requêtes associées à des bons et mauvais résultats. On appelle ça la ground truth (vérité terrain).
Google a ses milliards de clics pour créer cette vérité terrain. Nous, on a fait autrement : on utilise des LLMs comme juges. Oui, vous avez bien lu. On utilise l’IA pour entraîner l’IA. C’est ce qu’on appelle le LLM-as-a-Judge.
Cette approche nous permet de traiter des volumes invraisemblables en quelques heures, là où des annotateurs humains mettraient des semaines.
Mais attention : Les LLMs ont beau avoir encapsulé une grande partie de ce qui fait le jugement humain, ils sont très loin d’être parfaits. Ils peuvent avoir des biais (surpondération de la longueur du texte, sensibilité au style). Ces biais se propagent à Mimesis : par exemple si le processus surestime les textes longs, Mimesis apprendra à privilégier la longueur. C’est pour ça qu’à terme, on passera à un processus HITL (Human-in-the-Loop) où des annotateurs humains valideront et corrigeront un échantillon des annotations (offline ou en utilisation réelle, on ne sait pas encore).
Mais pour l’instant, le LLM-as-a-Judge nous permet de bootstrapper le système. Et ça marche.
Une fois qu'on a ces centaines de milliers d'exemples annotés, Mimesis peut apprendre. On a choisi une architecture de prédiction qui garantit : vitesse d'exécution, explicabilité (on doit comprendre chaque décision prise par l’algorithme), sobriété énergétique (pas besoin de GPUs énormes), et stabilité des résultats (pas de mauvaises surprises entre deux itérations).
Mimesis apprend progressivement des règles contextuelles, non-linéaires. Ces règles utilisent actuellement près de 100 signaux sur chaque document candidat. On ne va pas tout révéler (il faut bien garder quelques secrets), mais voici quelques exemples.
Signaux d’autorité : la version IBOU du BAS, la diversité du réseau de backlinks (nombre d’IP et d’AS distincts), la trust value, etc.
Signaux d’expertise : la qualité éditoriale, la présence de sources, les scores divers que la plupart des gens connaissent sous le nom de EEAT.
Signaux de risque : c’est un des plus importants. Un article sur “quelle est la capitale de la France” peut se permettre une erreur sans conséquence grave. Un article qui donne des conseils médicaux, non. On calcule plusieurs scores de risque et on adapte nos exigences.
Signaux sémantiques : le contenu répond-il à la question ? On utilise conjointement des approches lexicales standard et des modèles neuronaux qui comparent directement requête et document.
Signaux éditoriaux : le contenu est-il bien écrit ? Ou est-ce du chatGPT prompté en 30 secondes ? Quel est l’effort mis pour réalisé le contenu.
Signaux d’engagement potentiel : comme par exemple un score qui estime si le contenu va plaire.
Les résultats
On a testé Mimesis sur deux dimensions : la qualité des résultats, et la cohérence du classement global. Voici quelques insights (on ne montre quand même pas tout ;)).
Commençons par la cohérence. Pour la mesurer nous avons une métrique dédiée : le streak. C’est le nombre de résultats pertinents consécutifs visibles avant de tomber sur un mauvais. Plus le streak est haut plus l’expérience utilisateur est fluide et satisfaisante (pas de coupure dans la qualité).
Mimesis affiche un Streak 22% supérieur à toutes les autres approches testées.
Ensuite, regardons les résultats en eux-mêmes. Sur les requêtes les plus critiques (type YMYL par exemple), Mimesis a de très bons résultats face à la baseline de test.
+21% de précision sur le premier résultat
+37% sur les 3 premiers résultats (plus de qualité)
+43% de bons résultats trouvés en plus dans le top 3 (plus de diversité)
Attention, c’est une comparaison face à une baseline, pas encore face à d’autres moteurs de recherche.
Affaire à suivre !
Je voulais vous faire part de nos avancées, parce que la transparence fait partie des valeurs que nous avons mis dans notre manifeste. Avec Mimesis, on prouve qu’on peut faire du ranking de qualité sans milliards d’utilisateurs et que notre projet a du sens.
On ne prétend pas égaler les grands acteurs dès le premier jour. Mais on veut proposer quelque chose de différent et de fiable. Et ce sera déjà pas mal (et nécessaire dans le contexte geopolitique actuel).
Je vous dit à bientôt pour de nouveaux articles sur la suite de l’aventure !



"Lors du procès, Google a admis que retirer NavBoost avait un "impact négatif significatif" sur la qualité des résultats."
C'est intéressant, parce que ça repose la question du pacte avec le diable (pour simplifier). Assez similaire à mon sens avec la question de la liberté/sécurité.
"C’est le résultat de millions d’années d’évolution qui nous ont appris à évaluer rapidement la fiabilité d’une information et de sa source." Je comprends l'explication, mais peut-on encore soutenir une telle phrase en pleine ère de post-vérité ?
"sobriété énergétique" Probablement un de vos atouts les plus précieux dans la course à l'armement (cf : notre conversation d'il y a quelques jours)
" le contenu est-il bien écrit ? Ou est-ce du chatGPT prompté en 30 secondes ?" C'est intéressant, tu réponds à la question de la place des contenus générés par IA avec la nuance que tu apportes.
"et nécessaire dans le contexte geopolitique actuel" On se sait.
J'ajoute un petit point personnel "expertise" : le naming de votre algo est vraiment intelligent. Outre sa transparence, il permet de rappeler d'où part l'inspiration première (bien que, je le redis, je te trouve très généreux avec l'espèce humaine moderne). C'est un paradigme bien différent des autres compétiteurs.
Bravo à toute l'équipe, hâte de voir ibou prendre son envol !