2024-08-17

Ce matin, j’ai enfin pris le temps de parcourir attentivement la documentation d’Elasticsearch pour comparer ses fonctionnalités à celles de Meilisearch, Typesense et pg_search.

J’ai lu Text analysis overview de Elasticsearch.

Je note ici les étapes de l’Text analysis que j’ai des difficultés à retenir :

J’ai parcouru la liste des différents types des Built-in analyzer reference de Elasticsearch.

Je retiens le concept de stop analyzer.

JeMeDemande l’usage du Keyword analyzer 🤔.

Je trouve le Pattern analyzer intéressant.

En lisant Fingerprint analyzer je découvre l’algorithme fingerprinting décrit dans la documentation de OpenRefine : https://openrefine.org/docs/technical-reference/clustering-in-depth#fingerprint. Je garde cela dans un coin de mon esprit, il se peut que cela me soit utile à l’avenir 🤔.

Je découvre que Elasticsearch (sans doute Lucene 🤔) propose beauoup de token filtering différent qui peuvent être combinés : Apostrophe, ASCII folding, CJK bigram, CJK width, Classic, Common grams, Conditional, Decimal digit, Delimited payload, Dictionary decompounder, Edge n-gram, Elision, Fingerprint, Flatten graph, Hunspell, Hyphenation decompounder, Keep types, Keep words, Keyword marker, Keyword repeat, KStem, Length, Limit token count, Lowercase, MinHash, Multiplexer, N-gram, Normalization, Pattern capture, Pattern replace, Phonetic, Porter stem, Predicate script, Remove duplicates, Reverse, Shingle, Snowball, Stemmer, Stemmer override, Stop, Synonym, Synonym graph, Trim, Truncate, Unique, Uppercase, Word delimiter, Word delimiter graph.

J’ai lu Stemmer token filter que je considère comme très important pour un moteur de recherche efficace.

JaiDécouvert le support de Synonym graph token filter.

Je lis HTML strip character filter, fonctionnalité que je juge très utile.

Je lis qu’Elasticsearch propose de nombreuses méthodes de query, entre autres :

Tout cela est très riche !

J’ai lu Highlighting

JeMeDemande comment Elasticsearch gère le support Highlighting (search-engine) avec du contenu qui intègre initialement des balises HTML 🤔.

J’ai trouvé la réponse dans cet article Elastic Search: Highlighting Text That Contains HTML Tags.

notes.sklein.xyz

Notes éphémères

2024-09-17_1707

2024-09-16_1754

2024-09-15_1518

2024-09-15_1038

2024-09-14_2253

Projets

Projet 13 - "POC Elasticsearch sur un PKM"

Je cherche à convertir en SQL des query de filtre basé sur un système de "tags"

Projet 12 - "Implémentation nodemailer-scaleway-transport"

Projet 11 - "Première version d'un moteur web PKM"

Projet 10 - "Mettre en oeuvre DotTXT AI"

2024-08-17_1253

Vue Graphique

Liens retour