SEO / information retrieval15 min czytania

Latent Semantic Indexing (LSI) w SEO - co to jest i jak działa?

LSI jest metodą wyszukiwania informacji, która redukuje macierz termin-dokument za pomocą SVD i porównuje zapytania z dokumentami w powstałej przestrzeni. Oryginalny model definiuje reprezentacje matematyczne i ranking podobieństwa; „LSI keywords” to późniejsza etykieta branżowa dla powiązanych fraz.

Schemat działania LSI: macierz termin-dokument, redukcja SVD, zredukowana przestrzeń i ranking dokumentów
00 / KRÓTKA ODPOWIEDŹ

Czy LSI ma znaczenie w SEO?

Latent Semantic Indexing (LSI) ma znaczenie jako historyczna i techniczna metoda information retrieval. System analizuje rozkład terminów w zbiorze dokumentów, kompresuje te zależności za pomocą singular value decomposition (SVD), a potem porównuje zapytanie z dokumentami w zredukowanej przestrzeni.

Dla współczesnego SEO kluczowe są dwa wnioski. Publiczne źródła nie potwierdzają używania klasycznego LSI jako systemu rankingowego Google, a oryginalna metoda nie tworzy listy „LSI keywords” do obowiązkowego umieszczania w tekście. Wynik narzędzia opisanego tą nazwą wymaga więc weryfikacji przed wdrożeniem.

01 / DEFINICJA

Czym jest Latent Semantic Indexing?

Latent Semantic Indexing (LSI) to metoda wyszukiwania informacji oparta na statystycznych wzorcach użycia terminów w korpusie dokumentów. LSI tworzy macierz termin-dokument, redukuje jej liczbę wymiarów za pomocą SVD, a następnie odwzorowuje terminy, dokumenty i zapytania w zredukowanej przestrzeni nazywanej przestrzenią latentną.

Jaki problem miało rozwiązać LSI?

LSI opracowano, aby ograniczyć skutki niedopasowania słownictwa. Autor zapytania i autor trafnego dokumentu mogą użyć różnych słów, a ten sam termin może mieć kilka znaczeń. Analiza wzorców w całym korpusie pomaga odzyskać część trafnych materiałów pomijanych przez proste dopasowanie wyrazów i ograniczyć udział materiałów przypadkowych.

Metoda opisana w patencie złożonym w 1988 roku i w publikacji „Indexing by Latent Semantic Analysis” z 1990 roku zakłada, że za obserwowanym użyciem słów istnieje ukryta struktura. Można ją oszacować statystycznie na podstawie tego, które terminy pojawiają się w których dokumentach. Słowo latent oznacza tutaj strukturę ukrytą w danych. Metoda nie korzysta z ręcznie zdefiniowanej ontologii.

Definicja techniczna

LSI opisuje reprezentację korpusu i procedurę retrieval

Dokumenty i terminy otrzymują pozycje w przestrzeni o mniejszej liczbie wymiarów. Bliskość oznacza podobny wzorzec użycia w analizowanym zbiorze, dzięki czemu zapytanie może wskazać dokument bez pełnej zgodności słów.

Wynik metody

LSI zwraca reprezentacje matematyczne oraz ranking podobieństwa. Dobór redakcyjnego słownictwa, rozpoznawanie encji i ustalanie zakresu ich opisu wymagają innych metod.

LSI a LSA - dlaczego dwie nazwy?

Latent Semantic Analysis (LSA) podkreśla analizę ukrytej struktury. Latent Semantic Indexing opisuje zastosowanie tego samego rdzenia matematycznego do indeksowania i wyszukiwania. Literatura używa obu skrótów w zbliżonym znaczeniu, ponieważ różnica dotyczy akcentu: analizy struktury w LSA oraz jej zastosowania w information retrieval w LSI.

02 / MECHANIZM

Jak działa LSI krok po kroku?

Mechanizm zaczyna się od zamkniętego korpusu, czyli konkretnego zbioru dokumentów. Dopiero relacje obserwowane w tym zbiorze tworzą przestrzeń, w której zostaną porównane terminy, dokumenty i późniejsze zapytanie.

Mechanizm LSI

Od tekstów do dokumentów uporządkowanych według podobieństwa

Redukcja nie nadaje tematom nazw. Zachowuje dominujące wzorce współwystępowania i osłabia drobne różnice traktowane jako szum.

  1. KorpusPrzygotowanie terminów i dokumentów
    Teksty są dzielone na terminy. Wariant metody może usuwać częste słowa, sprowadzać formy fleksyjne do wspólnej postaci i ważyć terminy.
  2. MacierzZapis relacji termin–dokument
    Wiersz odpowiada terminowi, kolumna dokumentowi, a komórka opisuje wystąpienie lub wagę terminu. Powstaje statystyczny obraz całego korpusu.
  3. SVDRozkład i redukcja wymiarów
    Singular value decomposition rozkłada macierz na składowe. System zachowuje wybraną liczbę najsilniejszych wymiarów i tworzy przybliżenie danych.
  4. PrzestrzeńUmieszczenie terminów i dokumentów
    Dokumenty opisane innymi słowami mogą znaleźć się blisko, gdy ich terminy uczestniczą w podobnych wzorcach w całym zbiorze.
  5. ZapytanieOdwzorowanie i porównanie
    Zapytanie jest przetwarzane do wektora w tej samej przestrzeni. Podobieństwo cosinusowe ocenia kąt między wektorem zapytania i dokumentu.
Rezultat

Rezultatem jest matematyczna reprezentacja terminów i dokumentów oraz lista dokumentów uporządkowana według podobieństwa do zapytania w zredukowanej przestrzeni.

03 / PRZYKŁAD

Jak działa LSI krok po kroku na przykładzie?

Deerwester i współautorzy użyli dziewięciu tytułów memorandów technicznych: pięciu o interakcji człowieka z komputerem (c1-c5) oraz czterech o teorii grafów (m1-m4). Dla zapytania „human computer interaction” dopasowanie wspólnych słów zwracało c1, c2 i c4. Trafne dokumenty c3 i c5 nie zawierały żadnego terminu z zapytania, dlatego proste dopasowanie je pomijało.

Dlaczego LSI odnajduje dokumenty c3 i c5?

Zapytaniehuman computer interaction

Wspólne słowa prowadzą bezpośrednio do c1, c2 i c4.

Most w korpusiePowtarzające się terminy
userinterfacesystemresponsetimeEPS

C1, c2 i c4 łączą słowa zapytania z terminami obecnymi także w c3 i c5.

Odzyskane dokumentyc3: The EPS user interface management systemc5: Relation of user-perceived response time to error measurement

Oba tytuły mają 0 wspólnych terminów z zapytaniem.

Poza sąsiedztwem zapytania

Dokumenty m1-m4 tworzą osobny wzorzec oparty na terminach „graph”, „trees” i „minors”, dlatego pozostają poza wynikiem.

Uproszczony przebieg przykładu z publikacji o LSA
EtapObserwacjaZnaczenie dla wyniku
1. KorpusDo indeksu trafia 12 terminów występujących w więcej niż jednym z dziewięciu tytułów.Pięć dokumentów opisuje interakcję człowiek-komputer, a cztery teorię grafów.
2. Macierz 12 × 9Wiersz oznacza termin, kolumna dokument, a komórka liczbę wystąpień terminu w tytule.Macierz zapisuje bezpośrednie oraz pośrednie ścieżki łączące słownictwo całego korpusu.
3. Redukcja SVDNa potrzeby przykładu macierz zostaje odwzorowana w dwóch wymiarach.Dokumenty c1-c5 tworzą skupienie odrębne od dokumentów m1-m4 o grafach i drzewach.
4. ZapytanieTerminy „human” i „computer” wyznaczają pozycję pseudodokumentu reprezentującego zapytanie.Wektor zapytania można porównać ze wszystkimi dokumentami w tej samej przestrzeni.
5. RankingPróg podobieństwa cosinusowego 0,9 obejmuje dokumenty c1-c5 i pomija dokumenty m1-m4.C3 i c5 trafiają do wyniku dzięki wzorcowi całego korpusu, mimo że nie zawierają słów zapytania.

Dokumenty c3 i c5 zyskują wysokie podobieństwo przez pośrednie relacje. Terminy „user”, „interface”, „system”, „response” i „time” łączą ich słownictwo z pozostałymi tytułami o interakcji człowieka z komputerem. SVD zachowuje dominującą strukturę tych zależności w zredukowanej przestrzeni.

04 / MOŻLIWOŚCI I GRANICE

Co LSI potrafi, a czego nie widzi?

Nazwa „semantic” może sugerować pełne rozumienie języka. W LSI semantyka jest wnioskowana z rozkładu terminów. Metoda nie posiada wiedzy o świecie niezależnej od korpusu, a jej reprezentacja zwykle zachowuje cechy modelu bag-of-words.

Możliwości LSI i warunki interpretacji wyniku
WłaściwośćCo umożliwiaGdzie przebiega granica
Relacje z danychLSI wykrywa powtarzalne wzorce współwystępowania terminów w całym korpusie.Bliskość w przestrzeni jest oszacowaniem statystycznym. Nie stanowi faktu o świecie ani relacji zapisanej w grafie wiedzy.
Redukcja wymiarówSVD zachowuje najsilniejsze struktury i wygładza część lokalnych różnic w słownictwie.Zbyt mała liczba wymiarów usuwa użyteczne różnice, a zbyt duża ponownie uwzględnia szum. Dobór jest empiryczny.
SynonimiaDokument może zostać odnaleziony mimo braku dokładnych słów zapytania, jeśli łączą go z nimi wzorce w korpusie.Efekt zależy od danych. Metoda nie korzysta z wbudowanego słownika wszystkich synonimów.
WieloznacznośćKontekst korpusu może częściowo ograniczyć błędy powodowane przez słowo używane w kilku znaczeniach.Jedna uśredniona reprezentacja terminu może mieszać znaczenia. Szyk zdań i pełna składnia zwykle pozostają poza modelem bag-of-words.
Aktualizacja korpusuZnane zapytanie można odwzorować w już zbudowanej przestrzeni i porównać z dokumentami.Nowe słownictwo i duże zmiany zbioru wymagają aktualizacji modelu, ponownego obliczenia albo technik przyrostowych.

Rolę tego rozróżnienia w codziennej pracy nad treścią - obok intencji, encji i relacji - pokazuje artykuł o tym, czym jest SEO semantyczne.

05 / MIT SEO

Skąd wzięły się „LSI keywords”?

Branża SEO zaczęła używać tej nazwy dla synonimów, terminów współwystępujących i wyrażeń związanych z tematem. Etykieta połączyła prawdziwą metodę naukową z praktyką wzbogacania słownictwa strony. Problem polega na zmianie jednostki: LSI przetwarza cały korpus i zwraca relacje w przestrzeni, a narzędzie SEO zwykle zwraca gotową listę wyrażeń.

Trzy różne pojęcia

LSI, „LSI keywords” i słownictwo semantyczne

LSI, „LSI keywords” i słownictwo semantyczne
KryteriumLSI jako metoda„LSI keywords”Słownictwo semantyczne
Punkt wyjściakorpus dokumentów i rozkład terminów w tym korpusiewyniki Google, strony konkurencji, autocomplete lub baza narzędziarola URL-a, intencja odbiorcy oraz wiedza o opisywanej dziedzinie
Jednostka analizymacierz termin–dokument przekształcana matematycznielista wyrażeń uznanych przez dostawcę za powiązaneencje, atrybuty, procesy, relacje i pytania potrzebne w dokumencie
Rezultatwspółrzędne terminów, dokumentów i zapytania w zredukowanej przestrzenifrazy wraz z wolumenem, wagą, wynikiem podobieństwa lub zalecaną liczbą użyćtwierdzenia i sekcje odpowiadające na właściwy podproblem
Standard definicjiopis metody, SVD i procedury retrieval w literaturze naukowejbrak jednej definicji; wynik zależy od narzędziajawne kryteria trafności, prawdziwości i przynależności do intencji
Wspólny fundament

Wszystkie trzy obszary dotyczą zależności między językiem i tematem. Różnią je dane wejściowe, procedura oraz rodzaj wyniku, dlatego nazw nie należy stosować zamiennie.

Sama etykieta nie ujawnia metodologii narzędzia. Lista może pochodzić z analizy stron konkurencji, podobnych wyszukiwań, n-gramów, embeddingów albo własnego słownika. Każde z tych źródeł może dostarczyć użytecznych kandydatów, lecz kandydat potrzebuje jeszcze sprawdzenia relacji z intencją i roli w dokumencie.

Sposób budowania takich relacji opisujemy osobno w poradniku o tym, czym są i jak dobierać słowa kluczowe semantyczne. Ten artykuł pozostaje przy mechanizmie LSI i poprawnej interpretacji nazwy.

06 / GOOGLE I PEWNOŚĆ

Czy Google używa LSI?

Publicznie dostępne źródła nie potwierdzają, że Google używa klasycznego Latent Semantic Indexing jako systemu rankingowego. Pełna architektura wyszukiwarki pozostaje niepubliczna, dlatego zakres wniosku wyznaczają systemy i mechanizmy ujawnione przez Google.

Poziomy pewności w odpowiedzi na pytanie o Google i LSI
PoziomCo wiadomoUprawniony wniosek
Potwierdzone źródłowoLSI jest rzeczywistą metodą information retrieval opisaną w patencie z 1989 roku i publikacji Deerwestera i współautorów z 1990 roku. Publikacja Deerwestera i współautorów.Można precyzyjnie opisać jej dane wejściowe, SVD i sposób porównywania zapytania z dokumentami.
Publicznie udokumentowane przez GooglePrzewodnik po systemach rankingowych opisuje między innymi BERT, neural matching i RankBrain. Nie przedstawia klasycznego LSI jako systemu rankingowego. Przewodnik Google po systemach rankingowych.Brak tej nazwy w dokumentacji nie ujawnia kompletnej architektury, ale nie daje podstaw do sprzedawania optymalizacji pod LSI.
Publiczna korekta terminuJohn Mueller z Google napisał w 2019 roku: „There's no such thing as LSI keywords”. Wypowiedź Johna Muellera z 2019 roku.Wypowiedź dotyczy branżowej kategorii „LSI keywords”, a nie wszystkich matematycznych technik podobieństwa używanych w wyszukiwaniu.
NieujawnioneGoogle nie publikuje kompletnego kodu, wszystkich cech ani pełnej architektury swoich systemów retrieval i rankingowych.Kategoryczne twierdzenie o każdym wewnętrznym komponencie wykraczałoby poza dostępne dowody.

Współczesne wyszukiwanie Google wykorzystuje wiele systemów do rozumienia języka i dopasowania dokumentów. Opisywanie ich wspólną nazwą LSI zaciera różnice między metodami. Mechanizmy i publicznie nazwane systemy omawia osobny artykuł o tym, jak działa wyszukiwanie semantyczne.

07 / DECYZJA REDAKCYJNA

Jak przełożyć brief LSI na sensowne zadanie?

Polecenie zawierające „LSI keywords” trzeba przełożyć na jawne pytanie o metodę, relację pojęcia i rolę URL-a. Taka instrukcja może wskazywać, że w treści brakuje ważnego słownictwa albo że dostawca chce porównać dokument z konkurencją. Dopiero rozpoznanie źródła listy pozwala podjąć właściwą decyzję redakcyjną.

Tłumaczenie typowych poleceń z briefu LSI
PoleceniePytanie kontrolneDecyzja
Dodaj wszystkie LSI keywords z narzędziaJak narzędzie utworzyło listę i które pojęcia odpowiadają roli tego URL-a?Zachowaj elementy, które pozwalają napisać potrzebne i prawdziwe twierdzenie. Pozostałe odrzuć albo przypisz do innego URL-a.
Podnieś wynik LSI do 80%Co mierzy wynik: podobieństwo do konkurencji, pokrycie terminów, embedding czy własną formułę dostawcy?Traktuj wynik jako sygnał diagnostyczny. Sprawdź brakujące relacje ręcznie i nie uznawaj progu za wymóg Google.
Powtórz każdą frazę określoną liczbę razyCzy kolejne użycie wnosi nową informację lub zwiększa jednoznaczność zdania?Użyj naturalnej nazwy tam, gdzie jest potrzebna. Usuń powtórzenia powstałe wyłącznie dla gęstości.
Znajdź synonimy przez LSICzy potrzebujemy wariantu tej samej nazwy, czy pojęcia pozostającego w innej relacji z tematem?Nazwij typ relacji. Synonim, część, atrybut, przyczyna i skutek pełnią w treści różne funkcje.
08 / FAQ

Najczęstsze pytania o Latent Semantic Indexing

01Co to jest Latent Semantic Indexing (LSI)?

Latent Semantic Indexing to metoda wyszukiwania informacji, która buduje macierz termin–dokument, redukuje jej liczbę wymiarów za pomocą singular value decomposition i porównuje dokumenty oraz zapytania w powstałej przestrzeni. Dzięki wzorcom użycia słów może znaleźć dokument związany z zapytaniem mimo braku pełnego dopasowania wyrazów.

02Czy LSI keywords istnieją?

„LSI keywords” istnieją jako popularna etykieta marketingowa, lecz oryginalna metoda LSI nie definiuje specjalnej listy słów do umieszczania na stronie. Narzędzia pod tą nazwą mogą zwracać synonimy, frazy współwystępujące lub terminy z wyników wyszukiwania, a sposób ich wyboru zależy od dostawcy.

03Czy Google używa LSI?

Nie ma wiarygodnej publicznej dokumentacji potwierdzającej, że klasyczne LSI jest systemem rankingowym Google. Google opisuje inne systemy rozumienia języka i dopasowania, a John Mueller odrzucił pojęcie „LSI keywords”. Pełna wewnętrzna architektura wyszukiwarki pozostaje niepubliczna.

04Czy LSI i LSA oznaczają to samo?

Oba skróty odnoszą się do tego samego rdzenia matematycznego opartego na macierzy termin–dokument i redukcji SVD. LSA podkreśla analizę ukrytej struktury semantycznej, a LSI jej zastosowanie do indeksowania i wyszukiwania informacji. W publikacjach nazwy bywają używane zamiennie.

05Czy słowa LSI i słowa kluczowe semantyczne to to samo?

Nie. „Słowa LSI” nie są kategorią z oryginalnej metody. Słowa kluczowe semantyczne to redakcyjne określenie pojęć powiązanych z tematem przez konkretną relację, na przykład encji, atrybutów, procesów i pytań. Ich przydatność ocenia się w kontekście roli strony.

06Czy LSI jest dziś bezużyteczne?

Nie. LSI pozostaje ważną metodą historyczną i może być stosowane w wyszukiwaniu, klasyfikacji lub grupowaniu stabilnych kolekcji dokumentów. Błędne jest przypisywanie mu specjalnej kategorii fraz SEO lub statusu potwierdzonego algorytmu rankingowego Google.

Źródła pierwotne i dalsza lektura

Następny krok

Czy brief SEO mierzy znaczenie, czy tylko zgodność z listą?

Sprawdzimy intencję, źródła rekomendacji, encje, relacje i rolę URL-a. Otrzymasz priorytety zmian wraz z uzasadnieniem i wyjaśnieniem zastosowanej metodologii.

Zamów bezpłatną wycenę SEO