Czy LSI ma znaczenie w SEO?
Latent Semantic Indexing (LSI) ma znaczenie jako historyczna i techniczna metoda information retrieval. System analizuje rozkład terminów w zbiorze dokumentów, kompresuje te zależności za pomocą singular value decomposition (SVD), a potem porównuje zapytanie z dokumentami w zredukowanej przestrzeni.
Dla współczesnego SEO kluczowe są dwa wnioski. Publiczne źródła nie potwierdzają używania klasycznego LSI jako systemu rankingowego Google, a oryginalna metoda nie tworzy listy „LSI keywords” do obowiązkowego umieszczania w tekście. Wynik narzędzia opisanego tą nazwą wymaga więc weryfikacji przed wdrożeniem.
Czym jest Latent Semantic Indexing?
Latent Semantic Indexing (LSI) to metoda wyszukiwania informacji oparta na statystycznych wzorcach użycia terminów w korpusie dokumentów. LSI tworzy macierz termin-dokument, redukuje jej liczbę wymiarów za pomocą SVD, a następnie odwzorowuje terminy, dokumenty i zapytania w zredukowanej przestrzeni nazywanej przestrzenią latentną.
Jaki problem miało rozwiązać LSI?
LSI opracowano, aby ograniczyć skutki niedopasowania słownictwa. Autor zapytania i autor trafnego dokumentu mogą użyć różnych słów, a ten sam termin może mieć kilka znaczeń. Analiza wzorców w całym korpusie pomaga odzyskać część trafnych materiałów pomijanych przez proste dopasowanie wyrazów i ograniczyć udział materiałów przypadkowych.
Metoda opisana w patencie złożonym w 1988 roku i w publikacji „Indexing by Latent Semantic Analysis” z 1990 roku zakłada, że za obserwowanym użyciem słów istnieje ukryta struktura. Można ją oszacować statystycznie na podstawie tego, które terminy pojawiają się w których dokumentach. Słowo latent oznacza tutaj strukturę ukrytą w danych. Metoda nie korzysta z ręcznie zdefiniowanej ontologii.
LSI opisuje reprezentację korpusu i procedurę retrieval
Dokumenty i terminy otrzymują pozycje w przestrzeni o mniejszej liczbie wymiarów. Bliskość oznacza podobny wzorzec użycia w analizowanym zbiorze, dzięki czemu zapytanie może wskazać dokument bez pełnej zgodności słów.
LSI zwraca reprezentacje matematyczne oraz ranking podobieństwa. Dobór redakcyjnego słownictwa, rozpoznawanie encji i ustalanie zakresu ich opisu wymagają innych metod.
LSI a LSA - dlaczego dwie nazwy?
Latent Semantic Analysis (LSA) podkreśla analizę ukrytej struktury. Latent Semantic Indexing opisuje zastosowanie tego samego rdzenia matematycznego do indeksowania i wyszukiwania. Literatura używa obu skrótów w zbliżonym znaczeniu, ponieważ różnica dotyczy akcentu: analizy struktury w LSA oraz jej zastosowania w information retrieval w LSI.
Jak działa LSI krok po kroku?
Mechanizm zaczyna się od zamkniętego korpusu, czyli konkretnego zbioru dokumentów. Dopiero relacje obserwowane w tym zbiorze tworzą przestrzeń, w której zostaną porównane terminy, dokumenty i późniejsze zapytanie.
Od tekstów do dokumentów uporządkowanych według podobieństwa
Redukcja nie nadaje tematom nazw. Zachowuje dominujące wzorce współwystępowania i osłabia drobne różnice traktowane jako szum.
- KorpusPrzygotowanie terminów i dokumentówTeksty są dzielone na terminy. Wariant metody może usuwać częste słowa, sprowadzać formy fleksyjne do wspólnej postaci i ważyć terminy.
- MacierzZapis relacji termin–dokumentWiersz odpowiada terminowi, kolumna dokumentowi, a komórka opisuje wystąpienie lub wagę terminu. Powstaje statystyczny obraz całego korpusu.
- SVDRozkład i redukcja wymiarówSingular value decomposition rozkłada macierz na składowe. System zachowuje wybraną liczbę najsilniejszych wymiarów i tworzy przybliżenie danych.
- PrzestrzeńUmieszczenie terminów i dokumentówDokumenty opisane innymi słowami mogą znaleźć się blisko, gdy ich terminy uczestniczą w podobnych wzorcach w całym zbiorze.
- ZapytanieOdwzorowanie i porównanieZapytanie jest przetwarzane do wektora w tej samej przestrzeni. Podobieństwo cosinusowe ocenia kąt między wektorem zapytania i dokumentu.
Rezultatem jest matematyczna reprezentacja terminów i dokumentów oraz lista dokumentów uporządkowana według podobieństwa do zapytania w zredukowanej przestrzeni.
Jak działa LSI krok po kroku na przykładzie?
Deerwester i współautorzy użyli dziewięciu tytułów memorandów technicznych: pięciu o interakcji człowieka z komputerem (c1-c5) oraz czterech o teorii grafów (m1-m4). Dla zapytania „human computer interaction” dopasowanie wspólnych słów zwracało c1, c2 i c4. Trafne dokumenty c3 i c5 nie zawierały żadnego terminu z zapytania, dlatego proste dopasowanie je pomijało.
Dlaczego LSI odnajduje dokumenty c3 i c5?
Wspólne słowa prowadzą bezpośrednio do c1, c2 i c4.
C1, c2 i c4 łączą słowa zapytania z terminami obecnymi także w c3 i c5.
Oba tytuły mają 0 wspólnych terminów z zapytaniem.
Dokumenty m1-m4 tworzą osobny wzorzec oparty na terminach „graph”, „trees” i „minors”, dlatego pozostają poza wynikiem.
| Etap | Obserwacja | Znaczenie dla wyniku |
|---|---|---|
| 1. Korpus | Do indeksu trafia 12 terminów występujących w więcej niż jednym z dziewięciu tytułów. | Pięć dokumentów opisuje interakcję człowiek-komputer, a cztery teorię grafów. |
| 2. Macierz 12 × 9 | Wiersz oznacza termin, kolumna dokument, a komórka liczbę wystąpień terminu w tytule. | Macierz zapisuje bezpośrednie oraz pośrednie ścieżki łączące słownictwo całego korpusu. |
| 3. Redukcja SVD | Na potrzeby przykładu macierz zostaje odwzorowana w dwóch wymiarach. | Dokumenty c1-c5 tworzą skupienie odrębne od dokumentów m1-m4 o grafach i drzewach. |
| 4. Zapytanie | Terminy „human” i „computer” wyznaczają pozycję pseudodokumentu reprezentującego zapytanie. | Wektor zapytania można porównać ze wszystkimi dokumentami w tej samej przestrzeni. |
| 5. Ranking | Próg podobieństwa cosinusowego 0,9 obejmuje dokumenty c1-c5 i pomija dokumenty m1-m4. | C3 i c5 trafiają do wyniku dzięki wzorcowi całego korpusu, mimo że nie zawierają słów zapytania. |
Dokumenty c3 i c5 zyskują wysokie podobieństwo przez pośrednie relacje. Terminy „user”, „interface”, „system”, „response” i „time” łączą ich słownictwo z pozostałymi tytułami o interakcji człowieka z komputerem. SVD zachowuje dominującą strukturę tych zależności w zredukowanej przestrzeni.
Co LSI potrafi, a czego nie widzi?
Nazwa „semantic” może sugerować pełne rozumienie języka. W LSI semantyka jest wnioskowana z rozkładu terminów. Metoda nie posiada wiedzy o świecie niezależnej od korpusu, a jej reprezentacja zwykle zachowuje cechy modelu bag-of-words.
| Właściwość | Co umożliwia | Gdzie przebiega granica |
|---|---|---|
| Relacje z danych | LSI wykrywa powtarzalne wzorce współwystępowania terminów w całym korpusie. | Bliskość w przestrzeni jest oszacowaniem statystycznym. Nie stanowi faktu o świecie ani relacji zapisanej w grafie wiedzy. |
| Redukcja wymiarów | SVD zachowuje najsilniejsze struktury i wygładza część lokalnych różnic w słownictwie. | Zbyt mała liczba wymiarów usuwa użyteczne różnice, a zbyt duża ponownie uwzględnia szum. Dobór jest empiryczny. |
| Synonimia | Dokument może zostać odnaleziony mimo braku dokładnych słów zapytania, jeśli łączą go z nimi wzorce w korpusie. | Efekt zależy od danych. Metoda nie korzysta z wbudowanego słownika wszystkich synonimów. |
| Wieloznaczność | Kontekst korpusu może częściowo ograniczyć błędy powodowane przez słowo używane w kilku znaczeniach. | Jedna uśredniona reprezentacja terminu może mieszać znaczenia. Szyk zdań i pełna składnia zwykle pozostają poza modelem bag-of-words. |
| Aktualizacja korpusu | Znane zapytanie można odwzorować w już zbudowanej przestrzeni i porównać z dokumentami. | Nowe słownictwo i duże zmiany zbioru wymagają aktualizacji modelu, ponownego obliczenia albo technik przyrostowych. |
Rolę tego rozróżnienia w codziennej pracy nad treścią - obok intencji, encji i relacji - pokazuje artykuł o tym, czym jest SEO semantyczne.
Skąd wzięły się „LSI keywords”?
Branża SEO zaczęła używać tej nazwy dla synonimów, terminów współwystępujących i wyrażeń związanych z tematem. Etykieta połączyła prawdziwą metodę naukową z praktyką wzbogacania słownictwa strony. Problem polega na zmianie jednostki: LSI przetwarza cały korpus i zwraca relacje w przestrzeni, a narzędzie SEO zwykle zwraca gotową listę wyrażeń.
LSI, „LSI keywords” i słownictwo semantyczne
| Kryterium | LSI jako metoda | „LSI keywords” | Słownictwo semantyczne |
|---|---|---|---|
| Punkt wyjścia | korpus dokumentów i rozkład terminów w tym korpusie | wyniki Google, strony konkurencji, autocomplete lub baza narzędzia | rola URL-a, intencja odbiorcy oraz wiedza o opisywanej dziedzinie |
| Jednostka analizy | macierz termin–dokument przekształcana matematycznie | lista wyrażeń uznanych przez dostawcę za powiązane | encje, atrybuty, procesy, relacje i pytania potrzebne w dokumencie |
| Rezultat | współrzędne terminów, dokumentów i zapytania w zredukowanej przestrzeni | frazy wraz z wolumenem, wagą, wynikiem podobieństwa lub zalecaną liczbą użyć | twierdzenia i sekcje odpowiadające na właściwy podproblem |
| Standard definicji | opis metody, SVD i procedury retrieval w literaturze naukowej | brak jednej definicji; wynik zależy od narzędzia | jawne kryteria trafności, prawdziwości i przynależności do intencji |
Wszystkie trzy obszary dotyczą zależności między językiem i tematem. Różnią je dane wejściowe, procedura oraz rodzaj wyniku, dlatego nazw nie należy stosować zamiennie.
Sama etykieta nie ujawnia metodologii narzędzia. Lista może pochodzić z analizy stron konkurencji, podobnych wyszukiwań, n-gramów, embeddingów albo własnego słownika. Każde z tych źródeł może dostarczyć użytecznych kandydatów, lecz kandydat potrzebuje jeszcze sprawdzenia relacji z intencją i roli w dokumencie.
Sposób budowania takich relacji opisujemy osobno w poradniku o tym, czym są i jak dobierać słowa kluczowe semantyczne. Ten artykuł pozostaje przy mechanizmie LSI i poprawnej interpretacji nazwy.
Czy Google używa LSI?
Publicznie dostępne źródła nie potwierdzają, że Google używa klasycznego Latent Semantic Indexing jako systemu rankingowego. Pełna architektura wyszukiwarki pozostaje niepubliczna, dlatego zakres wniosku wyznaczają systemy i mechanizmy ujawnione przez Google.
| Poziom | Co wiadomo | Uprawniony wniosek |
|---|---|---|
| Potwierdzone źródłowo | LSI jest rzeczywistą metodą information retrieval opisaną w patencie z 1989 roku i publikacji Deerwestera i współautorów z 1990 roku. Publikacja Deerwestera i współautorów. | Można precyzyjnie opisać jej dane wejściowe, SVD i sposób porównywania zapytania z dokumentami. |
| Publicznie udokumentowane przez Google | Przewodnik po systemach rankingowych opisuje między innymi BERT, neural matching i RankBrain. Nie przedstawia klasycznego LSI jako systemu rankingowego. Przewodnik Google po systemach rankingowych. | Brak tej nazwy w dokumentacji nie ujawnia kompletnej architektury, ale nie daje podstaw do sprzedawania optymalizacji pod LSI. |
| Publiczna korekta terminu | John Mueller z Google napisał w 2019 roku: „There's no such thing as LSI keywords”. Wypowiedź Johna Muellera z 2019 roku. | Wypowiedź dotyczy branżowej kategorii „LSI keywords”, a nie wszystkich matematycznych technik podobieństwa używanych w wyszukiwaniu. |
| Nieujawnione | Google nie publikuje kompletnego kodu, wszystkich cech ani pełnej architektury swoich systemów retrieval i rankingowych. | Kategoryczne twierdzenie o każdym wewnętrznym komponencie wykraczałoby poza dostępne dowody. |
Współczesne wyszukiwanie Google wykorzystuje wiele systemów do rozumienia języka i dopasowania dokumentów. Opisywanie ich wspólną nazwą LSI zaciera różnice między metodami. Mechanizmy i publicznie nazwane systemy omawia osobny artykuł o tym, jak działa wyszukiwanie semantyczne.
Jak przełożyć brief LSI na sensowne zadanie?
Polecenie zawierające „LSI keywords” trzeba przełożyć na jawne pytanie o metodę, relację pojęcia i rolę URL-a. Taka instrukcja może wskazywać, że w treści brakuje ważnego słownictwa albo że dostawca chce porównać dokument z konkurencją. Dopiero rozpoznanie źródła listy pozwala podjąć właściwą decyzję redakcyjną.
| Polecenie | Pytanie kontrolne | Decyzja |
|---|---|---|
| Dodaj wszystkie LSI keywords z narzędzia | Jak narzędzie utworzyło listę i które pojęcia odpowiadają roli tego URL-a? | Zachowaj elementy, które pozwalają napisać potrzebne i prawdziwe twierdzenie. Pozostałe odrzuć albo przypisz do innego URL-a. |
| Podnieś wynik LSI do 80% | Co mierzy wynik: podobieństwo do konkurencji, pokrycie terminów, embedding czy własną formułę dostawcy? | Traktuj wynik jako sygnał diagnostyczny. Sprawdź brakujące relacje ręcznie i nie uznawaj progu za wymóg Google. |
| Powtórz każdą frazę określoną liczbę razy | Czy kolejne użycie wnosi nową informację lub zwiększa jednoznaczność zdania? | Użyj naturalnej nazwy tam, gdzie jest potrzebna. Usuń powtórzenia powstałe wyłącznie dla gęstości. |
| Znajdź synonimy przez LSI | Czy potrzebujemy wariantu tej samej nazwy, czy pojęcia pozostającego w innej relacji z tematem? | Nazwij typ relacji. Synonim, część, atrybut, przyczyna i skutek pełnią w treści różne funkcje. |
Najczęstsze pytania o Latent Semantic Indexing
01Co to jest Latent Semantic Indexing (LSI)?
Latent Semantic Indexing to metoda wyszukiwania informacji, która buduje macierz termin–dokument, redukuje jej liczbę wymiarów za pomocą singular value decomposition i porównuje dokumenty oraz zapytania w powstałej przestrzeni. Dzięki wzorcom użycia słów może znaleźć dokument związany z zapytaniem mimo braku pełnego dopasowania wyrazów.
02Czy LSI keywords istnieją?
„LSI keywords” istnieją jako popularna etykieta marketingowa, lecz oryginalna metoda LSI nie definiuje specjalnej listy słów do umieszczania na stronie. Narzędzia pod tą nazwą mogą zwracać synonimy, frazy współwystępujące lub terminy z wyników wyszukiwania, a sposób ich wyboru zależy od dostawcy.
03Czy Google używa LSI?
Nie ma wiarygodnej publicznej dokumentacji potwierdzającej, że klasyczne LSI jest systemem rankingowym Google. Google opisuje inne systemy rozumienia języka i dopasowania, a John Mueller odrzucił pojęcie „LSI keywords”. Pełna wewnętrzna architektura wyszukiwarki pozostaje niepubliczna.
04Czy LSI i LSA oznaczają to samo?
Oba skróty odnoszą się do tego samego rdzenia matematycznego opartego na macierzy termin–dokument i redukcji SVD. LSA podkreśla analizę ukrytej struktury semantycznej, a LSI jej zastosowanie do indeksowania i wyszukiwania informacji. W publikacjach nazwy bywają używane zamiennie.
05Czy słowa LSI i słowa kluczowe semantyczne to to samo?
Nie. „Słowa LSI” nie są kategorią z oryginalnej metody. Słowa kluczowe semantyczne to redakcyjne określenie pojęć powiązanych z tematem przez konkretną relację, na przykład encji, atrybutów, procesów i pytań. Ich przydatność ocenia się w kontekście roli strony.
06Czy LSI jest dziś bezużyteczne?
Nie. LSI pozostaje ważną metodą historyczną i może być stosowane w wyszukiwaniu, klasyfikacji lub grupowaniu stabilnych kolekcji dokumentów. Błędne jest przypisywanie mu specjalnej kategorii fraz SEO lub statusu potwierdzonego algorytmu rankingowego Google.
Źródła pierwotne i dalsza lektura
- Deerwester i in.: Indexing by Latent Semantic Analysis (1990)
- Patent US4839853A: Computer information retrieval using latent semantic structure
- Bradford: An empirical study of required dimensionality for large-scale LSI (2008)
- Zha i Simon: On Updating Problems in Latent Semantic Indexing (1999)
- Vecharynski i Saad: Fast Updating Algorithms for Latent Semantic Indexing (2014)
- John Mueller: publiczna wypowiedź o „LSI keywords” (2019)
- Google Search Central: przewodnik po systemach rankingowych