Metodologia
Generator znaczników schema analizuje stronę internetową etapami: pobiera zarówno surowy HTML, jak i wyrenderowany DOM, klasyfikuje typ strony, heurystycznie ekstrahuje dane strukturalne, porównuje z istniejącymi znacznikami i emituje zwalidowany JSON-LD.
Pipeline
- Pobranie: Surowy HTML najpierw, potem wyrenderowany DOM przez headless browser. Przechwytuje to, co widzą crawlery vs. co dodaje JavaScript.
- Klasyfikacja: Rozpoznaje typ strony (Organization, Service, Article, Product, FAQ, LocalBusiness) na podstawie struktury HTML, wzorców tekstu i istniejących znaczników.
- Ekstrakcja: Heurystycznie wydobywa encje: nazwa prawna, adres URL loga, adres, telefon, profile społecznościowe, autor, daty publikacji/aktualizacji, okruszki nawigacyjne. Każde pole jest oznaczone poziomem pewności ekstrakcji.
- Diff: Parsuje istniejące znaczniki schema i porównuje z wyodrębnionymi danymi, pokazując luki i konflikty.
- Emisja: Generuje kompletny @graph z wymaganymi i zalecanymi polami zgodnie ze schema.org, wypełniając to, co zostało znalezione i pozostawiając placeholdery (oznaczone TODO) na to, czego nie było.
- Walidacja: Waliduje wynik względem schema.org i wymagań Google na pola przed zwróceniem.
Punktacja i oceny
Raport zawiera wynik kompletności 0–100 przypisany do oceny literowej:
| Ocena | Zakres | Znaczenie |
|---|---|---|
| A | 90–100 | AI-ready — kompletne, obecne dane strukturalne |
| B | 75–89 | Mostly visible — kilka luk, ale schemat obecny |
| C | 60–74 | Partially visible — rzadkie lub niekompletne znaczniki |
| D | 40–59 | Hard to cite — bardzo niekompletne |
| F | 0–39 | Effectively invisible — brak lub uszkodzone znaczniki |
Formula punktacji
Wynik waży trzy kategorie:- Wymagane właściwości (60 pkt): Pola główne, które schema.org oznacza jako wymagane dla każdego typu (nazwa, URL, logo dla Organization itd.). Brakujące którekolwiek to znaczna luka.
- Zalecane właściwości (25 pkt): Pola, które Google specjalnie rekomenduje (sameAs do łączenia entitet, linki profilów społecznych, dane kontaktowe). Zwiększa jakość, ale niekrytyczne.
- Higiena łączenia (15 pkt): Czy wiele stron jest połączone poprzez BreadcrumbList lub sameAs? Czy zagnieżdżona encja (autor, wydawca, lokalizacja) łączy się z powrotem? Źle sformułowana struktura @graph kosztuje punkty tutaj.
Jak działa ekstrakcja
Ekstrakcja to tylko heurystyka, bez wywołań LLM. Skanujemy pod kątem:- Istniejących bloków JSON-LD (źródło o najwyższej pewności)
- Tagów meta Open Graph / Twitter
- Microdata (schema.org itemscope)
- Adnotacji RDFa
- Wzorów tekstu: numery telefonów, formaty e-mailów, URLs, które wyglądają jak profile społeczne
- Tekstu H1/title jako fallback dla nazwy
- Obrazów logo z
<img alt="[company]">lub standardowych ścieżek logo
Etykiety pewności
- Wysoka: Pobrana bezpośrednio z istniejącego znacznika schema.org lub wyraźnego znacznika jak tagi Open Graph.
- Średnia: Dopasowana wzorem (np. numer telefonu znaleziony w sekcji "Kontakt", założony jako telefon biznesu).
- TODO: Nie mógł być znaleziony lub pewnie wnioskowany. Musisz to wypełnić przed publikacją lub pominąć pole.