Először: crawl és index nem ugyanaz
A keresési folyamatot leegyszerűsítve három részre bonthatjuk: feltérképezés, indexelés, majd kiszolgálás és rangsorolás.
Feltérképezés
A Google megtalálja és lekéri az URL-t.
Indexelés
Feldolgozza és értelmezi a tartalmat, majd eldöntheti, hogy az oldal bekerüljön-e az indexbe.
Rangsorolás
Egy konkrét keresésnél eldől, megjelenik-e, és milyen pozícióban.
Feltérképezett ≠ indexelt. Indexelt ≠ jól rangsoroló.
Google Indexing Pipeline
Az URL-t nem fedezi fel a kereső
Nincs belső link, hibás vagy hiányos a sitemap, illetve az oldal elszigetelten áll a webhelyen.
A crawler nem tudja megfelelően lekérni
Robots-blokk, szerverhiba, redirect loop, DNS- vagy hálózati probléma akadályozhatja.
A fontos tartalom nem renderelődik
JavaScript-hiba, API-probléma, blokkolt erőforrás vagy kliensoldali routing miatt hiányos lehet az oldal.
Más URL lesz az elsődleges
A rel=canonical, belső linkek, sitemap és tartalmi hasonlóság nem következetes.
Az oldal nem kerül az indexbe
Noindex, duplikáció, soft 404 vagy alacsony önálló tartalmi érték lehet az ok.
Indexelt, de nem jelenik meg a keresésre
Keresési szándék, relevancia, verseny, belső súly vagy hitelességi jel lehet kevés.
1. Még nem találta meg a Google
Új oldal esetén előfordulhat, hogy a crawler még nem jutott el hozzá. Segíthet egy normál belső link, megfelelő sitemap és a Search Console URL Inspection. Az indexelési kérés azonban nem parancs és nem jelent garanciát.
2. Nincs belső link
Egy URL létezhet úgy, hogy a webhelyen gyakorlatilag semmi nem hivatkozik rá. A sitemap segítheti a felfedezést, de egy fontos szolgáltatási oldalnak a normál navigációs és belső linkrendszerbe is illeszkednie kell.
Ha sem a kezdőlap, sem a szolgáltatási hub, sem más releváns tartalom nem mutat rá, az nemcsak feltérképezési, hanem információs architektúra-probléma.
3. Noindex
<meta name="robots" content="noindex">A meta robots vagy X-Robots-Tag noindex azt jelzi a támogatott keresőknek, hogy az oldalt ne tartsák a keresési indexben. Legitimen használható utility vagy belső jellegű oldalakon; probléma akkor van, ha fontos landing kapja véletlenül. Staging–production költözésnél ezt külön ellenőrizni kell.
4. Robots.txt blokkolás
A robots.txt elsősorban a feltérképezés szabályozására szolgál, nem az indexelés tiltására. Ha a robots.txt blokkolja az URL-t, a crawler nem feltétlenül látja az oldalon lévő noindex utasítást.
robots.txt ≠ noindex
5. Hibás HTTP-státusz
A böngészőben valami megjelenhet, miközben a crawler 404, 410, 5xx, redirect loop vagy soft 404 választ tapasztal. Technikai vizsgálatnál ezért nem elég vizuálisan megnyitni az oldalt: a HTTP-választ is ellenőrizni kell.
6. A canonical másik URL-re mutat
Ha a /seo-audit/ oldal canonicalja a /seo/ URL-re mutat, a rendszer azt jelzi, hogy utóbbi az előnyben részesített verzió. Ha ez nem szándékos, az indexelési viselkedés eltérhet a várttól.
A canonical nem abszolút parancs. Következetesség kell a canonical, belső linkek, sitemap, átirányítások és URL-struktúra között.
7. A Google más canonicalt választ
Előfordulhat, hogy a felhasználó által megadott canonical A, a Google által választott pedig B. Ennek oka lehet nagyon hasonló tartalom vagy ellentmondó webhelyjelzés. A helyes kérdés nem az, hogyan kényszerítsük a keresőt, hanem az, miért tűnik B következetesebb elsődleges verziónak.
8. Duplikált vagy nagyon hasonló tartalom
Húsz városoldal, ahol csak a településnév változik, technikailag húsz URL, tartalmilag azonban alig különbözik. Ez nem pusztán canonical-probléma. Minden indexelni kívánt oldalnak világos, önálló feladatot és értéket kell adni.
9. Vékony vagy alacsony értékű tartalom
Nincs univerzális minimumszószám az indexeléshez. Egy 300 szavas oldal lehet kiváló, egy 3000 szavas pedig felesleges. A kérdés az, hogy ad-e önálló értéket, megválaszolja-e a feladatát, és indokolt-e külön URL-ként léteznie.
Ha tíz oldal csak kulcsszóvariáció miatt készült, lehet, hogy a konszolidáció jobb megoldás, mint még több szöveg hozzáadása.
10. JavaScript- vagy renderelési probléma
A Google renderel JavaScriptet, de ettől nem lesz minden megvalósítás automatikusan problémamentes. Hibás JavaScript, API-hiba, hitelesítés mögé rejtett tartalom, kliensoldali routing vagy crawler számára eltérő állapot miatt a fontos tartalom hiányozhat.
A lényegi tartalomnak és linkeknek megbízhatóan elérhetőnek kell lenniük.
11. Sitemap-probléma
A sitemap segít URL-eket felfedezni, de nem indexelési garancia. Canonical és indexelni kívánt URL-eket érdemes benne tartani, hibás vagy átirányított címek nélkül. Ha egy URL egyszerre szerepel a sitemapben és noindex, a jelzések ellentmondanak egymásnak.
12. Az oldal új vagy nemrég módosult
Új URL, canonical-változás, jelentős tartalmi átalakítás vagy migráció után az újrafeldolgozás időt igényelhet. A Search Console-ban kérhető újrafeltérképezés, de az ismételt kérés nem gyorsítja korlátlanul a folyamatot.
Gyakori Search Console állapotok
Feltérképezve — jelenleg nincs indexelve
A Google megtalálta és lekérte az URL-t, de jelenleg nincs az indexben. Ez nem automatikusan büntetés. Vizsgálni kell az egyediséget, értéket, duplikációt, canonicalt, belső linkelést és webhelystruktúrát.
Felfedezve — jelenleg nincs indexelve
A kereső ismeri az URL-t, de még nem feltétlenül térképezte fel. Crawlprioritás, szerverterhelés, webhelyméret, minőség vagy struktúra is szerepet játszhat.
Soft 404
A szerver 200-as sikeres választ ad, miközben az oldal tartalma azt mondja, hogy nincs termék, találat vagy érdemi tartalom. Ilyenkor a HTTP-státusz és a tartalom jelentése nem egyezik.
Indexelve van, de nem találod?
Lehet, hogy az oldal indexben van, csak nem rangsorol az általad próbált keresésre. A Search Console URL Inspection pontosabb diagnosztikai forrás lehet, mint egy kézi keresés vagy a site: operátor.
Ha indexelt, akkor keresési szándékot, tartalmi minőséget, versenyt, belső súlyt, relevanciát, külső jeleket és oldalélményt kell vizsgálni. Ez már nem indexelési probléma.
Gyors diagnózis
A legfontosabb hiba: automatikusan több SEO-szöveget írni
Ha az oldal nincs indexben, gyakori reakció még ezer szó hozzáadása. Ez csak akkor segít, ha a valódi probléma a tartalmi érték. Noindex, hibás canonical vagy 5xx szerverhiba esetén a plusz szöveg semmit nem old meg.
Először diagnózis. A javítás csak utána következik.
Design&Code Indexing Check
Elérhető?
Státusz, szerver és hálózati hozzáférés.
Indexelhető?
Robots és noindex szabályok.
Melyik az elsődleges?
Canonical és duplikációs jelek.
Megtalálható?
Belső linkek és sitemap.
Látható a tartalom?
JavaScript és erőforrások.
Van önálló értéke?
Feladat, minőség és keresési szándék.
Ezután következik a struktúra és a konkrét Search Console-státusz értelmezése. Csak ezután döntünk a javításról.
Mikor érdemes indexelést kérni?
- új, fontos oldal publikálása után;
- lényegesen módosított oldalnál;
- technikai indexelési hiba javítása után;
- canonical-probléma rendezése után.
Az indexelési kérés nem kerülőút. Ha a kiváltó ok megmaradt, az újrakérés sem oldja meg.
A Design&Code álláspontja
Az indexelési problémát nem a „Request Indexing” gomb ismételt megnyomásával kezdjük. Előbb megértjük, miért nem akarja vagy nem tudja a kereső az adott URL-t indexelni.
Források
Összefoglalás
Ha egy oldal nincs a Google indexében, ne kezdj azonnal tartalmat átírni. Ellenőrizd sorrendben a HTTP-választ, robots-szabályokat, noindexet, canonicalt, sitemapet, belső linkeket, Search Console-státuszt, renderelést és tartalmi minőséget. Az indexelés nem egyetlen kapcsoló, hanem rendszer.