Wikipedysta:Happywaldeuszek/Crawl Budget

Craw Budget – ilość podstron, którą jest w stanie zaindeksować robot wyszukiwarki np. GoogleBot w określonym czasie np. w ciągu jednej doby. Ta liczba może zmieniać się z dnia na dzień, jest zależna od wielu czynników np. wielkości strony, jej kondycji, prędkości czy rozkładu linków wewnętrznych. Wspomniane czynniki mogą powodować, że ilość indeksowanych podstron jest zmienna i skrajnie różna dla różnych serwisów internetowych. Zła optymalizacja bezpośredni związek z Crawl Budget może powodować problemy z indeksowaniem się nowych treści, jest to ekstremalnie niebezpieczne zjawisko w przypadku podstron produktowych w sklepach internetowych z dużym asortymentem.

Czynniki wpływające na Crawl Budget

W pierwszej kolejności Crawler pobiera plik robots.txt, aby wiedzieć które adresy trzeba wykluczyć ze skanowania. Crawler przegląda adresy jeden po drugim zaczynając od strony głównej, kiedy już przeanalizuje zawartość konkretnej podstrony do kolejki dodaje sobie wszystkie znalezione tam hiperłącza. Inne czynniki które wpływają na kolejkę indeksacji to m.in. mapa strony i linki z zewnętrznych adresów[1].

Niski Crawl Budget

Głównymi powodami niskiego Crawl Budgetu są brakujące odnośniki do podstron lub nałożenie blokady indeksacji w postaci tagu meta robots noindex. Jeśli jednak optymalizacja SEO na stronie jest wykonana poprawnie do szczegółowej analizy zachowania Crawlera należy przeanalizować logi z serwera www. W logach jest zawarta informacja o User Agent to daje pogląd które podstrony odwiedził Crawler wyszukiwarki, w jakiej kolejności i częstotliwości. Dzięki takiej analizie może okazać się, że Crawler np. odpytuje usunięte podstrony i marnuje swoje zasoby na próbę indeksacji podstron których nie ma, w takim przypadku konieczne jest wykonanie odpowiednich przekierowań. Tworząc przekierowania należy unikać łańcuchów przekierowań np. podstrona1.html (301) > podstrona2.html (301) > podstrona3.html (301) > podstrona4.html (200)

Crawler bierze również pod uwagę prędkość indeksacji. Jeśli przy dużej ilości wejść Crawlera pojawiają się dłuższe czasy odpowiedzi serwera lub błędy nagłówka http 50x to Crawler automatycznie spowalnia proces indeksacji, aby nie powodować utrudnień w interakcji na stronie użytkownikom mogącym odwiedzać stronę równolegle z Crawlerem. W przypadku skrajnie dużych portali o złej optymalizacji czas indeksacji wszystkich treści może trwać nieskończenie długo.

Optymalizując Crawl Budget pod wyszukiwarkę internetową trzeba brać pod uwagę jeszcze jakość strony, należy unikać:[2]

  • podstron o niskiej jakości, tzw. thin content
  • miękkich błędów 404, czyli podstron zwracających odpowiedź 200 (zamiast 404) z szablonem strony 404
  • duplikatów treści, np. Google na podstawie algorytmów heurystycznych sam określa kanoniczność adresów URL, odwiedziny podstron po to aby uznać je za duplikat jest marnowaniem zasobów crawlera

Przypisy

  1. Junghoo Cho, Hector Garcia-Molina, Lawrence Page, Efficient crawling through URL ordering, „Computer Networks and ISDN Systems”, 30 (1-7), 1998, s. 161–172, DOI10.1016/s0169-7552(98)00108-1, ISSN 0169-7552 [dostęp 2020-01-21].
  2. Dominik Krawiec, Crawl budget – co wpływa na budżet indeksowania witryny? [online], Grupa TENSE, 9 lipca 2019 [dostęp 2020-01-21] (pol.).

Kategoria:Wyszukiwarki internetowe


Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.
Kembali kehalaman sebelumnya