llms.txt i dostęp dla robotów AI: czy modele w ogóle mogą Cię przeczytać
Sprawdzamy, czy roboty modeli AI mają wstęp na Twoją stronę, odblokowujemy te, które chcesz wpuścić, i przygotowujemy plik llms.txt wskazujący im najważniejsze adresy w serwisie.
Pierwsza rzecz, którą trzeba sprawdzić
Zanim zaczniesz zastanawiać się, dlaczego ChatGPT Cię nie wymienia, sprawdź, czy w ogóle wpuszczasz jego robota. Sporo hostingów i wtyczek bezpieczeństwa blokuje crawlery AI domyślnie, bo traktuje je jak niechciany ruch. Właściciel firmy nie ma o tym pojęcia, bo nikt mu tego nie zgłosił.
Blokada bywa też świadoma i sensowna. Jeśli sprzedajesz treść, wpuszczanie modeli może być błędem. To decyzja biznesowa, nie techniczna, i podejmuje ją właściciel, nie agencja.
Co robimy krok po kroku
- Czytamy robots.txt i reguły serwera pod kątem robotów wymienionych z nazwy: GPTBot, ClaudeBot, PerplexityBot, Google-Extended i kilku innych.
- Sprawdzamy zaporę aplikacyjną i konfigurację CDN, bo blokada częściej siedzi tam niż w robots.txt.
- Ustalamy z Tobą, kogo wpuszczamy. Google-Extended i GPTBot to osobne decyzje, dotyczą różnych rzeczy.
- Budujemy plik llms.txt: krótki opis firmy i lista adresów, które mają być czytane w pierwszej kolejności.
- Sprawdzamy, czy treść jest dostępna bez uruchamiania JavaScriptu. Wiele crawlerów AI nie renderuje strony i widzi pustkę.
Czym jest llms.txt bez marketingu
To plik tekstowy w katalogu głównym domeny, w którym opisujesz swoją stronę i wskazujesz jej najważniejsze adresy. Format zaproponował we wrześniu 2024 roku Jeremy Howard i nie jest to standard zatwierdzony przez nikogo, ani obowiązek. Część modeli go czyta, część ignoruje.
Traktujemy go jak tani zakład: godzina pracy, zero ryzyka, możliwa korzyść. Jeśli ktoś sprzedaje Ci llms.txt jako sposób na wejście do ChatGPT, sprzedaje Ci bajkę.
Co daje więcej niż sam plik
Treść dostępna bez JavaScriptu, jasne nagłówki, odpowiedzi na pytania podane w pierwszych zdaniach akapitu i dane strukturalne. To działa na wszystkie modele, niezależnie od tego, czy czytają llms.txt.
Zanim zapytasz
Częściowo tak. Modele odpowiadają na pytania bez wysyłania kliknięcia. Z drugiej strony firma, której model nie zna, nie zostanie polecona nikomu. Wybór zależy od tego, czy zarabiasz na ruchu, czy na zleceniach.
Tak. Roboty przedstawiają się nazwą, więc regułę pisze się osobno dla każdego. Można na przykład wpuścić wyszukiwarkę Perplexity, a zablokować robota zbierającego dane do trenowania.
Sama weryfikacja i konfiguracja to zwykle jeden dzień. Efekt w odpowiedziach modeli, jeśli w ogóle się pojawi, widać po kilku tygodniach.
Sprawdź, czy modele AI w ogóle mają wstęp na Twoją stronę
To pierwsza rzecz, którą weryfikujemy w darmowym audycie GEO.