Wer crawlt deinen Shop wirklich? 15 Tage Server-Log, ausgewertet

Über KI-Crawler wird viel geschrieben und wenig gemessen. Also habe ich mein eigenes Server-Log ausgewertet: 15 Tage, ein Server, ein grep. Das kam dabei heraus.
Damit die Zahlen einzuordnen sind, vorweg um welche Seite es geht: markusstoeger.com, meine eigene Entwickler-Website. Laut Sitemap 164 URLs, davon 83 deutsch und 81 englisch, überwiegend technische Guides zu WordPress, WooCommerce und KI-Integration. Kein Shop, kein Werbebudget, keine Ads. Eine mittelgroße Fachseite also — nichts, was besondere Aufmerksamkeit auf sich zieht.
| Crawler | Zugriffe | | --- | --- | | meta-externalagent | 3.530 | | ClaudeBot | 1.131 | | GPTBot | 950 | | ChatGPT-User | 855 | | OAI-SearchBot | 623 | | KI-Crawler gesamt | 7.138 | | Googlebot | 2.581 | | bingbot | 982 |
Die KI-Bots waren fast dreimal so oft da wie Google. Und selbst wenn man Metas Crawler herausrechnet, der mit Abstand am gierigsten ist, bleiben 3.559 gegen 2.581.
Auf 164 Seiten gerechnet heißt das: Jede einzelne URL wurde im Schnitt 43 Mal in 15 Tagen von einem KI-Crawler abgeholt. Knapp dreimal am Tag, pro Seite.
Das ist keine Prognose über die Zukunft der Suche. Das ist letzte und vorletzte Woche.
Drei Bots von OpenAI, drei verschiedene Aufgaben
In der Tabelle stehen drei OpenAI-Crawler, zusammen 2.428 Zugriffe. Sie in einen Topf zu werfen ist der häufigste Fehler, den ich sehe — jeder macht etwas anderes mit deinem Shop.
GPTBot sammelt Inhalte fürs Modelltraining. Was er mitnimmt, landet im Modell selbst und sorgt dafür, dass ChatGPT deine Marke kennt, auch ohne im Netz nachzusehen.
OAI-SearchBot baut den Suchindex, aus dem ChatGPT seine Antworten zusammenstellt. Er ist der Grund, warum du überhaupt als Quelle auftauchen kannst.
ChatGPT-User ist kein Crawler im klassischen Sinn. Er läuft los, wenn gerade jemand im Chat sitzt und eine Frage stellt, für die deine Seite in Frage kommt. Bei mir mit 855 Zugriffen der aktivste der drei — die Startseite allein wurde 403 Mal live abgeholt.
Diese Unterscheidung ist der Grund, warum pauschales Blockieren so teuer ist. Wer alles aussperrt, was nach KI aussieht, trifft mit demselben Klick den Trainings-Bot und die beiden, die tatsächlich Besucher bringen.
Die auffälligste Zahl steht nicht in der Tabelle
Von den 623 Zugriffen des OAI-SearchBot gingen 447 auf eine einzige Datei: die robots.txt. Nur der Rest verteilte sich auf echte Inhalte.
Er prüft also vor fast jedem Besuch neu, ob er darf. Das ist eine gute Nachricht und eine unangenehme zugleich. Gut, weil eine Korrektur an der robots.txt innerhalb von Stunden ankommt und nicht erst beim nächsten großen Crawl. Unangenehm, weil ein versehentliches Disallow genauso schnell wirkt — und niemand dir eine Meldung schickt, wenn es passiert.
Was in so einer Datei stehen sollte, habe ich im Guide zur robots.txt für KI-Crawler aufgeschrieben, samt Vorlage zum Kopieren.
Und was kommt am Ende dabei heraus?
12 Klicks im selben Zeitraum, mit chatgpt.com als Verweisquelle. Dazu 6 von claude.ai.
Das ist wenig, und ich schreibe es bewusst hin, weil an dieser Stelle sonst gern große Zahlen behauptet werden. Interessanter als die Menge ist, welche Seiten es waren: durchweg technische Artikel mit einer klaren Frage im Titel. Keine Startseite, keine Leistungsseite. Wer über ChatGPT kommt, kommt mit einer konkreten Frage und landet auf der Seite, die sie beantwortet.
Für einen Shop heißt das: Die Produktseite, die nur aus Herstellertext und Bildergalerie besteht, hat wenig Chancen. Die Seite, die „Passt Größe 43 bei diesem Modell?" wirklich beantwortet, hat welche.
Was davon auf deinen Shop übertragbar ist
Meine 164 Seiten sind eine überschaubare Fachseite. Ein WooCommerce-Shop mit 400 Produkten, dazu Kategorien, Filterseiten und Varianten, kommt schnell auf ein Vielfaches an URLs — und wird entsprechend häufiger abgeholt. Bei 43 Zugriffen pro Seite und Zeitraum wären das mehrere zehntausend Anfragen in zwei Wochen, nur von KI-Crawlern.
Das hat zwei Konsequenzen, die nichts mit Sichtbarkeit zu tun haben:
Es kostet Serverlast. Crawler ignorieren deinen Seiten-Cache nicht, aber sie treffen zuverlässig auch die Ecken, die selten jemand aufruft und die deshalb nie im Cache liegen. Wenn dein Shop ohnehin am Limit läuft, merkst du das.
Sie holen auch Seiten, die niemandem nützen. Filter-URLs mit angehängten Parametern, Warenkorb, Kasse, Kundenkonto. Der Crawler verbrennt dort Zeit und findet nichts Zitierfähiges. Deshalb steht in der robots.txt-Vorlage ein Disallow für genau diese Bereiche — nicht aus Geheimhaltung, sondern damit die verfügbaren Zugriffe auf deine Produkt- und Ratgeberseiten fallen.
So siehst du das bei dir
Du brauchst dafür keinen Server-Zugang.
Im Browser. Ruf deinshop.de/robots.txt auf. Das ist die Erlaubnis, an der alles hängt — und die Datei, die OAI-SearchBot bei mir hunderte Male geholt hat.
In Analytics. Filter deine Verweisquellen nach chatgpt.com, perplexity.ai und claude.ai. Bei Google Analytics steht das unter Akquisition → Traffic-Akquisition, bei Matomo und Plausible direkt in den Verweisen. Das zeigt dir die Klicks, nicht die Crawler.
In WordPress. Es gibt inzwischen mehrere kostenlose Plugins, die KI-Crawler mitschreiben und im Dashboard auflisten. Such im Plugin-Verzeichnis nach „AI Crawler Analytics"; die brauchbaren speichern die Daten in deiner eigenen Datenbank und schicken nichts nach außen.
Mit Server-Zugang geht es am schnellsten:
grep -c "OAI-SearchBot" /var/log/nginx/access.log
grep "OAI-SearchBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Die erste Zeile zählt die Zugriffe, die zweite zeigt, welche Seiten er geholt hat. Bei Apache liegt das Log unter /var/log/apache2/access.log, bei Managed Hosting meist im Kundenmenü unter „Zugriffsstatistik" oder „Rohlogs".
Eine halbe Stunde, und du rätst nicht mehr. Bei mir war das Ergebnis deutlich anders als erwartet — ich hätte Google vorn vermutet.
Willst du die nächsten Build- und Audit-Guides, mit allen Stolperfallen? Abonniere den „Built with AI"-Newsletter.
Lieber done-for-you? Wenn ich deinen Shop auf KI-Sichtbarkeit prüfen soll — Crawler-Zugriffe, robots.txt, Firewall-Regeln, strukturierte Daten: Schreib mir kurz. Das ist mein Tagesgeschäft.
Vom Autor
Diese Anleitungen entstehen aus meiner täglichen Arbeit: Ich baue und betreue Shops als WooCommerce- & WordPress-Entwickler und entwickle blitzschnelle Storefronts mit Headless WooCommerce. Wenn dein Shop Tempo oder Funktionen braucht, melde dich.
Built with AI – der Newsletter
Praxisnahe KI-Tutorials und die Tools, die ich wirklich nutze, direkt in dein Postfach. Kostenlos, ohne Hype.
Über Substack. Jederzeit abbestellbar.