English version further below...
Stand: 15.06.: Aktuell ist der Katalog wieder weltweit zugreifbar. Das Risiko, dass die Botattacken neu starten, ist allerdings groß.
***
Die Online-Systeme der Bibliothek und besonders unsere Kataloge, Suchmaschinen und Repositorien sind leider zunehmend das Ziel von Bot-Attacken. Aus diesem Grund sind wir aktuell immer wieder gezwungen, den Zugriff auf unsere Katalogsuche einzuschränken. Das bedeutet, dass dann nur noch aus den Campusnetzen der Universität Bremen und der Hochschulen eine Katalogsuche bei uns möglich ist. Selbstverständlich ist für die Hochschulangehörigen auch ein externer Zugriff über die VPN Verfahren der Einrichtungen möglich.
Bots sind Systeme, die automatisiert nahezu alle öffentlichen Suchmaschinen im akademischen Kontext mit einer massiven Intensität und Flut an Suchanfragen überschwemmen. Darunter sind Systeme, die im Auftrag der großen Anbieter von KI-basierten Suchmaschinen operieren. Solche KI-Webcrawler indexieren akademische Daten, die über unsere Bibliothekssysteme erreichbar sind, um Large Language Models (LLM) besonders effektiv um wissenschaftliche Inhalte zu erweitern. Viele bekannte Suchmaschinenanbieter betreiben solche KI-Crawler.
Diese Abfragen verlaufen zuweilen so intensiv, dass ein normaler Suchbetrieb für unsere Nutzer:innen unmöglich ist.
So haben die Bibliothekssysteme im Moment zeitweise 50-100 Abfrage pro Sekunde zu verarbeiten. Dies ist eine Größenordnung, bei der die vorhandene Infrastruktur nicht mehr richtig antworten kann.
Wir arbeiten natürlich intensiv an einer Lösung. Voraussichtlich wird zukünftig eine vorgeschaltete Prüfung des zugreifenden Clients die Überlastung durch solche Bots verhindern können.
English version
15/06: Our catalogue is accessible again. The risk of new bot attacks is, however, high.
***
Unfortunately, our library’s online systems – in particular our catalogues, search engines and repositories – are increasingly targeted by bots. We are therefore currently forced to restrict access to our catalogue search on a regular basis. This means that catalogue searches can only be carried out via the campus networks of the Bremen universities. Of course, university members can also access the service remotely via their institution’s VPN.
Bots are systems that automatically flood almost all public search engines in an academic context with an overwhelming volume of search queries. These include systems operating on behalf of major providers of AI-based search engines. These AI web crawlers index academic data accessible via library systems in order to expand Large Language Models (LLM) with academic content. Many well-known search engine providers operate these AI crawlers.
These queries are sometimes so intense that regular search operations by our patrons are made impossible.
At present, the library systems are repeatedly having to process 50–100 queries per second. At this scale our present infrastructure can no longer respond properly.
We are, of course, working intensively on a solution. We plan to introduce a preliminary check of the accessing client. This should prevent the bots from causing a system overload.
Weitere Infromationen zum Thema/Furhter information on bot attacks:
FOSS infrastructure is under attack by AI companies
Copyright-Klagen: Wie AI-Firmen das Internet „klauen“ und womöglich damit durchkommen
Kommentare