Bij Kernel.org gaat inmiddels zo’n twintig procent van de cpu-capaciteit op aan het renderen van commits voor AI-scrapers. Dat vergt veel meer cpu-capaciteit dan andere vormen van legitieme toegang, waaronder Git-clones. Kernel.org ziet zich daardoor genoodzaakt om bepaalde functionaliteit uit te schakelen.
Git.kernel.org krijgt dagelijks zo'n 6 miljoen verzoeken voor individuele commitpagina's, schrijft Konstantin Ryabitsev, die bijdraagt aan de infrastructuur van Kernel.org. Daardoor zijn op elk moment 14 tot 16 cpu's alleen maar bezig met Git-commits omzetten naar HTML. In totaal heeft Kernel.org 90 cpu's, verspreid over vijf locaties.
Het probleem zit hem volgens Ryabitsev in hoe de scrapers door de geschiedenis van Linux heengaan. Een scraper kan alle repository's klonen en lokaal alle commits doorlopen. Maar in plaats daarvan vragen veel scrapers om één commitpagina per keer. Die pagina moet dan omgezet worden naar HTML, waarna de scraper om de volgende vraagt.
De algemene Linux-repository heeft nu zo'n 1,48 miljoen commits. Daarnaast zijn er zo'n 922 forks op git.kernel.org, met doorgaans diezelfde commits. Dat levert enkele miljarden valide URL's op die allemaal gescrapet kunnen worden, concludeert Ryabitsev. "Om vervolgens te eindigen met 922 duplicaten van dezelfde 1,48 miljoen commits." Daarnaast kunnen de scrapers om patches, diffs en platte tekst vragen, waardoor het aantal URL's nog verder toeneemt.
Weinig echte oplossingen
Kernel.org heeft op verschillende manieren geprobeerd het verkeer terug te dringen. Zo blokkeerde Kernel.org bepaalde IP-adressen en netwerken. Maar de scrapers stapten over op residentiële en mobiele proxynetwerken, waardoor dat minder effectief werd.
Kernel.org heeft ook Anubis ingezet, dat bezoekers een kleine uitdaging laat oplossen voor ze een site kunnen bezoeken. De scrapers wisten zich daar ook op aan te passen en een deel lost inmiddels ook moeilijkere uitdagingen op.
Kernel.org ziet zich nu genoodzaakt om bepaalde functies uit te zetten om het aantal crawlbare URL's te verminderen. Daarnaast worden kostbare acties beperkt voor anonieme gebruikers. "Maar we beloven dat al onze gegevens te downloaden blijven voor iedereen die daarom vraagt. Het kan alleen zijn dat je door meer hoepels moet springen om ze te bemachtigen", zegt Ryabitsev.
/i/2008344398.png?f=imagenormal)
:strip_icc():strip_exif()/u/71115/plus222.jpg?f=community)
:strip_icc():strip_exif()/u/401615/edit.jpg?f=community)
/u/1741088/crop636b6e3488036_cropped.png?f=community)
:strip_icc():strip_exif()/u/61340/125281113_256.jpg?f=community)
/u/89414/crop601ef6957a87f_cropped.png?f=community)
:strip_exif()/u/6999/logofreem.gif?f=community)
:strip_icc():strip_exif()/u/1033233/crop5a69b122681c2.jpeg?f=community)
:strip_exif()/u/682799/crop5fc57c6c9c5fa_cropped.gif?f=community)