Anthropic snijdt miljoenen boeken kapot om Claude te trainen

Nieuws
donderdag, 30 juli 2026 om 00:00
Anthropic snijdt miljoenen boeken kapot om Claude te trainen
Anthropic heeft miljoenen fysieke boeken laten versnijden, digitaliseren en vervolgens vernietigen om zijn AI-modellen te trainen. Gelekte interne documenten tonen aan dat het project bewust geheim werd gehouden. De onthullingen zorgen wereldwijd voor felle discussies over auteursrechten, cultureel erfgoed en de toekomst van kennis.
Waar de afgelopen jaren vooral werd gedebatteerd over het gebruik van illegaal gedownloade digitale boeken voor AI-training, verschuift de discussie nu naar een nieuwe praktijk. In plaats van boeken van internet te halen, kopen AI-bedrijven op industriële schaal fysieke exemplaren op. Vervolgens worden de ruggen van de boeken afgesneden, iedere pagina wordt op hoge snelheid ingescand en daarna verdwijnen de boeken in de papierverwerking.
Volgens rechtbankdocumenten gebeurde dit bij Anthropic onder de interne codenaam Project Panama, een initiatief dat volgens interne memo's als doel had om "alle boeken ter wereld destructief te scannen". Medewerkers kregen daarbij expliciet de instructie om niet publiekelijk over het project te spreken.

Wat is Project Panama?

Project Panama werd begin 2024 opgezet nadat Anthropic steeds meer juridische problemen kreeg rondom het gebruik van auteursrechtelijk beschermd materiaal voor de training van Claude, de AI-chatbot van het bedrijf.
Uit duizenden pagina's aan rechtbankdocumenten blijkt dat Anthropic miljoenen dollars investeerde in het opkopen van enorme partijen tweedehandsboeken. Daarbij werd voormalig Google Books-manager Tom Turvey aangetrokken om een industriële scanoperatie op te zetten.
Het proces verliep volgens de documenten als volgt:
  • miljoenen boeken werden opgekocht;
  • de rug werd hydraulisch afgesneden;
  • alle pagina's werden afzonderlijk ingescand;
  • de fysieke boeken werden weggegooid;
  • de digitale scans werden intern gebruikt voor AI-training.
Volgens de rechtbank leverde deze methode kwalitatief betere data op dan internetbronnen, omdat boeken minder fouten bevatten en niet zijn vervuild met door AI gegenereerde teksten.

Waarom gebeurt dit juist nu?

De timing is geen toeval.
Anthropic kwam de afgelopen jaren onder vuur te liggen omdat het miljoenen boeken uit piratenbibliotheken zoals LibGen gebruikte om Claude te trainen.
In juni 2025 oordeelde een Amerikaanse rechter dat het trainen van AI op legaal verkregen boeken onder omstandigheden als fair use kan worden beschouwd. Tegelijkertijd bleef het illegaal verkrijgen van piratenkopieën onderwerp van verdere rechtszaken.
Door fysieke boeken simpelweg te kopen probeert Anthropic dat juridische risico grotendeels te vermijden.
Het bedrijf bezit immers een legaal exemplaar voordat het wordt gedigitaliseerd.
Dat maakt de juridische discussie fundamenteel anders dan het downloaden van illegale digitale kopieën.

Boekhandelaren zien plotseling enorme vraag

De gevolgen zijn inmiddels zichtbaar op de internationale tweedehandsboekenmarkt.
Meerdere handelaren melden dat zij normaal enkele tientallen bijzondere boeken per week verkochten, maar sinds vorig jaar plotseling honderden orders ontvangen.
Vooral:
  • buitenlandse uitgaven;
  • wetenschappelijke werken;
  • oude vakliteratuur;
  • zeldzame titels;
  • uitverkochte boeken
zijn bijzonder populair geworden.
Volgens verschillende verkopers vermoeden zij dat veel van deze aankopen uiteindelijk bij AI-bedrijven terechtkomen.

Zorgen over zeldzame boeken

Juist dat baart bibliotheken, verzamelaars en auteurs zorgen.
Hoewel veel vernietigde boeken in grote oplages bestaan, melden boekhandelaren dat ook moeilijk verkrijgbare exemplaren worden opgekocht.
Critici vrezen dat sommige uitgaven waarvan nog maar weinig fysieke exemplaren bestaan permanent verdwijnen.
Daar komt nog iets bij.
De gemaakte scans worden niet openbaar beschikbaar gemaakt.
Ze verdwijnen in de gesloten trainingsdatabases van AI-bedrijven en zijn niet toegankelijk voor onderzoekers, bibliotheken of het grote publiek.
Daardoor ontstaat volgens critici geen digitaal archief voor de samenleving, maar uitsluitend commerciële trainingsdata voor private AI-systemen.

Juridisch toegestaan, maar ethisch omstreden

De rechter maakte in de Amerikaanse rechtszaak een belangrijk onderscheid.
Het digitaliseren van een legaal gekocht boek en het vernietigen van het fysieke exemplaar werd gezien als een transformatief gebruik, vergelijkbaar met eerdere digitaliseringsprojecten.
Dat betekent echter niet dat alle kritiek daarmee verdwijnt.
Auteurs wijzen erop dat zij geen vergoeding ontvangen voor de uiteindelijke AI-training, ondanks dat hun werk wel wordt gebruikt om commerciële AI-systemen slimmer te maken.
Bovendien verandert de uitspraak niets aan eerdere beschuldigingen rondom het gebruik van illegale digitale kopieën.

ISBNdb biedt inmiddels speciale AI-diensten aan

De praktijk lijkt zich bovendien uit te breiden.
ISBNdb, een grote internationale boekendatabase, biedt inmiddels speciale bulkdiensten aan waarmee AI-bedrijven honderdduizenden tot miljoenen boeken kunnen inkopen.
Volgens documentatie van het bedrijf worden boeken geselecteerd op onder meer taal, onderwerp en publicatiejaar, waarna ze gereed worden gemaakt voor grootschalige scanning.
Zelf erkent ISBNdb dat de publieke beeldvorming problematisch is. Een kop als "AI-bedrijf vernietigt twee miljoen boeken" zou volgens het bedrijf begrijpelijk negatieve reacties oproepen.

Een nieuwe fase in de AI-wedloop

De onthullingen laten zien hoe belangrijk hoogwaardige trainingsdata inmiddels zijn geworden.
Nu internet steeds meer wordt gevuld met AI-gegenereerde teksten, zoeken AI-bedrijven naar betrouwbare, oorspronkelijke informatiebronnen.
Boeken vormen daarvoor een aantrekkelijke dataset:
  • zorgvuldig geredigeerd;
  • feitelijk gecontroleerd;
  • vaak geschreven vóór de opkomst van generatieve AI.
Dat verklaart waarom bedrijven bereid zijn miljoenen dollars uit te geven aan fysieke boeken die na digitalisering direct worden vernietigd.

Waarom deze discussie waarschijnlijk alleen maar groter wordt

Project Panama raakt aan een veel bredere vraag dan alleen auteursrecht.
Wie bezit menselijke kennis wanneer die eenmaal is omgezet in trainingsdata voor kunstmatige intelligentie?
Voorstanders wijzen erop dat de informatie behouden blijft in digitale vorm en AI-systemen daardoor beter kunnen functioneren.
Tegenstanders zien juist een verschuiving waarbij cultureel erfgoed verdwijnt in gesloten commerciële modellen waar niemand buiten de bedrijven zelf toegang toe heeft.
Nu steeds meer rechtszaken lopen tegen AI-ontwikkelaars als Anthropic, OpenAI, Meta en Google, lijkt de strijd over trainingsdata nog lang niet voorbij. De komende jaren zullen waarschijnlijk bepalen waar de juridische én ethische grenzen liggen van het digitaliseren van de volledige menselijke kennis voor kunstmatige intelligentie.
loading

Populair nieuws

Laatste reacties

Loading