Google koopt bedrijfsdata van failliete luchtvaartmaatschappij om AI te trainen

Google koopt voor 10 miljoen dollar veel bedrijfsdata van Spirit Airlines, een Amerikaanse luchtvaartmaatschappij die dit jaar failliet ging. Het gaat bijvoorbeeld om e-mails, documenten en chatberichten, maar niet om klantendata. Google wil de bestanden gebruiken om AI-modellen te trainen.

De data bevat zo'n 100 miljoen e-mails en 500 miljoen Microsoft Teams-chatgesprekken. Voor zover bekend gaat het vooral om interne bedrijfsdata, zoals HR-informatie over de productiviteit van werknemers, of hoeveel Spirit verdiende aan bepaalde vluchten en marketingmateriaal.

Klantendata zit voor zover bekend dus niet bij de data. De data is volgens de verkopende partij ook geanonimiseerd en Google mag ook niet proberen de data alsnog aan mensen te koppelen. De data zou dus niet te herleiden moeten zijn tot specifieke Spirit-werknemers.

Google zegt tegen nieuwssite Axios de data door een derde partij te laten opschonen om ervoor te zorgen dat de informatie volledig geanonimiseerd is. Het bedrijf zegt dat de data 'waardevol kan zijn om ons te helpen bij het verbeteren van onze producten en onze AI-modellen'.

Google deelt dus geen concrete plannen, maar mogelijk geeft de data de AI-modellen een beter beeld van hoe bedrijven of luchtvaartmaatschappijen intern werken. Een Amerikaanse rechter moet de verkoop nog goedkeuren.

Spirit Airlines. Bron: NurPhoto / Getty Images
Spirit Airlines. Bron: NurPhoto / Getty Images

Door Hayte Hugo

Redacteur

18-08-2026 • 12:13

47

Submitter: duvekot

Reacties (47)

Sorteer op:

Weergave:

Het lijkt me dat er in deze data toch behoorlijk wat persoonlijke en privacygevoelige data gaat. Een werknemer of klant maakt wat mij betreft niet uit. Het gaat nog steeds om privacy. Benieuwd hoe hiermee wordt omgegaan, gezien in de USA bedrijven een stuk meer mogen wat betreft schenden van privacy.
Daar schrijft het artikel toch over?
De data is volgens de verkopende partij ook geanonimiseerd en Google mag ook niet proberen de data alsnog aan mensen te koppelen. De data zou dus niet te herleiden moeten zijn tot specifieke Spirit-werknemers.

Google zegt tegen nieuwssite Axios de data door een derde partij te laten opschonen om ervoor te zorgen dat de informatie volledig geanonimiseerd is.
maar je moet ook realistisch zijn, bij zulke hoeveelheden van data zal anonimisatie achteraf gewoon niet lukken.
Jij stelt, dan mag je ook onderbouwen. Waarom kan dat niet? Een computer heeft geen harde limiet op een megabyte aan data.
Het gaat niet perfect. E-mail adressen en Teams namen kun je vrij eenvoudig vervangen, maar er staan in berichten ook veel ongeformatteerde persoonsverwijzingen. Aanheffen, afscheidsgroeten, verwijzingen naar personen in de tekst, signatures, BSN nummers, polisnummers, telefoonnummers, relaties tussen personen, enz, enz. Mogelijk ook nog in verbasterde vormen.
Daar zou het een en ander door kunnen slippen.

En als je maar genoeg datapunten hebt kun je zelfs een perfect geanonimiseerde dataset tot een specifiek persoon herleiden.

De vraag is hoeveel er mis kan gaan en of het de moeite is om je druk over te maken.

[Reactie gewijzigd door locke960 op 18 augustus 2026 12:49]

Je kan "AI" gebruiken voor anonymization, vorig jaar nog een demo project hiervoor gemaakt. Een model als deze had ik toendertijd gebruikt.

Een lastiger punt is dat ook na anonymization je soms kan herleiden na een persoon of individu. Bijvoorbeeld is er iemand die een specifieke combinatie van medicijnen ontvangt over een gegeven periode. Dat is theoretisch te fingerprinten.

[Reactie gewijzigd door ZpAz op 18 augustus 2026 12:53]

Omdat je, met genoeg datapunten het gewoon kan herleiden naar een afdeling/functie/persoon etc. Hoe meer data er in die dataset zit, hoe slechter anonimiseren gaat werken.
Hoe ga je data ín een mail anonimiseren? Mensen geven natuurlijk compleet random gegevens door..
Wanneer is iets een naam en wanneer niet... AI zou daar misschien bij kunnen helpen, maar ...... je snapt me denk ik?? :+
Weet niet precies wat je probeert te suggereen (je zou ook gewoon concreet kunnen zeggen wat het probleem is). Maar AI kan je ook (lokaal) gebruiken zonder dat die data gebruikt wordt voor verdere training.
Vanuit mijn werkveld (digitaal forensisch onderzoek) kan je vertellen dat het volledig anonimiseren van dit soort data (echte gebruikersdata, en dat in gigantische hoeveelheden) nagenoeg onmogelijk is.

Sure: je kan de from en de to verwijderen. Maar wat met de inhoud van een mail of chatbericht waarin iemand naar diens leidinggevende stuurt dat die vandaag niet naar werk kan komen omdat <naam partner> een chemo afspraak heeft? Of wat dacht je van gedeelde locaties?
En hoe kom je erachter dat er privacygevoelige gegevens zit in data die niet meteen human readable is? Neem een WhatsApp database: je kan even alle kolommen nagaan en waar je een naam ziet die weghalen, en dan hopen dat de inhoud van de gesprekken geen AVG schendingen bevat (is wel zo)... en dan kom je erachter dat je het telefoonnummer van gebruikers kan afleiden uit hun whatsapp user ID.

Het is echt eindeloos je data schoonschrobben, en met 100 miljoen mails en 500 miljoen berichten zal er altijd wel privacygevoelige data in blijven zitten.

Het echt kwalijke hier is dat je deze AVG schendingen vroeger misschien nog door de vingers kon zien, vanuit een praktisch oogpunt: sure, in je archief zitten persoonlijke gegevens zelfs nadat je echt je verdomde best deed om het te scrubben, maar niemand die dat nog inkijkt en verbanden gaat leggen tussen een chatbericht hier en een email daar om zo te achterhalen wat de identiteit is van een bepaalde gebruiker.
Maar een AI model dat op die data wordt getraind? Diens taak is het net om verbanden te zoeken en het lijkt me dus dat we dan extra voorzichtig moeten zijn.
Ze hebben AI gebruikt om te anonimiseren :+ /s
"Google zegt tegen nieuwssite Axios de data door een derde partij te laten opschonen om ervoor te zorgen dat de informatie volledig geanonimiseerd is."

Dat suggereert dat de data niet volledig geanonimiseerd is op het moment dat Google het in handen krijgt.

Of het bericht spreekt zichzelf tegen.

Dus het blijft een kwestie van goed vertrouwen wat Google ermee doet als het wel klopt wat er staat.
Nee, dat zegt dat de verkoper een derde partij inschakelt om de data volledig te anonimiseren voordat het Google bereikt.
Nee, het blijft een kwestie van goed vertrouwen. Google heeft de data gekocht en heeft nu een derde partij ingeschakeld voor het anonimiseren maar dat geeft geen enkele garantie dat diezelfde data later alsnog anders gebruikt gaat worden. De data met prive gegevens blijft zo bestaan om in de toekomst gebruikt te kunnen worden, door Google of een andere partij die de data ooit van Google kan krijgen.
Google heeft nog niets gekocht, een rechter moet er nog over beslissen of verkoop doorgang mag vinden of niet. Het zou daarnaast gek zijn als Google eerst de data koopt, maar voordat het de data kan/mag gebruiken, het zelf eerst langs een derde partij haalt die de data anonimiseert.

Het lijkt me dan dus veel logischer als het dus eerst langs de derde partij gaat die data anonimiseert voordat een partij als Google er iets mee kan/mag doen.

[Reactie gewijzigd door CH4OS op 18 augustus 2026 12:52]

Heel mooi statement van Google, maar ik snap de cynisch houden wel ten aanzien van Google. Als ik lees dat google de data echt anonimiseert dan neem ik dat met een flinke bak zout. Er zijn en waren enorm veel privacy rechtszaken tegen Google omdat zo continue de privacy van hun eigen gebruikers al niet serieus nemen.

Dan bekruipt mij het gevoel dat de privacy van de medewerkers of klanten van een failliet bedrijf al helemaal niet serieus genomen wordt. Inmiddels mogen we er toch wel vanuit gaan dat een bedrijf als Google privacy niet erg hoog in het vaandel hebben.
Dat klopt. Maar omdat het om veel data gaat en zoals anderen hieronder aangeven, is de kans dat er toch iets doorheen glipt, best realistisch.

Bovendien wordt er een derde partij erbij gehaald om de data te anonimiseren en derde partijen hebben de laatste tijd steeds vaker een rol in grote data lekken.
Als je het artikel ook had gelezen:

Klantendata zit voor zover bekend dus niet bij de data. De data is volgens de verkopende partij ook geanonimiseerd en Google mag ook niet proberen de data alsnog aan mensen te koppelen. De data zou dus niet te herleiden moeten zijn tot specifieke Spirit-werknemers.
Ik heb het artikel goed gelezen.

Ik stel alleen vraagtekens bij de mogelijkheid zoveel data te kunnen anonimiseren. Zoals anderen ook al aangeven hierboven, dat is bijna onmogelijk. Hoe meer data, hoe meer er te fingerprinten is. En Google heeft al een oceaan aan data, die ze maar al te graag gebruiken om jou van hele gerichte reclame te voorzien.
Dan heb je de derde alinea gemist denk ik:
Klantendata zit voor zover bekend dus niet bij de data. De data is volgens de verkopende partij ook geanonimiseerd en Google mag ook niet proberen de data alsnog aan mensen te koppelen. De data zou dus niet te herleiden moeten zijn tot specifieke Spirit-werknemers.
In de tweede alinea staat dan overigens de opmerking dat het vooral over interne bedrijfsdata gaat.

[Reactie gewijzigd door CH4OS op 18 augustus 2026 12:27]

Yeah, right. Google heeft al zoveel informatie over wereldburgers dat het haast wel mogelijk moet zijn om data te koppelen aan personen. En mail en chat? Daar zit heus ook data van klanten in. Slim van google, maar dit is bijna net zo erg als een database die bij een hack wordt buitgemaakt.
Daarom dat de data voordat het bij Google komt eerst langs een derde partij gaat, die de volledige data set volledig anonimiseert:
Google zegt tegen nieuwssite Axios de data door een derde partij te laten opschonen om ervoor te zorgen dat de informatie volledig geanonimiseerd is.

[Reactie gewijzigd door CH4OS op 18 augustus 2026 12:32]

Hoe groot achten we vervolgens de kans om volgende week een nieuwsbericht te lezen met de titel: "Partij ABC verliest klantdata Spirit Airlines door hack"
Als ik Google was zouden me de personen geen sodemieter interesseren maar des te meer hoe ik een AI kan aanleren hoe ik een grote, logistieke organisatie in een dynamisch speelveld kan runnen en welke activiteiten welke gevolgen hebben.

Het zal daar ook eerder om gaan dan de vliegbewegingen van Pietje Puk, gegevens die sowieso in tig andere systemen zijn vastgelegd.
Probleem is dat je dat een AI niet kan 'leren' want dat vereist inhoudelijke kennis, redeneren, en strategie. Dingen die fundamenteel niet kunnen met een "AI" (ofwel een taalmodel). Een grootschalig taalmodel draait eigenlijk bijna alleen op patronen en statistiek, en kan die patronen extrapoleren. Het heeft geen flauw idee van waarom bepaalde patronen ontstaan, als je het op taal betrekt, bijvoorbeeld hoe grammatica eigenlijk in elkaar steekt (tenzij je daar expliciet regels voor inprogrammeert). Zo'n model ziet alleen dat in 999 van de 1000 gevallen een persoonsvorm na een onderwerp komt dus zal dat in de rest van de gevallen ook zo zijn.
Het is ook niet gezegd dat er alleen een llm op losgelaten wordt. Google heeft bijvoorbeeld DeepMind die van heel andere AI modellen gebruik maken.
hoe ik een AI kan aanleren hoe ik een grote, logistieke organisatie in een dynamisch speelveld kan runnen en welke activiteiten welke gevolgen hebben.
Kan je dan niet beter de data van een bedrijf kopen dat niet failliet is gegaan :P
Waarschijnlijk wel maar ik denk niet dat KLM hierom staat te springen en van fouten kun je leren :)
Klantendata zit voor zover bekend dus niet bij de data. De data is volgens de verkopende partij ook geanonimiseerd en Google mag ook niet proberen de data alsnog aan mensen te koppelen. De data zou dus niet te herleiden moeten zijn tot specifieke Spirit-werknemers.
Serieuze vraag: dit kun je tegenwoordig toch niet meer beweren. Deze ´belofte´ is voldoende om deze data te geven aan het grootste dataslurper ter wereld?!?

[Reactie gewijzigd door Ynst2003 op 18 augustus 2026 12:22]

Zelfs al zou deze data volledig geanonimiseerd zijn, dan hebben de werknemers die deze data hebben gecreëerd geen toestemming gegeven dat dit gebruikt mag worden voor AI doeleinden. Achteraf natuurlijk niet aan te tonen of jouw data is gebruikt (als werknemer) maar nog steeds vind ik het heel vreemd dat zoiets gewoon verhandeld mag worden.
Het is heel normaal dat in je arbeidsovereenkomst staat dat alle output die je levert tijdens je werk eigendom is en blijft van je werkgever.
Ja en nee, die overeenkomst gaat voornamelijk over dingen die jij geproduceerd hebt namens/voor het bedrijf.

De overeenkomst was nooit bedoeld voor het doorverkopen van "persoonlijke data" aan een databoer om AI te trainen. Dit is puur weer een bedrijf dat een maas in de huidige afspraken/wetten probeert te gebruiken om data op te slurpen.

Ja de data is eigendom van het bedrijf, maar het kan niet de bedoeling zijn dat dit verkocht wordt aan een 3e partij met een compleet andere business case.
Daarom dat nu dus een rechter erover beslist of Google de data mag opkopen.
Hoezo? Een derde partij gaat de data eerst anonimiseren voordat het Google bereikt;
Google zegt tegen nieuwssite Axios de data door een derde partij te laten opschonen om ervoor te zorgen dat de informatie volledig geanonimiseerd is.
Dat maakt het al moeilijker voor Google om dit te doen.

[Reactie gewijzigd door CH4OS op 18 augustus 2026 12:34]

Dataset Spirit Airlines

Medewerker X mailt medewerker Y over een klacht die Persoon A heeft over een vlucht HV9234 die 8 uur vertraging had en dus overnachting heeft moet boeken, die niet tevreden is met de standaard vergoeding die Spirit Airlines biedt.


Dataset 1 Google:

Persoon M zoekt wat er te doen in Stad C

Persoon M zoekt hotel in Stad C

Persoon M ontvangt mailtje met bevestiging van vlucht HV9234 (Gmail)

Persoon M zoekt op dag van vertraging vlucht HV9234 een hotel Stad D


Dataset 2 Google:

alle data van alle vliegtuigbewegingen wereldwijd inclusief realtime alle vertragingen


Zou het kunnen dat Persoon A in dataset Spirit Airlines misschien wel Persoon M in Dataset 1 van Google? Percentagewijs?

Voor mij is het zeer lastig om Google op hun blauwe ogen te geloven dat ze al deze datasets niet aan elkaar koppelen. En Google heeft miljoenen datasets/-punten die ze kunnen combineren, zeer krachtige AI en miljarden dollars.. Hoe meer ze combineren, hoe zeker ze ze zijn.

[Reactie gewijzigd door Ynst2003 op 18 augustus 2026 12:49]

Geen idee, daarom dat een derde partij de data anonimiseert. En of dat effectief gaat werken ja of nee, geen idee dus. Bedenk echter wel, dat er ook een rechter over gaat buigen of deze verkoop überhaupt doorgang mag vinden of niet, dus Google heeft op het moment ook nog niets.
dat is mijn punt. hoe veel verder kun je het anonimiseren.

Persoon A heeft een klacht over een vlucht die te laat is en het niet eens is het de vergoeding.

(Geen tijd, geen datum, geen vluchtnummer, geen ´van stad X naar stad Y´)

Als je ze zo ver gaan met anonimiseren, zou het misschien kunnen.
Dat kan in dit geval niet want HV9234 is een vlucht van Transavia. :+
Dat is HV5234, aldus Google.
Toch fijn om even een bewust wording te krijgen dat alles wat je ooit via je zakelijke email en teams heb verstuurd door willekeurige derde commerciële partij gebruikt kan worden mocht het raar lopen.
En natuurlijk je volledige dossier wat bij HR inc. hoe hoe je presteert en of je vaak ziek bent.

maar gelukkig is de data geanonimiseerd.
en is er afgesproken dat data niet herleid mag worden.
Net zoals werknemers in het verleden toch wel mochten verwachten dat hun persoonlijke (geanonimiseerde) data niet in bulk aan een mega corp verkocht zou worden.
Daarom dat ook een rechter hierover zich gaat buigen en bepalen of deze verkoop doorgang mag vinden.
Net zoals werknemers in het verleden toch wel mochten verwachten dat hun persoonlijke (geanonimiseerde) data niet in bulk aan een mega corp verkocht zou worden.
Dat mag je niet verwachten in de VS, alles wat je doet voor je werkgever is eigendom van de werkgever, van uitvindingen tot chats. En omdat die blijkbaar geld waard zijn, moet de partij die het faillissement afhandelt die data verkopen om schuldeisers te betalen. In deze maatschappij is informatie eenvoudig geld waard en zelfs bijzonder ruwe data zoals in dit geval heeft nog een waarde.

Of dat juist is, moet je zelf beslissen. Ik zou er wel voor zijn om het verkopen van bepaalde data van een failliet bedrijf te verbieden, maar het is moeilijk om grenzen te trekken. Als ik een bedrijf koop, heb ik tenslotte ook toegang tot alle data van dat bedrijf.
Nu maar hopen dat de AI die ze hier mee trainen niet dezelfde fouten gaat maken wat tot het faillissement van Spirit Airlines heeft geleid }>
Google koopt voor 10 miljoen dollar veel bedrijfsdata van Spirit Airlines
10 miljoen. Een koopje noemen we dat. En waarschijnlijk gaat het veeel meer opleveren
Wat ik me ook wel afvraag, waar gaat deze 10M naartoe dan? Het bedrijf is failliet immers. En ja, meestal als een partij failliet gaat, zijn diens eigendommen vaak een koopje, omdat de gebruikswaarde van de eigendommen niet heel groot meer is.
als een bedrijf failliet is, dan bepaalt de curator wie er als eerste betaald moet worden.

Zij hebben een lijst met schuldeisers. Belastingdienst en banken staan over het algemeen bovenaan. Daarna komen de schuldeisers aan de beurt. Vanuit het oogpunt van de curator is het zeer logisch dat deze dataset wordt verkocht (zoveel mogelijk geld binnen halen voor de schuldeisers).
Het wordt natuurlijk steeds moeilijker voor bedrijven om nog originele sec door mensen geschreven tekst te vinden die ze goedkoop kunnen omzetten naar Ai-modellen.

Dus dan is dit wel een slimme stap.

Om te kunnen reageren moet je ingelogd zijn