Massachusettsi Tehnoloogiainstituut andmekogum , mis sisaldab 80 miljoni väikese pildi annotatsioonidega kogumit, mille resolutsioon on 32×32. Kogumit toetas rühm, mis arendab arvutinägemise tehnoloogiaid, ja seda on alates 2008. aastast kasutanud mitmed teadlased objektide tuvastamise koolitamiseks ja testimiseks masinõppes.
Eemaldamise põhjuseks oli rassistlike ja naistevastaste terminite kasutamine siltides, mis iseloomustasid piltidel kujutatud objekte, samuti piltide olemasolu, mida peeti solvavaks. Näiteks sisaldasid pildid suguelundeid slängiterminitega, mõningaid naisi iseloomustati "prostituudidena", kasutati kaasaegses ühiskonnas vastuvõetamatuid termineid mustanahaliste ja aasialaste kohta.
Kuid MIT viidatud dokumendis nimetatakse ka tõsisemaid probleeme selliste kogumitega: arvutinägemise tehnoloogiaid saab kasutada näotuvastus süsteemide arendamiseks, et otsida ametlikult keelatud rahvusgruppe; pildigeneratsiooni tehisintellekt suudab taastada originaali anonüümsetest andmetest.
Lubamatute sõnade ilmumise põhjuseks oli automatiseeritud protsessi kasutamine, mis klassifitseerimisel tuginemas semantilistele seostele ingliskeelse leksikaandmebaasist. , mis loodi 1980. aastatel Princetoni ülikoolis. Kuna on võimatu käsitsi kontrollida 80 miljoni väikese pildi seas solvava leksika olemasolu, võeti vastu otsus andmebaas täielikult sulgeda. MIT kutsus ka teisi teadlasi üles lõpetama selle kogumi kasutamine ja kustutama selle koopiad. Sarnaseid probleeme esineb ka suurimas markeeritud pildikogus, , kus on samuti kasutatud seoseid WordNet'ist.
Allikas: opennet.ru
