Instituti Teknologjik të Masaçusetsit grupi i të dhënave , duke përfshirë një koleksion të annotuar me 80 milion imazhe të vogla me rezolucion 32×32. Grupi është mb supported nga një ekip që zhvillon teknologji të vizionit kompjuterik dhe është përdorur që nga viti 2008 nga kërkues të ndryshëm për trajnim dhe verifikim të njohjes së objekteve në sistemet e mësimit të makinerisë.
Arsyeja për heqjen ishte përdorimi i termave racistë dhe seksistë në etiketat që karakterizojnë objektet e paraqitura në imazhe, si dhe pranimi i imazheve që perceptoheshin si ofendues. Për shembull, ishin të pranishme imazhe të organeve gjenitale me terma argotë, imazhe të disa grave që karakterizoheshin si "prostituta", dhe terma të papranueshëm në shoqërinë moderne për njerëzit me ngjyrë dhe aziatikët.
Megjithatë, në dokumentin e cituar nga MIT, përmenden edhe probleme më të rënda me këto koleksione: teknologjitë e vizionit kompjuterik mund të përdoren për të zhvilluar sisteme të njohjes së fytyrës, për të kërkuar anëtarët e grupeve të ndaluara për ndonjë arsye; një rrjet neural për gjenerimin e imazheve mund të rikuperojë origjinalin nga të dhënat e anonimizuara.
Shkaku i shfaqjes së fjalëve të papranueshme ishte përdorimi i një procesi të automatizuar, i cili përdor lidhje semantike nga një bazë të dhënash leksikore në gjuhën angleze , e krijuar në vitet '80 në Universitetin e Prinstonit. Duke qenë se nuk ishte e mundur të verifikohej manualisht eprania e leksikut ofendues në 80 milion imazhe të vogla, u mor vendimi për të mbyllur plotësisht aksesin në bazën e të dhënave. MIT gjithashtu i bëri thirrje kërkuesve të tjerë të ndalonin përdorimin e kësaj koleksioni dhe të fshin kopjet e saj. Problemet e ngjashme shihen edhe në bazën më të madhe të annotuar të imazheve , në të cilën gjithashtu përdoren lidhjet nga WordNet.
Burimi: opennet.ru
