Kriza podataka u doba umjetne inteligencije: Hoćemo li ostati bez goriva za AI modele?

Kriza podataka u doba umjetne inteligencije: Hoćemo li ostati bez goriva za AI modele?

Umjetna inteligencija (UI) trenutno prolazi kroz period nevjerojatnog uspona, transformirajući način na koji radimo, komuniciramo i stvaramo. Međutim, iza spektakularnih mogućnosti alata poput ChatGPT-a ili Midjourneyja krije se jedna kritična potreba: ogromne količine podataka. Upravo ti podaci služe kao “gorivo” za obuku kompleksnih algoritama, ali istraživači i stručnjaci iz tehnološkog sektora počinju slati ozbiljne signale upozorenja. Pitanje koje se nameće nije više samo kako ćemo unaprijediti AI, već hoćemo li uopće imati dovoljno kvalitetnih informacija kako bismo nastavili taj trend rasta.

Zašto je kvaliteta podataka ključna za razvoj AI sustava?

Kada govorimo o treniranju velikih jezičnih modela, kvantiteta je važna, ali kvaliteta je presudna. Da bismo razumjeli razmjere, ChatGPT je za svoju obuku koristio oko 570 gigabajta tekstualnih podataka, što iznosi približno 300 milijardi riječi. Slično stanje je i u svijetu vizualne umjetnosti; model Stable Diffusion oslanjao se na skup podataka LAION-5B, koji sadrži nevjerojatnih 5,8 milijardi parova slika i pripadajućih tekstualnih opisa.

Problem nastaje kada se modeli treniraju na podacima niske kvalitete. Sadržaji s društvenih mreža, mutne fotografije ili neprovjereni forumski dopisi lako su dostupni, ali često nose sa sobom opasne predrasude, dezinformacije ili čak ilegalne sadržaje. Primjer iz prakse pokazuje da su pokušaji treniranja botova na sadržajima s platforme X ( bivši Twitter) ponekad rezultirali generiranjem rasističkih ili mizoginih odgovora. Zbog toga programeri preferiraju strukturirane i provjerene izvore kao što su:

  • Digitalizirane knjige i književna djela;
  • Znanstveni radovi i akademski časopisi;
  • Enciklopedijski sadržaji poput Wikipedije;
  • Filtrirani web članci visokog kvaliteta.

Zanimljivo je da su neki modeli, poput Googleovog asistenta, dodatno “finisirani” korištenjem tisućama romantičnih romana kako bi se postigao prirodniji i konverzacijski ton komunikacije.

Predviđanja o iscrpljivanju digitalnih zaliha

Iako nam se čini da je internet beskonačan izvor informacija, brzina kojom AI modeli “konzumiraju” podatke daleko nadmašuje brzinu kojom ljudi stvaraju novi, kvalitetan sadržaj. Prema određenim istraživanjima, ako se trenutni trendovi nastave, svijet bi mogao ostati bez visokokvalitetnih tekstualnih podataka već do 2026. godine.

Situacija s podacima niže kvalitete je nešto manje kritična, ali i dalje zabrinjavajuća. Procjenjuje se da će zalihe manje kvalitetnih tekstova biti iscrpljene između 2030. i 2050. godine, dok bi se slićan scenarij za slike mogao dogoditi između 2030. i 2060. godine. S obzirom na to da PwC predviđa da bi umjetna inteligencija do 2030. godine mogla doprinijeti svjetskom gospodarstvu s nevjerojatnih 15,7 bilijuna dolara, bilo kakav zastoj u dostupnosti podataka mogao bi značajno usporiti ovaj ekonomski i tehnološki napredak.

Kako tehnološki giganti planiraju preživjeti “glad za podacima”?

Iako zvuči alarmantno, industrija već razvija strategije za ublažavanje ovog rizika. Umjesto da se oslanjaju isključivo na besplatno prikupljanje podataka s weba, programeri istražuju nove putove:

Sintetički podaci: Jedno od najperspektivnijih rješenja je korištenje same umjetne inteligencije za generiranje novih podataka. Stvaranjem sintetičkih skupova informacija, programeri mogu kreirati precizno prilagođene setove podataka koji su čisti, bez predrasuda i optimizirani za specifične potrebe modela.

Digitalizacija offline arhiva: Postoje milijuni stranica teksta, knjiga i dokumenata koji su nastali prije interneta i još uvijek nisu digitalizirani. Ovi repozitoriji predstavljaju neiskorišteni rudnik znanja koji bi mogao produžiti životni vijek obuke AI modela.

Plaćeni sadržaj i licenciranje: Era besplatnog prikupljanja podataka polako završava. Veliki izdavači, poput News Corp-a, već pregovaraju o ugovorima s AI tvrtkama. Ovo ne samo da rješava problem nedostatka podataka, već i stvara pravedniji sustav u kojem autori i kreatori sadržaja dobivaju financijsku kompenzaciju za svoje radove, što je ključno za rješavanje brojnih pravnih sporova koji trenutno vode kreativci protiv tvrtki kao što su OpenAI i Microsoft.

Zaključak

Potencijalni nedostatak podataka za obuku umjetne inteligencije predstavlja jedan od najvećih izazova suvremenog tehnološkog doba. Iako postoji rizik od usporavanja razvoja, ovaj problem prisiljava industriju na inovacije – od efikasnijih algoritama koji zahtijevaju manje podataka do etičnijih modela licenciranja sadržaja. Budućnost AI vjerojatno neće ovisiti o tome koliko podataka možemo “usisati” s interneta, već o tome koliko pametno i etički možemo koristiti one koje već imamo.

Česta pitanja (FAQ)

Što su zapravo sintetički podaci?
To su podaci koji nisu nastali iz stvarnih događaja ili ljudskog ponašanja, već su generirani pomoću algoritama umjetne inteligencije kako bi simulirali stvarne podatke za potrebe obuke.

Zašto nije dovoljno koristiti sve što postoji na internetu?
Internet je pun “šuma” – pogrešaka, pristranosti, duplih sadržaja i niskokvalitetnih tekstova. Ako se AI trenira na takvim podacima, on će ponavljati iste pogreške i proizvoditi netočne ili uvredljive rezultate.

Hoće li nedostatak podataka zaustaviti razvoj AI-a?
Vjerojatno neće potpuno zaustaviti, ali bi mogao promijeniti putanju razvoja. Fokus će se vjerojatno pomaknuti s kvantitativnog rasta (veći

If you like this post you might also like these

More Reading

Post navigation

back to top