Näihin kolmeen sivustoon tekoäly luottaa vastauksissaan

Lähes kaikki kielimallit hyödyntävät vastauksissaan Wikipediaa, Reutersia ja Yhdysvaltain hallinnon verkkosivustoja.

Kielimallit nojaavat vahvasti tiettyihin verkkosivustoihin, kun ne tuottavat vastauksia käyttäjien kysymyksiin. Tekoälyä koskevassa Muck Rackin selvityksessä analysoitiin yli miljoona ChatGPT:n, Googlen Geminin ja Anthropicin Clauden tuottamaa vastausta. Tulokset osoittavat selvästi, että tietyt lähteet korostuvat toistuvasti.

Selvityksen mukaan kielimallien suosituimmat lähteet ovat Wikipedia, Reuters ja Yhdysvaltain hallinnon verkkosivustot (esimerkiksi whitehouse.gov tai cdc.gov). Näihin viitataan lähes kaikkien kielimallien vastauksissa riippumatta aihealueesta. Kyseiset lähteet tarjoavat kattavaa, luotettavaa ja usein neutraaliksi koettua tietoa, mikä tekee niistä houkuttelevia tekoälyn näkökulmasta.

Journalististen lähteiden merkitys kasvaa ajankohtaisaiheissa

Kun kielimalleilta kysytään erityisesti nykytapahtumiin tai uutisiin liittyviä kysymyksiä, journalististen lähteiden osuus kasvaa jopa puoleen kaikista viittauksista. Uutistoimistot ja mediatalot nousevat silloin tärkeään rooliin tekoälyn tiedonlähteinä.

Samaan aikaan tekoälymallien käyttämiin lähteisiin vaikuttaa merkittävästi kysymyksen muotoilu. Esimerkiksi tarkkoihin lainsäädäntöön tai viranomaistietoihin liittyvät kysymykset nostavat esiin virallisia lähteitä, kun taas historiaa tai populaarikulttuuria koskevissa kysymyksissä Wikipedia on hallitseva.

Kumppanuudet vaikuttavat lähdevalintoihin

Kaikki lähdevalinnat eivät kuitenkaan perustu pelkästään sisällön luotettavuuteen. Muck Rackin selvityksessä tuodaan esiin, että osa lähteiden käytöstä voi heijastaa tekoäly-yhtiöiden tekemiä kumppanuuksia. Esimerkiksi uutissivusto Axios ei näy laajasti eri mallien lähteissä, mutta OpenAI:n kehittämä ChatGPT käyttää Axiosia usein. Taustalla on Axiosin ja OpenAI:n välinen yhteistyösopimus.

“Jos sivusto ei näy tekoälyssä, se ei näy lainkaan”

Muck Rackin toimitusjohtaja Greg Galant korostaa tiedotteessa, että tekoälyn suosimilla lähteillä on yhä suurempi vaikutus siihen, millainen tieto saa näkyvyyttä verkossa.

– Jos sivusto ei näy tekoälyn generoimassa vastauksessa, se ei näy lainkaan, Galant toteaa.

Tämä herättää kysymyksiä paitsi tiedon saatavuudesta ja monipuolisuudesta, myös pienempien julkaisijoiden näkyvyydestä tekoälyn ohjaamassa tietoympäristössä.