Prijava

Vpliv podatkov in umetne inteligence na znanstveno produkcijo

Politični pogled na to, kako lahko FAIR podatki in upravljanje z umetno inteligenco ohranita zaupanja vredno znanstveno produkcijo.

Avtorji:

Portret Barenda Monsa

Barend mons, zaslužni profesor Univerze v Leidnu, član upravnega odbora fundacije GO FAIR in direktor LIFES, Leidenske pobude za FAIR in pravično znanost

Portret Arieja Baaka

Arie Baak, članica upravnega odbora združenja LIFES za pošteno in pravično znanost

Portret Koena Jonkersa

Koen Jonkers, Evropska komisija, Skupni raziskovalni center (JRC), Bruselj, Belgija

Umetna inteligenca spreminja način izvajanja, komuniciranja in potrjevanja znanosti. Je resnično obetavna, saj omogoča prepoznavanje vzorcev v obsegu, ki ga noben človeški raziskovalec ne more doseči, pospešuje delovne procese in odpira nove možnosti za odkritja. Vendar je umetna inteligenca tudi hitra, ni brez napak in je neselektivna, medtem ko je znanost zamudna in natančna po zasnovi. Napetost med tema dvema realnostma že povzroča resne disfunkcije: poplavo publikacij in podatkov, ki jih ustvarja umetna inteligenca, degradirano medsebojno ocenjevanje, halucinirane ugotovitve in spodkopano zaupanje v znanstvene zapise. Spretnosti, ki se zahtevajo od bodočih znanstvenikov, se temeljito spreminjajo, znanstvena politika pa temu ne sledi. Odprava te vrzeli je nujna.

Umetna inteligenca spreminja način dela na področju znanosti

Znanost se je z izjemno hitrostjo premaknila iz okolja, kjer so bili podatki redki, v okolje, bogato s podatki. Kjer so raziskovalci nekoč ustvarjali skromne nabore podatkov in sporočali ugotovitve predvsem prek člankov, ki jih lahko berejo ljudje, zdaj delujejo v dobi eksponentnega ustvarjanja podatkov. Večina teh podatkov je visokodimenzionalnih, porazdeljenih in jih lahko obdelujejo le stroji. Vendar se ta trend ne odraža v dejanski ponovni uporabi podatkov. Da bi to spremenili, je treba podatke same obravnavati kot prvovrsten znanstveni rezultat, ne pa kot stranski produkt člankov.

Stroji blestijo pri iskanju vzorcev v velikih in kompleksnih naborih podatkov. Vendar stroji nimajo inherentnega konceptualnega modela realnosti, relevantne za človeka. Rezultat je skoraj neomejena zaloga vzorcev, mnogi lažni, nekateri zavajajoči. Osrednji izziv za naslednjo generacijo znanstvenikov bo krmarjenje po tej džungli vzorcev: razlikovanje smiselnega signala od statističnega šuma. Človeški nadzor ni neobvezen; je strukturno potreben.

Oblikovalci politik bi se morali zavedati tudi, da umetna inteligenca v znanosti sega daleč preko modelov velikih jezikov, ki trenutno prevladujejo v javnem diskurzu. Širša krajina vključuje strojno učenje za ustvarjanje hipotez, avtomatizirane eksperimentalne poteke dela in sklepanje na podlagi grafov znanja, pri čemer vsak nosi svoja tveganja in priložnosti, ki zahtevajo prilagojene odzive upravljanja.

Kakovost podatkov in infrastruktura sta ozko grlo

Kakovost rezultatov umetne inteligence v znanosti je neposredno odvisna od kakovosti podatkov. vhodPodatki FAIR (Findable, Accessible, Interoperable and Reusable, vse bolj razumljeni kot Fully AI Ready - popolna uporaba umetne inteligence) so temeljni pogoj za odgovorno znanost, ki jo vodi umetna inteligenca. Brez njih se modeli umetne inteligence učijo na surovi, neurejeni, potencialno pristranski ali celo izmišljeni vsebini, kar povzroča halucinacije, ki so lahko smrtno nevarne v kliničnih kontekstih in sistematično spodkopavajo zaupanje v znanost. Še posebej tam, kjer ponovno uporabo zlahka dostopnih podatkov večinoma izvajajo akterji, ki niso znanstveno utemeljeni, kot so sedanja podjetja za magisterij iz znanosti (LLM).

Enako pomembna je uporaba konceptualnih modelov FAIR za omejevanje umetne inteligence. izhodiZ zagotavljanjem strukturiranih semantičnih okvirov, kjer je vsak koncept dobro opredeljen, kako so povezani in kaj šteje za veljavno sklepanje, ti modeli znatno zmanjšajo tveganje za halucinacije in pomagajo zagotoviti, da ugotovitve, ki jih ustvari umetna inteligenca, ostanejo razložljive, interpretativne in preverljive za ljudi.

Kriza integritete v znanstvenem objavljanju ta tveganja še povečuje. Sistemi umetne inteligence lahko zdaj skoraj v trenutku ustvarijo članke, podatke in preglede, ki so videti verodostojni. Ena vodilna konferenca o umetni inteligenci je samo v letu 2025 prejela več kot 20,000 prispevkov. Odziv (znanstveniki, ki uporabljajo umetno inteligenco za pregledovanje člankov, ustvarjenih z umetno inteligenco) tvega nastanek zaprte povratne zanke šuma, v kateri se pomanjkljivi sistemi medsebojno ocenjujejo brez smiselnega zunanjega preverjanja. Podatki FAIR, objavljeni pri viru, kjer je mogoče preveriti izvor, so med najmočnejšimi orodji, ki so na voljo za preprečevanje tega trenda.

Vse to je posledica strukturne pomanjkljivosti v spodbudah. ​​Raziskovalci so še vedno pretežno nagrajeni za število člankov in stopnjo citiranja, kar je metrika, zasnovana za obdobje redkih podatkov. Objavljanje visokokakovostnih podatkov FAIR prinaša malo strokovnega priznanja in ni zagotovljenega financiranja. To se mora spremeniti.

Vrzeli v upravljanju so hude

Pokrajina tehničnega upravljanja podatkov v znanosti je v krizi. Desetletja odvisnosti od majhnega števila velikih ponudnikov storitev v oblaku so v kombinaciji s pravnimi instrumenti, kot je ameriški zakon o oblaku, ustvarila problem suverenosti podatkov, ki je zdaj pereč, zlasti glede na nedavno nestabilnost politike ZDA in njene učinke na mednarodno skupno raziskovalno infrastrukturo. Številni ključni svetovni viri znanstvenih podatkov so dejansko zunaj jurisdikcionalnega nadzora institucij in skupnosti, ki so jih ustvarile.

Načela FAIR, ki jih dopolnjujejo načela CARE (ki obravnavajo pravice in interese domorodnih ljudstev pri upravljanju podatkov), zagotavljajo skladen okvir za odgovorno upravljanje. Skupaj opredeljujejo pogoje, pod katerimi naj bi bili podatki odprti ali omejeni, ponovno uporabni in suvereni. Koncept interneta podatkov in storitev FAIR (IFDS), v katerem podatki ostanejo pri viru in jih obiščejo pooblaščeni algoritmi, namesto da se kopirajo in centralizirajo, ponuja praktičen arhitekturni odgovor. V tem modelu računske poizvedbe potujejo do porazdeljenih podatkovnih vozlišč; podatki ne potujejo v centralizirana skladišča, razen če se to ne more izogniti.

Pravična udeležba v znanosti, ki jo poganja umetna inteligenca, zahteva tudi, da je ta infrastruktura resnično dostopna. Institucije in skupnosti na globalnem jugu ne morejo biti pasivni subjekti ponovne uporabe podatkov. Na drugem koncu spektra povezljivosti ne smemo izključiti podatkovno intenzivne industrije. Porazdeljena infrastruktura FAIR, zasnovana tako, da se izognemo vezavi na prodajalca in enotnim točkam odpovedi, je mehanizem, s katerim postane smiselna udeležba mogoča.

Kaj bi morali storiti oblikovalci politik

Skladen politični odziv zahteva ukrepanje na več področjih:

  • Zahtevajte standarde podatkov FAIR v javno financiranih raziskavah. Financerji bi morali objavo podatkov FAIR postaviti kot pogoj za dodelitev nepovratnih sredstev, ne pa kot priporočilo.
  • Objavljanje podatkov in FAIRification se štejeta za upravičene stroške nepovratnih sredstev. Naložba, potrebna za ustvarjanje visokokakovostnih, strojno uporabljivih podatkov, mora biti prepoznana in pokrita.
  • V predlogih za nepovratna sredstva omogočite ponovno uporabo predhodno ustvarjenih podatkov in upravičenih raziskovalnih stroškov podporne infrastrukture.Naložbo, potrebno za shranjevanje in zagotavljanje visokokakovostnih, strojno uporabljivih podatkov, je treba prepoznati in pokriti.
  • Podpirajte standarde, ki temeljijo na skupnosti, namesto rešitev, ki jih vodijo prodajalci. Odprta, interoperabilna infrastruktura, zgrajena na minimalnih skupnih standardih, preprečuje vezavo na določeno platformo in zagotavlja enake konkurenčne pogoje.
  • Vlagajte v znanstveno pismenost. Poleg znanstvenikov morajo tudi državljani, novinarji in oblikovalci politik delovno razumevanje zmogljivosti in omejitev umetne inteligence. Razkorak med javnim dojemanjem in tehnično realnostjo predstavlja tveganje za upravljanje.
  • Uvesti zahteve glede izvora in preglednosti za umetno inteligenco, ki se uporablja v raziskavah. Vsak sistem umetne inteligence, ki prispeva k objavljenim znanstvenim ugotovitvam, bi moral biti dolžan razkriti izvor učnih podatkov ter omejitve in omejitve modela.

Znanost je svetovna javna dobrina. Njene integritete, pravičnosti in odprtosti ni mogoče predpostavljati; zahtevajo aktivne politične odločitve. Možnost vzpostavitve dobrega upravljanja umetne inteligence v znanstveni produkciji je odprta, vendar ne bo ostala v nedogled. Odločitve, ki so bile sprejete zdaj glede podatkovnih standardov, infrastrukture, spodbud in nadzora, bodo določile, ali bo umetna inteligenca pospeševala zaupanja vredno znanost ali jo sistematično spodkopavala.


Foto: Getty Images za Unsplash+

Ta blog, ki ga gostita Mednarodni znanstveni svet (ISC) in Frontiers Policy Labs, je del Novo upravljanje znanosti v 21. stoletju" serija, ki služi kot dinamičen forum za razpravo o prihodnosti znanstvenega upravljanja in miselnosti. Pobuda se oddaljuje od togih akademskih študij in združuje vodilne svetovne glasove, da bi predstavili ostra, provokativna, a na dokazih temelječa in napredna mnenja. S tem želi prispevati k opredelitvi odpornega, vključujočega in preglednega modela upravljanja, ki je pripravljen na izzive prihodnosti.

Glej originalno objavo tukaj.

Zavrnitev odgovornosti
Informacije, mnenja in priporočila, predstavljena v naših gostujočih blogih, so mnenja posameznih sodelavcev in ne odražajo nujno vrednot in prepričanj Mednarodnega znanstvenega sveta.

Bodite na tekočem z našimi glasili