Ερευνητές αγνοούν την απαγόρευση και χρησιμοποιούν AI στην αξιολόγηση άρθρων

Από Trantorian 29 Σεπτεμβρίου 2026 1 λεπτό ανάγνωσης
Ερευνητές αγνοούν την απαγόρευση και χρησιμοποιούν AI στην αξιολόγηση άρθρων

Η απαγόρευση χρήσης AI από τους ερευνητές για την αξιολόγηση της αξίας επιστημονικών άρθρων δεν φαίνεται να αλλάζει ιδιαίτερα τα συμπεράσματα των κριτών. Σε μεγάλο βαθμό, αυτό συμβαίνει επειδή πολλοί αγνοούν την απαγόρευση και χρησιμοποιούν AI ούτως ή άλλως.

Μια ομάδα με επικεφαλής επιστήμονες υπολογιστών στο Microsoft Research πραγματοποίησε ένα μεγάλο τυχαιοποιημένο πείραμα κατά τη διάρκεια του 2026 International Conference on Machine Learning (ICML), ενός από τα μεγαλύτερα συνέδρια τεχνητής νοημοσύνης στον κόσμο, που έγινε τον Ιούλιο στη Σεούλ της Νότιας Κορέας.

Στο συνέδριο υποβλήθηκαν 24.661 άρθρα, τα οποία χρειάστηκε να αξιολογηθούν από 17.886 κριτές. Όταν οι ερευνητές υπέβαλαν τις εργασίες τους, μπορούσαν να επιλέξουν τον τρόπο αξιολόγησης. Η πρώτη επιλογή ήταν να εξεταστούν από κριτές που ακολουθούσαν μια αυστηρή πολιτική, η οποία απαγόρευε πλήρως τη χρήση μεγάλων γλωσσικών μοντέλων (LLMs) για βοήθεια στην αξιολόγηση. Η άλλη επιλογή ήταν η αξιολόγηση από κριτές που ακολουθούσαν μια πιο επιτρεπτική πολιτική, η οποία επέτρεπε τη χρήση LLMs για να κατανοήσουν καλύτερα τα άρθρα, να ελέγξουν σχετική βιβλιογραφία και να βελτιώσουν τη διατύπωση των δικών τους κειμένων, αλλά όχι για να κρίνουν την αξία μιας εργασίας ή να συντάξουν την αξιολόγηση.

Οι επιστήμονες προτιμούν τα σχόλια του ChatGPT από την κρίση των ομότιμών τους

Η ομάδα του Microsoft Research διαπίστωσε ότι τα άρθρα που αξιολογήθηκαν υπό τις δύο πολιτικές είχαν σχεδόν ίδια ποσοστά αποδοχής — 27% με την αυστηρότερη πολιτική και 26,5% με την πιο επιτρεπτική — ενώ οι μέσες βαθμολογίες των αξιολογήσεων ήταν 3,31 και 3,32 στα 6, αντίστοιχα. Η εμπιστοσύνη των κριτών παρέμεινε επίσης σχεδόν αμετάβλητη. Οι αξιολογήσεις που γράφτηκαν υπό την πιο επιτρεπτική πολιτική ήταν περίπου 5,5% έως 7% μεγαλύτερες και κρίθηκαν ελαφρώς καλύτερες σε ποιότητα από ειδικούς, αν και η σύγκριση ανά κριτή δεν έδειξε ουσιαστική διαφορά.

Ο λόγος για αυτή την έλλειψη διαφοράς έγινε σαφής μετά από ανώνυμη έρευνα σε 1.486 κριτές που συμμετείχαν στη διαδικασία. Εκεί, το 22,5% των κριτών που είχαν λάβει οδηγία να μην χρησιμοποιήσουν AI παραδέχτηκαν ότι χρησιμοποίησαν LLM ούτως ή άλλως. «Η αυτοαναφερόμενη μη συμμόρφωση του 23% είναι σίγουρα υψηλότερη από ό,τι περίμενα», λέει ο Miro Dudík από το Microsoft Research, που συμμετείχε στη μελέτη και ήταν επίσης ένας από τους διοργανωτές του συνεδρίου.

Όσοι χρησιμοποίησαν AI ενώ τους είχε ζητηθεί να μην το κάνουν, το έκαναν για να βρουν ιδέες για σχόλια, να συντάξουν το κείμενο της αξιολόγησης, να διαβάσουν τα άρθρα και να συνοψίσουν τα δυνατά και αδύνατα σημεία τους. «Η μετασυνεδριακή μας έρευνα αποκαλύπτει ορισμένους λόγους για τους οποίους οι κριτές μπορεί να παραβιάζουν την πολιτική, όπως ο μεγάλος φόρτος εργασίας και οι ανεπαρκώς σαφείς κανόνες», λέει ο Dudík.

«Η μελέτη δείχνει ότι η απαγόρευση του AI στο peer review είναι πολύ δύσκολο να εφαρμοστεί», λέει ο Kayvan Kousha από το University of Wolverhampton στο Ηνωμένο Βασίλειο. «Λόγω του φόρτου εργασίας των ακαδημαϊκών, υπάρχει ο πειρασμός» να χρησιμοποιήσουν AI, λέει ο Kousha.

Σε ξεχωριστό μέρος της μελέτης, οι ερευνητές ανέλυσαν τις αξιολογήσεις με το Pangram, έναν ανιχνευτή κειμένου AI. Διαπίστωσαν ότι μόνο το 52,2% των αξιολογήσεων υπό την αυστηρή πολιτική χαρακτηρίστηκαν ως γραμμένες αποκλειστικά από άνθρωπο, σε σύγκριση με το 37,0% υπό την πιο επιτρεπτική πολιτική — αν και οι ερευνητές προειδοποιούν ότι οι ανιχνευτές κειμένου AI δεν είναι τέλειοι.

«Πιστεύω ότι η δουλειά μας έχει χρήσιμα συμπεράσματα και για άλλα συνέδρια της επιστήμης των υπολογιστών — και πιθανώς και για διοργανώσεις σε άλλους τομείς — που αντιμετωπίζουν παρόμοιες προκλήσεις», λέει η Sunnie S. Y. Kim από το Microsoft Research.

arXiv DOI: 10.48550/arXiv.2609.19420

Το παρόν κείμενο δημιουργήθηκε με τη χρήση τεχνητής νοημοσύνης.