فرض کنید سردبیر یا داور همتا هستید و دستنوشتههایی که هنوز بررسی نکردهاید، روی میزتان انباشته شدهاند. بعضی از همکارانتان در حال امتحان کردن ابزارهای داوری مبتنی بر هوش مصنوعی (AI) هستند که میتوانند بخشی از این بار سنگین را کاهش دهند. بعضی از این ابزارها اشتباهات موجود در ارجاعات یا محاسبات را بررسی میکنند. برخی دیگر حتی وعده میدهند که مشخص کنند آیا ادعاهای مطرح شده در یک مقاله قابل اتکا هستند یا خیر، یا اینکه آیا مقاله واقعا دانش جدیدی به آن حوزه اضافه میکند یا خیر. آیا چنین ارزیابیهایی را میخوانید؟ آیا به آنها اعتماد میکنید؟ آیا بر اساس آنها از یک مقاله انتقاد میکنید یا حتی آن را رد میکنید؟
به نقل از ساینس، این پرسشها اکنون برای جامعه علمی اهمیت زیادی پیدا کردهاند؛ جامعهای که سالها است با مشکل سیستم بیش از حد تحت فشار داوری همتا دست و پنجه نرم میکند و حالا با چالشهای عظیم جدیدی روبهرو شده که هوش مصنوعی مولد ایجاد کرده است.
تعداد مقالات علمی طی تنها ۵ سال دو برابر شده و در سال ۲۰۲۵ به بیش از ۸ میلیون مقاله رسیده است. برخی ناشران حتی از افزایش شدیدتر تعداد مقالات ارسالی خبر میدهند؛ افزایشی که بخشی از آن به دلیل دسترسی گستردهتر به مدلهای زبانی بزرگ (LLM) است؛ مدلهایی که میتوانند بعضی پیشنویسهای مقاله را تنها در چند دقیقه تولید کنند.
سردبیران بیش از پیش برای پیدا کردن داورانی که حاضر باشند مقالات را بررسی کنند، با مشکل مواجهاند. این مسئله باعث شده فاصله زمانی بین ارسال مقاله و انتشار آن گاهی ماهها و حتی بیش از یک سال طول بکشد.
آیا هوش مصنوعی میتواند بخشی از راهحل باشد؟
برخی پژوهشگران و ناشران معتقدند هوش مصنوعی باید بخشی از راه حل این مشکل باشد.
طرفداران این ایده میگویند خودکار کردن بخشی از فرایند داوری همتا میتواند روند انتشار مقالات را سریعتر کند و در وقت پژوهشگران صرفهجویی ایجاد کند.
در واقع، تعداد فزایندهای از داوران در حال استفاده از این ابزارها هستند. در یک نظرسنجی جهانی از ۱۶۴۵ پژوهشگر در حوزههای مختلف علمی، کمی بیش از نیمی از پاسخدهندگان گفتند که در سال ۲۰۲۵ از هوش مصنوعی برای انجام وظایف مربوط به داوری استفاده کردهاند؛ از جمله برای کمک به نوشتن نظرات داوری و در برخی موارد برای بررسی روشهای تحقیق و آمار.
این رقم در سال قبل تنها ۲۹ درصد بود؛ این افزایش در حالی اتفاق افتاده که بسیاری از مجلات استفاده از هوش مصنوعی در داوری را ممنوع کردهاند.
اما گروه دیگری از پژوهشگران نسبت به توانایی ماشینها برای ارائه بازخورد قابل اعتماد، تردید دارند؛ به خصوص در مهمترین بخشهای داوری همتا، مانند ارزیابی نوآوری و اهمیت علمی یک مقاله و همچنین در مورد خطرهایی مانند سوگیری و سوءاستفاده از سیستم.
پژوهشگر پسادکتری دانشگاه استنفورد که درباره تاثیرات اجتماعی هوش مصنوعی مطالعه میکند، میگوید: بحران داوری همتا واقعی است و هوش مصنوعی برای کمک به آن امیدوارکننده به نظر میرسد؛ اما اگر با بیمسئولیتی برای خودکار کردن بخش بزرگی از فرایند قضاوت عجله کنیم، ممکن است نتیجه معکوس داشته باشد. باید مطمئن شویم ابزارهایی که به کار میگیریم، برای وظیفهای که به آنها میسپاریم، مناسب هستند.
افزایش سرسامآور استفاده از هوش مصنوعی
همزمان با اینکه هوش مصنوعی مولد روند چندین دههای افزایش تعداد مقالات علمی را سرعت بخشیده است، سردبیران و داوران تلاش میکنند خودشان را به این حجم کار برسانند.
تعداد مقالات منتشرشده از حدود ۱.۲۵ میلیون مقاله در سال ۱۹۹۰ به حدود ۸.۷۵ میلیون مقاله در سال ۲۰۲۵ رسیده است. این افزایش در سالهای اخیر شتاب بیشتری گرفته است.
چت جیپیتی در سال ۲۰۲۲ معرفی شد و سرعت نوشتن مقالات را افزایش داد.
پروژهها و مطالعات آزمایشی برای بررسی تواناییهای هوش مصنوعی در سالهای اخیر به شدت افزایش یافتهاند.
سوال این نیست که آیا هوش مصنوعی میتواند به بهترین داوری انسانی برسد یا نه. سوال این است که آیا داوریِ کمکگرفته از هوش مصنوعی، با استفاده از معیارهای روشن، میتواند از داوری معمول انسانی که تحت تاثیر ناهماهنگی، خستگی و حتی خلقوخو قرار دارد، بهتر عمل کند یا خیر.
در حال حاضر، بیشتر مجلات تا زمانی که سردبیران مشخص کنند هوش مصنوعی چگونه میتواند به ارائه داوری باکیفیت کمک کند، استفاده داوران از ابزارهای هوش مصنوعی را تا حد زیادی ممنوع کردهاند.
داوری انسانی هم مشکلات خودش را دارد
ارزیابیهای داوران انسانی یکی از اجزای حیاتی ارتباطات علمی هستند. با این حال، به گفته پزشک و پژوهشگر حوزه نفرولوژی کودکان در دانشگاه ویرجینیا، این ارزیابیها میتوانند بهشدت ذهنی و سطحی باشند.
او میگوید: زمانی که داوران ایرادهایی را در مقالات او مطرح کردهاند، بعضی از آنها چیزی بیشتر از این ننوشتهاند که نتایج مقاله اشتیاق آنها را کاهش داده است.
او میگوید که این موضوع واقعا آزاردهنده است، چون تمرکز روی علم نیست.
او همچنین میگوید وسوسهای وجود دارد که داوران فقط مقاله را سریع مرور کنند و بررسی کاملی انجام ندهند.
نشان داده شده است که داوران انسانی همچنین تمایل دارند کار پژوهشگران مشهور را بیشتر مورد توجه قرار دهند و گاهی نظرات بسیار تند و انتقادی ارائه کنند.
او معتقد است اگر سیستمهای داوری هوش مصنوعی به درستی طراحی شوند، میتوانند مکمل داوران انسانی باشند یا حتی در برخی زمینهها از آنها بهتر عمل کنند.
هوش مصنوعی ممکن است سازگارتر باشد
مطالعات نیز نشان میدهند که داوریهای تولیدشده توسط ماشین ممکن است ثبات بیشتری داشته باشند.
در یک مطالعه، از هوش مصنوعی و انسانها خواسته شد مقالات کنفرانسی را ارزیابی کنند. امتیازهای ارائه شده توسط ماشینها نسبت به امتیازهای داوران انسانی در محدوده فشردهتری قرار داشتند.
برخی این موضوع را مثبت میدانند، زیرا ممکن است نوعی اصلاح برای داوران انسانی بیدقت باشد.
اما این یکدستی میتواند باعث شکلگیری چیزی شود که آن را «یکنواختی فکری» (intellectual monoculture) مینامند؛ وضعیتی که در آن ایدههای غیرمتعارف و متفاوت ممکن است بیشتر جریمه شوند.
در مقابل، برخی پژوهشگران تنوع بازخوردهایی را که داوری سنتی ارائه میدهد، ارزشمند میدانند.
میکروبیولوژیست در مؤسسه زیستشناسی ماکس پلانک، میگوید: چیزی که در داوری انسانی دوست دارم، این است که سه داور ممکن است سه نظر کاملا متفاوت ارائه دهند؛ چون هرکدام متوجه چیزهای متفاوتی میشوند. به نظر میرسد از دست دادن این ناهمگونی و تنوع در فرایند داوری واقعا ناراحتکننده باشد.
دشوارترین مسئله: آیا مقاله واقعا نوآورانه است؟
داوران اغلب درباره اینکه یافتههای یک مقاله جدید و نوآورانه هستند یا نه، با یکدیگر اختلاف نظر دارند.
این موضوع یکی از وظایف مهم داوری همتا محسوب میشود، اما تعریف دقیق و ارزیابی آن بسیار دشوار است. هوپ و همکارانش از جمله گروههایی هستند که در حال تلاش برای توسعه توانایی هوش مصنوعی در این زمینهاند. روش آنها از یک مدل زبانی بزرگ استفاده میکند تا ادعاهای اصلی مقاله درباره نوآوری را استخراج کند؛ در اینترنت به دنبال مقالات مرتبط و قبلا منتشرشده بگردد؛ آن مقالات را خلاصه کند و بررسی کند مقاله جدید چه تفاوتی با دانش موجود دارد.
در مطالعهای روی ۱۸۲ مقاله ارسالی به یک کنفرانس یادگیری ماشینی، ارزیابان انسانی در بیشتر موارد داوریهای هوش مصنوعی را از نظر ارزیابی نوآوری، حداقل به اندازه داوریهای نوشته شده توسط انسان خوب ارزیابی کردند.
هوش مصنوعی در چه بخشهایی از داوری عملکرد خوبی دارد؟
یکی از حوزههایی که مدلهای زبانی بزرگ احتمالا در آن بسیار خوب عمل میکنند، انجام بررسیهای تکراری، خسته کننده و زمانبر برای یافتن خطاها است؛ بررسیهایی که داوران انسانیِ تحت فشار زمانی ممکن است از آنها صرفنظر کنند.
ناشران سالها است از سیستمهای خودکار استفاده میکنند تا بررسی کنند آیا مقالات سرقت ادبی دارند، آیا روشهای تحقیق به طور شفاف گزارش شدهاند و آیا استانداردهای مختلف را رعایت میکنند یا نه.
پژوهشهای جدید نشان میدهند مدلهای زبانی بزرگ میتوانند این قابلیتها را بسیار گستردهتر کنند.
در یک مطالعه، پژوهشگران دریافتند هوش مصنوعی در بررسی معیارهای مشخص و محدود، مانند اینکه آیا محاسبات درست هستند و آیا متن با اعداد موجود در جداول مطابقت دارد، عملکرد موفقی داشته است.
طبق این پژوهش، هوش مصنوعی تشخیص داد حدود یک سوم مقالات حداقل یک خطا دارند و ارزیابان انسانی ۸۳ درصد از این خطاها را تایید کردند؛ هرچند بیشتر این خطاها نتیجهگیری اصلی مقاله را تغییر نمیدادند. هوش مصنوعی همچنین در تشخیص اشتباهات ریاضی بهتر از اشتباهات متنی عمل کرد.
داوران انسانی ممکن است وقت نداشته باشند یک مقاله را خط به خط بررسی کنند. این موضوع نشاندهنده نوعی همافزایی میان انسان و هوش مصنوعی است.
هوش مصنوعی در کدام بخشهای فرایند انتشار میتواند وارد شود؟
ناشران میگویند هوش مصنوعی هنوز برای جایگزین شدن با انسان در ارزیابی نوآوری یا کیفیت کلی یک مقاله آماده نیست، اما مطالعات نشان میدهند میتواند در تصمیمگیری انسانها نقش کمکی داشته باشد.
ابزارهای هوش مصنوعی برای کمک به نویسندگان
برخی نویسندگان اکنون به ابزارهایی دسترسی دارند که برای بررسی مقالات علمی طراحی شدهاند و میگویند این ابزارها برای بهبود پیشنویس مقاله قبل از ارسال بسیار مفید هستند.
برای مقابله با نگرانیهایی درباره اینکه بخشهایی از مقالات منتشرنشدهای که در اختیار هوش مصنوعی قرار میگیرند، ممکن است برای آموزش مدلهای زبانی استفاده شوند یا به فضای عمومی راه پیدا کنند، این ابزار و برخی خدمات مشابه وعده میدهند مقاله آپلودشده را در یک مخزن خصوصی و جدا از اینترنت نگهداری کنند.
استفاده از هوش مصنوعی در bioRxiv
در ماههای اخیر، سرور پیشچاپ bioRxiv نیز به نویسندگان این امکان را داده است که مقالات خود را برای بررسی فنی به یکی از چند ابزار داوری هوش مصنوعی ارسال کنند.
این داوریها محرمانه باقی میمانند و فقط در اختیار نویسندگان هستند. نویسندگان میتوانند قبل از انتشار مقاله تصمیم بگیرند که آیا بر اساس این بازخوردها مقاله را اصلاح کنند یا خیر.
زیستشناس تکوینی و مهندس زیستی که سال گذشته از این سرویس استفاده کرده، میگوید تجربه او با این ابزار از بسیاری از داوریهای انسانی که در بیش از ۳۵ سال ارسال مقاله داشته، دقیقتر، توجهمندتر، سازندهتر و مفیدتر بوده است.
هوش مصنوعی در کجا ضعف دارد؟
اگرچه مطالعه کیم نقاط قوت داوری هوش مصنوعی را نشان داد، ضعفهای آن را نیز آشکار کرد.
برای مثال، مدلهای زبانی بزرگ در مجموع از داوران انسانی در درستی ارزیابیهای خود ضعیفتر بودند.
در یک مورد، هوش مصنوعی یک مقاله را به دلیل اصلاح نکردن یک سوگیری شناخته شده در دادههای مربوط به آلودگی هوا در چین مورد انتقاد قرار داد؛ در حالی که مقاله در واقع این مشکل را اصلاح کرده بود.
این اشتباه به یکی از محدودیتهای شناختهشده مدلهای زبانی بزرگ نسبت داده میشود: محدودیت حافظه کاری.
این محدودیت میتواند باعث شود مدل جزئیات مرتبط را نادیده بگیرد، به خصوص زمانی که آن جزئیات در بخشهای مختلف مقاله و فایلهای تکمیلی پراکنده باشند.
هوش مصنوعی همیشه قواعد تخصصی هر رشته را نمیفهمد
مدلهای زبانی بزرگ همچنین درک محدودی از قواعد روش شناختی خاص برخی زیرشاخههای علمی نشان دادند. بنابراین یک گروه داوری هوش مصنوعی نمیتواند بهسادگی جایگزین یک گروه داوری انسانی شود.
درخواستهای غیرضروری هوش مصنوعی
هوش مصنوعی ممکن است درخواستهایی برای ارائه نتایج بیشتر مطرح کند که منطقی نباشند.
هوش مصنوعی پیشنهاد میکند جزئیاتی به مقاله اضافه شود که برای ارائه آنها باید مطالعات تکمیلی زمانبری انجام شود؛ در حالی که این مطالعات برای اثبات نکته اصلی مقاله ضروری نیستند.
مشکل دیگر: پرحرفی و تمرکز روی مسائل کماهمیت
برخی دانشمندان میگویند نقدهای هوش مصنوعی بیش از حد طولانی هستند و معمولا روی مشکلات کوچک و کماهمیت تمرکز میکنند، در حالی که ممکن است مهمترین مشکلات مقاله را نادیده بگیرند.
خطر سوگیری در هوش مصنوعی
ماشینها همچنین میتوانند سوگیریهایی را که در حجم عظیم متونی که مدلهای زبانی با آنها آموزش دیدهاند وجود دارد، بازتاب دهند.
برای مثال، ممکن است هوش مصنوعی نسبت به پژوهشهایی که توسط نویسندگان مؤسسات بسیار معتبر انجام شدهاند، تمایل بیشتری داشته باشد.
در یک آزمایش، پژوهشگران از یک مدل زبانی بزرگ خواستند چند نسخه از مقالات منتشرشده را ارزیابی کند. نسخهها از نظر محتوای علمی کاملا یکسان بودند و فقط نام و وابستگی سازمانی نویسنده اصلی تغییر کرده بود.
نتیجه نشان داد مدل زبانی با احتمال بیشتری مقالات نویسندگانی را که در مؤسسات کماعتبارتر بودند رد میکند، در حالی که برای نویسندگان مؤسسات معتبرتر احتمال پذیرش بیشتری وجود داشت.
مشکل دیگر: حوزههای علمی جدید
داوران هوش مصنوعی در ارزیابی نتایج مربوط به حوزههای علمی جدید یا زیرشاخههای بسیار تخصصی نیز مشکل دارند؛ حوزههایی که مطالعات قبلی کمی درباره آنها وجود دارد تا مدلهای زبانی بزرگ بتواند قضاوت خود را بر اساس آنها شکل دهد.
همچنین چندین مطالعه نشان دادهاند که ماشینها به دلیل تمایل به تایید و خوشایندگویی به کاربر (sycophancy) معمولا به مقالات امتیازهایی بالاتر از امتیازهای داوران انسانی میدهند.
آیا استفاده از هوش مصنوعی واقعا باعث صرفهجویی در وقت میشود؟
در نهایت، استفاده از هوش مصنوعی حتی ممکن است همیشه باعث صرفهجویی در وقت داوران نشود.
یک گروه پژوهشی از ۲۴ دانشمند خواست دو مقاله منتشرشده مشابه را بررسی کنند. به داوران گفته شد برای یکی از دو داوری خود از هوش مصنوعی کمک بگیرند.
هنگام استفاده از هوش مصنوعی، داوران زمان کمتری را صرف کارهایی مانند بررسی مقالات مرتبط دیگر کردند؛ اما این صرفهجویی با زمانی که لازم بود برای بررسی صحت پیشنهادهای هوش مصنوعی صرف کنند، جبران شد.
در نهایت میزان صرفهجویی خالص تنها چند دقیقه بود و از نظر آماری معنادار نبود.
مجلات و کنفرانسها در حال آزمایش هستند
حتی با وجود عدم قطعیت درباره داوری هوش مصنوعی و نبود استانداردهای مشخص برای استفاده از آن، برخی سردبیران مجلات و برگزارکنندگان کنفرانسها در حال آزمایش این فناوری در دنیای واقعی هستند. از آنجا که موضوع کنفرانس مربوط به هوش مصنوعی بود، آنها احساس کردند مسئولیت و فرصت مناسبی دارند تا این مسئله اجتماعی-فنی و امکان کمک هوش مصنوعی به حل آن را بررسی کنند. اما گرفتن موافقت برای اجرای این آزمایش آسان نبود.
آزمایش انجمن پیشبرد هوش مصنوعی (AAAI)
آنها تصمیم گرفتند هدفشان این باشد که بررسی کنند هوش مصنوعی چقدر میتواند این کار را انجام دهد و داده جمعآوری کنند؛ در حالی که همچنان نقش انسان بسیار پررنگ باشد و میزان تاثیر داوری هوش مصنوعی بر تصمیم نهایی پذیرش یا رد مقاله محدود شود.
آنها گروهی از مدلهای زبانی بزرگ را که با همکاری یکدیگر کار میکردند، برای کمک به پردازش ۳۰ هزار مقاله ارسالی به کار گرفتند؛ رقمی که دو برابر سال قبل بود.
نویسندگان علاوه بر حداقل دو داوری انسانی، یک داوری نوشته شده توسط هوش مصنوعی نیز دریافت کردند.
اما فقط داوریهای انسانی شامل امتیازهای عددی و توصیه درباره پذیرش یا رد مقاله بودند و داوران انسانی نیز بدون مشاهده ارزیابی هوش مصنوعی، داوری خود را انجام دادند.
سپس نویسندگان پاسخهایی در دفاع از مقاله خود تهیه کردند تا در تصمیم نهایی داوران انسانی مورد استفاده قرار گیرد.
در یک نظرسنجی از شرکتکنندگان، اکثریت نزدیک به ۶۰۰۰ نویسنده، داور و قاضی گفتند که در ۶ مورد از ۹ معیار کیفیت، داوریهای هوش مصنوعی را به داوریهای انسانی ترجیح میدهند؛ از جمله از نظر کامل بودن و ارائه پیشنهادهای مفید برای بهبود طراحی پژوهش.
با این حال، نویسندگان در برخی معیارهای مهم، داوری انسانی را ترجیح دادند؛ از جمله در مورد اینکه آیا داوری حاوی خطاهای فنی است یا بیش از حد روی مسائل جزئی تمرکز کرده است.
انجمن پیشبرد هوش مصنوعی قصد دارد این آزمایش را برای نشست سال ۲۰۲۷ تکرار کند، اما برنامهای ندارد که صرفا بر اساس داوریهای هوش مصنوعی مقالات را رد کند؛ اقدامی که به گفته او احتمالا با مخالفت شدید شرکتکنندگان مواجه خواهد شد.
هوش مصنوعی چگونه میتواند داور انسانی را تقویت کند؟
در نشست دیگری در حوزه یادگیری ماشینی، یعنی کنفرانس بینالمللی بازنماییهای یادگیری (ICLR) در سال ۲۰۲۵، برگزارکنندگان آزمایشی انجام دادند تا ببینند آیا مدلهای زبانی بزرگ میتوانند با استفاده از تحلیل مقاله ارسالی و یک داوری نوشته شده توسط انسان، کیفیت داوری را بهتر کنند یا خیر.
۲۷ درصد داوران انسانی نقدهای خود را تغییر دادند. این داوریهای اصلاح شده به طور میانگین طولانیتر شدند و تقریبا همه آنها دستکم یک نکته از پیشنهادهای هوش مصنوعی را در خود جای دادند.
یک گروه جداگانه از ارزیابان انسانی تشخیص دادند که حدود دو سوم این داوریهای اصلاح شده و تحت تاثیر هوش مصنوعی، بهتر از نسخه اولیه بودهاند.
اما همه داوران راضی نبودند. دیدگاهها متفاوت بود. برخی داوران نقدهای هوش مصنوعی را تکراری یا حتی تا حدی تحقیرآمیز میدانستند، زیرا هوش مصنوعی پیشنهاد میکرد جزئیات بسیار بیشتری به مقاله اضافه شود.
در سمت مجلات علمی، نشریهای وابسته به مجله پزشکی نیواینگلند که بر استفاده از هوش مصنوعی در پزشکی تمرکز دارد، سال گذشته یک برنامه آزمایشی راهاندازی کرد.
در این مسیر، تصمیم پذیرش یا رد مقاله ظرف ۷ روز و بر اساس ترکیبی از تحلیل هوش مصنوعی و بررسی سردبیران انسانی انجام میشود. البته این مسیر فقط برای مقالاتی ارائه میشود که سردبیران تصور میکنند احتمال پذیرش بالایی از طریق مسیر معمولی دارند.
از زمانی که این مجله نخستین دو مقاله را در ماه نوامبر سال ۲۰۲۵ از طریق این مسیر منتشر کرد، کیفیت تحلیل هوش مصنوعی بهتر شده و میزان راحتی نویسندگان و سردبیران با این فناوری نیز افزایش یافته است.
اما آنها همچنان ادعاهایی را که هوش مصنوعی مطرح میکند، بررسی میکنند و آنها را با خود مقاله تطبیق میدهند.
آینده چگونه خواهد بود؟
هوش مصنوعی تقریبا به طور قطع در آینده نقش گستردهتری در داوریهای این نشریه خواهد داشت.
در گذشته نهچندان دور، تصور اینکه یکی از مجلات برجسته حوزه هوش مصنوعی پزشکی از هوش مصنوعی در داوری همتا استفاده کند، تقریبا غیرممکن بود. به نظر میرسد هنجارها در حال تغییر هستند.
- منبع خبر : https://www.isna.ir/news/1405071006355/









































