محققان دانشگاه کورنل الگوریتمی برای پیش‌بینی مقالات علمی پراستناد توسعه دادند

محققان دانشگاه کورنل الگوریتمی برای پیش‌بینی مقالات علمی پراستناد توسعه دادند

به گزارش مدیاتی:محققان دانشگاه کورنل به روشی دست یافته‌اند که می‌تواند به پیش‌بینی احتمال موفقیت و میزان استناد مقالات علمی کمک کند. این روش با بررسی الگوهای موجود در پژوهش‌ها، امکان شناسایی مقالاتی را فراهم می‌کند که ظرفیت بیشتری برای جلب توجه جامعه علمی و تبدیل شدن به پژوهش‌های پراستناد دارند؛ دستاوردی که می‌تواند به درک بهتر عوامل مؤثر بر اثرگذاری تحقیقات علمی کمک کند.

محققان دانشگاه کورنل روشی برای پیش‌بینی مقالات علمی پراستناد و موفق کشف کردند

آیا می‌توان شهرت و میزان تاثیرگذاری یک مقاله علمی را سال‌ها پیش از مطرح شدن آن پیش‌بینی کرد؟ محققان دانشگاه کورنل بر این باورند که به راهکاری برای پاسخ به این پرسش دست یافته‌اند و همه چیز به یک شاخص بسیار ساده برمی‌گردد: تعداد دانلودهای اولیه.

این تیم تحقیقاتی مجموعه‌داده‌های جدیدی را از پایگاه arXiv (مخزن معروف مقالات پیش‌چاپ) و پلتفرم GitHub (سرویس میزبانی پروژه و کد) استخراج کرده‌اند. هدف این پژوهش، ارزیابی روش پیش‌بینی «پیشرو-پست‌رو» (Lead-lag forecasting) است؛ الگویی که از میزان تعاملات اولیه کاربران (شامل تعداد بازدید، دانلود و لایک) برای تخمین اهمیت یک پروژه یا مقاله در سال‌های آینده استفاده می‌کند.

چرا این الگوی پیش‌بینی کارساز است؟

چرا این الگوی پیش‌بینی کارساز است؟
در حال حاضر، معیار اصلی برای سنجش اهمیت یک مقاله علمی، تعداد ارجاعات (Citations) آن توسط سایر پژوهشگران است؛ اما مشکلی که وجود دارد این است که ثبت و جلب ارجاعات معمولاً سال‌ها زمان می‌برد. محققان دانشگاه کورنل به جای انتظار برای دریافت ارجاعات، بر سرعت مطالعه مقاله توسط کاربران بلافاصله پس از انتشار تمرکز کردند. یان ین (Yian Yin)، یکی از همکاران این پژوهش، این روند را به «بازار پیش‌بینی» تشبیه می‌کند با این تفاوت که دانشمندان به جای پول، زمان خود را روی مقالات سرمایه‌گذاری می‌کنند.

سارا دین (Sarah Dean)، از نویسندگان ارشد این مطالعه، اشاره می‌کند که پلتفرم‌های امروزی همگی داده‌های تعاملی را ثبت می‌کنند و این آمار به شکل غافلگیرکننده‌ای سیگنال قوی و معتبری برای پیش‌بینی موفقیت‌های آتی محسوب می‌شود.

تیم تحقیقاتی با بررسی داده‌های ناشناس مربوط به دانلود ۲.۳ میلیون مقاله در arXiv و مقایسه آمار دانلودهای اولیه با تعداد ارجاعات آن‌ها پس از ۵ سال، دریافتند که تنها با داشتن آمار دانلود یک ماه اول می‌توان میزان محبوبیت و پراستناد بودن مقاله در ۵ سال آینده را پیش‌بینی کرد.

آیا این الگو برای کدهای برنامه‌نویسی نیز صدق می‌کند؟

نتایج بررسی‌ها نشان می‌دهد پاسخ مثبت است. محققان با تحلیل تغییرات کد (Pushes)، ستاره‌ها (Stars) و فورک‌های (Forks) نزدیک به ۳ میلیون مخزن در گیتهاب، به الگوی مشابهی دست یافتند. ستاره‌ها و به‌روزرسانی‌های اولیه یک پروژه در گیتهاب، مستقیماً به افزایش تعداد فورک‌ها در پنج سال بعد منجر می‌شود.

محققان امیدوارند این مجموعه‌داده‌ها به توسعه ابزارهای دقیق‌تر پیش‌بینی کمک کند. همچنین ایده‌های اولیه‌ای مطرح شده تا از این روش برای شناسایی و علامت‌گذاری مقالات کم‌کیفیت تولیدشده توسط هوش مصنوعی در پایگاه arXiv استفاده شود، پیش از آنکه این‌گونه مقالات فضای این پلتفرم را پر کنند.

آیا این مطلب را دوست داشتید؟

مشترک شوید

ایمیل شما منتشر نخواهد شد.

دیدگاهتان را بنویسید