چکیده
تأثیر اندازه مدلهای زبان بزرگ (LLM) بر عملکرد یادگیری متا همچنان به طور کامل مشخص نیست. ما یک ارزیابی کنترلشده از ۱۳ مدل متراکم و مدلهای Mixture-of-Experts از نسلهای Qwen3.5 و Qwen3.6، به همراه نسخههای اختصاصی GPT، را با استفاده از خط لوله تولید تقویتشده با بازیابی OntoLearner انجام دادیم. همه مدلها با استفاده از یک مدل درجگذاری، پیکربندی بازیابی، قالبهای پیشفرض، تنظیمات رمزگشایی، دادهها و معیارهای یکسان در زمینههای تایپ اصطلاحات، کشف طبقهبندی و استخراج روابط غیرفعالشده در چهار متا زیستپزشکی و علوم و مهندسی مواد، ارزیابی شدند. در نسل متراکم Qwen3.5، افزایش تعداد پارامترها عمدتاً دقت را بهبود میبخشد، نه یادآوری، و بزرگترین بهبودها بین ۹ میلیارد و ۲۷ میلیارد پارامتر رخ میدهد. با این حال، تأثیر اندازه مدل نه تکانهای است و نه یکنواخت در سراسر وظایف و حوزهها. مدلهای متراکم ۲۷ میلیاردی در زمینه تایپ اصطلاحات عملکرد بهتری نسبت به مدلهای رقیق بسیار بزرگتر دارند، در حالی که مدلهای بزرگتر Mixture-of-Experts بهترین نتایج وزن باز را در زمینه کشف طبقهبندی به دست میآورند. استخراج روابط غیرفعالشده همچنان در سراسر مقیاسهای مدل دشوار است، به ویژه در متا علوم داده مواد. تفاوتهای عملکردی بین نسخههای مطابق Qwen و نسخههای اختصاصی GPT نیز نشان میدهد که معماری و نسل مدل میتواند بر تعداد پارامترهای اسمی غلبه کند. این یافتهها نشان میدهند که اندازه مدل به تنهایی یک معیار انتخاب کافی برای یادگیری متا نیست و راهنماییهای تجربی برای مهندسی متا با کمک LLM قابل بازتولید را ارائه میدهد.
متن کامل
علوم کامپیوتر > هوش مصنوعی
arXiv:2608.31118v1 (cs) [ارسالشده در ۳۱ آگوست ۲۰۲۶]
عنوان: چه زمانی اندازه بزرگتر کمک میکند؟ یک مطالعه کنترلشده از مقیاس مدل زبانی بزرگ (LLM) برای یادگیری آنتولوژی (OL)
نویسندگان: حامد بابایی گیلو، زورن آور، جنیفر دیسوزا
چکیده: تأثیر مقیاس مدل زبانی بزرگ (LLM) بر عملکرد یادگیری آنتولوژی (OL) همچنان بهطور ناکافی مشخص شده است. ما ارزیابی کنترلشدهای از ۱۳ مدل شامل نسخههای متراکم و مخلوط متخصصان (MoE) از سریهای Qwen3.5 و Qwen3.6، بههمراه مدلهای انتشار اختصاصی GPT، با استفاده از خط لوله تولید تقویتشده با بازیابی OntoLearner ارائه میدهیم. تمام مدلها با مدل جاسازی (embedding) یکسان، پیکربندی بازیابی، قالبهای دستور (prompt)، تنظیمات رمزگشایی، مجموعه دادهها و معیارهای یکسان در تایپینگ اصطلاح، کشف طبقهبندی و استخراج رابطه غیرتاکسونومیک در چهار آنتولوژی زیستپزشکی و علوم و مهندسی مواد ارزیابی شدند. در مدلهای متراکم Qwen3.5، افزایش تعداد پارامترها عمدتاً دقت (precision) را بهبود میبخشد، نه بازیابی (recall)، با بزرگترین سود بین پارامترهای ۹B و ۲۷B. با این حال، اثر مقیاس یکنواخت نیست و در وظایف و حوزههای مختلف یکسان نیست. مدلهای متراکم ۲۷B در تایپینگ اصطلاح از مدلهای مخلوط متخصصان بسیار بزرگتر پیشی میگیرند، در حالی که مدلهای بزرگتر مخلوط متخصصان قویترین نتایج با وزن باز (open-weight) را در کشف طبقهبندی به دست میآورند. استخراج رابطه غیرتاکسونومیک در مقیاسهای مختلف مدل دشوار باقی میماند، بهویژه برای آنتولوژی علم داده مواد. تفاوتهای عملکرد در مدلهای متناظر Qwen و نسخههای انتشارات اختصاصی GPT نشان میدهد که معماری و مسیر مدل میتواند از تعداد پارامترهای اسمی مهمتر باشد. این یافتهها نشان میدهد که اندازه مدل به تنهایی معیار کافی برای انتخاب در OL نیست و راهنمایی تجربی برای مهندسی آنتولوژی با کمک LLM قابل بازتولید فراهم میکند.
موضوعات: هوش مصنوعی (cs.AI)
استناد: arXiv:2608.31118 [cs.AI] (یا arXiv:2608.31118v1 [cs.AI] برای این نسخه)
https://doi.org/10.48550/arXiv.2608.31118
تاریخچه ارسال
از: حامد بابایی گیلو [مشاهده ایمیل]
[v1] دوشنبه، ۳۱ آگوست ۲۰۲۶ ۱۷:۳۰:۰۵ UTC (۳۳۳ کیلوبایت)
نسکست، ساینسکس (ساینسکست چیست؟) دموها دموها توگل رپلیکیت (رپلیکیت چیست؟) اسپیسها توگل هگینگ فیس اسپیسز (اسپیسها چیست؟) اسپیسها توگل تیاکسوایزد.آی (تیاکسوایزد.آی چیست؟) مقالات مرتبط ابزارهای توصیهگر و جستجو لینک به اینفلوئنس فلور اینفلوئنس فلور (اینفلوئنس فلور چیست؟) توصیهگر اصلی توگل CORE Recommender (CORE Recommender چیست؟) نویسنده مکان برگزارکننده مؤسسه موضوع درباره arXivLabs arXivLabs: پروژههای آزمایشی با همکاری جامعه arXivLabs یک چارچوب است که به همکاران امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs همکاری میکنند، ارزشهای ما را در زمینه باز بودن، جامعه، برتری و حریم خصوصی دادههای کاربران پذیرفتهاند. arXiv به این ارزشها متعهد است و تنها با شرکایی همکاری میکند که به آنها پایبند باشند. آیا ایدهای برای پروژهای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ بیشتر در مورد arXivLabs بدانید. کدام یک از نویسندگان این مقاله تأییدکننده هستند؟ | MathJax را غیرفعال کنید (MathJax چیست؟)