چکیده
متن فارسی که میخواهید بهبود یابد را ارسال کنید تا آن را ویرایش کنم.
متن کامل
علوم کامپیوتر > محاسبه و زبان arXiv:2609.19145v1 [cs] [تاریخ ارسال: ۱۶ سپتامبر ۲۰۲۶]
عنوان: هدف در برابر جستجو: بررسی عوامل کلیدی در طراحی یک توکنیزر مؤثر
نویسندگان: احمدچمن یاووز، کلارا میستر، تیاگو پیمانتل
نمایش PDF مقاله با عنوان «هدف در برابر جستجو: بررسی عوامل کلیدی در طراحی یک توکنیزر مؤثر» نوشته احمدچمن یاووز و دو نویسنده دیگر.
نمایش PDF HTML (آزمایشی)
چکیده:
دو الگوریتم اصلی توکنیزاسیون که توسط مدلهای زبانی مدرن استفاده میشوند، رمزنگاری بایت-به-بایت (BPE) و UnigramLM هستند. این الگوریتمها در دو بعد متفاوت از هم متمایز میشوند: هدف بهینهسازی (فشردهسازی در برابر لگ-احتمال) و روش جستجو (ادغام از پایین به بالا در برابر حذف از بالا به پایین). مقایسههای موجود، این دو بعد را به طور همزمان در نظر میگیرند، که باعث میشود مشخص نشود که آیا تفاوتهای مشاهده شده ناشی از هدف بهینهسازی یا روش آن است. ما با معرفی دو الگوریتم توکنیزاسیون جدید که این فضای طراحی ۲×۲ را تکمیل میکنند، این دو را از هم جدا میکنیم: BottomUpLL، یک توکنیزر لگ-احتمالی از پایین به بالا، و TopDownComp، یک توکنیزر فشردهسازی از بالا به پایین. ما مدلهای زبانی را با توکنیزرهای تولید شده توسط هر الگوریتم آموزش میدهیم و متغیرهای زیر را تغییر میدهیم: اندازه مدل، اندازه واژگان، و حوزه (انگلیسی-تنها در برابر چندزبانه). ارزیابی مدلها بر اساس بیت-در-هر-بایت نشان میدهد که روش جستجو — نه هدف — عامل غالب است: توکنیزرهای از پایین به بالا در اکثر تنظیمات، بیت-در-هر-بایت پایینتری دارند. با این حال، ارزیابی مدلها بر روی وظیفه BLiMP هیچ رابطه سازگاری بین انتخاب طراحی و عملکرد نشان نمیدهد. به طور کلی، نتایج ما تأثیر انتخابهای طراحی توکنیزر بر عملکرد مدلهای زبانی را از هم جدا میکنند و راهنماییهای عملی برای طراحی اصولی آنها ارائه میدهند.
نظرات:
موضوعات: محاسبه و زبان (cs.CL); هوش مصنوعی (cs.AI)
ارجاع به عنوان: arXiv:2609.19145 [cs.CL] (یا arXiv:2609.19145v1 [cs.CL] برای این نسخه)
https://doi.org/10.48550/arXiv.2609.19145
برای کسب اطلاعات بیشتر در مورد DOI منتشر شده توسط arXiv از طریق DataCite (ثبت در حال انجام)
تاریخچه ارسال:
از: احمدچمن یاووز [نمایش ایمیل]
[v1] چهارشنبه، ۱۶ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۵ UTC (۱۳۲ کیلوبایت)
ابزارهای کتابشناسی
ابزارهای کتابشناسی و ارجاع
کاوشگر کتابشناسی
فعال/غیرفعال کردن کاوشگر کتابشناسی (کاوشگر چیست؟)
مقالات مرتبط
فعال/غیرفعال کردن مقالات مرتبط (مقالات مرتبط چیست؟)
Litmaps
فعال/غیرفعال کردن Litmaps (Litmaps چیست؟)
scite.ai
فعال/غیرفعال کردن استنادها هوشمند scite (استنادها هوشمند چیست؟)
کد، داده، رسانه
کد، داده و رسانه مرتبط با این مقاله
alphaXiv
فعال/غیرفعال کردن alphaXiv (alphaXiv چیست؟)
لینک به کد
فعال/غیرفعال کردن یابنده کد CatalyzeX برای مقالات (CatalyzeX چیست؟)
DagsHub
فعال/غیرفعال کردن DagsHub (DagsHub چیست؟)
GotitPub
فعال/غیرفعال کردن Gotit.pub (GotitPub چیست؟)
Huggingface
فعال/غیرفعال کردن Hugging Face (Huggingface چیست؟)
ScienceCast
فعال/غیرفعال کردن ScienceCast (ScienceCast چیست؟)
دموها
Demos
Replicate
فعال/غیرفعال کردن Replicate (Replicate چیست؟)
Spaces
فعال/غیرفعال کردن فضاهای Hugging Face (Spaces چیست؟)
فضاهای TXYZ.AI
فعال/غیرفعال کردن فضاهای TXYZ.AI (TXYZ.AI چیست؟)
مقالات مرتبط
پیشنهاددهندگان و ابزارهای جستجو
لینک به تأثیرگذاری
Flower Influence Flowe
ر (تأثیر گلها چیست؟) | کلید تغییر وضعیت توصیهگر اصلی | توصیهگر CORE (CORE چیست؟) | نویسنده | محل انتشار | مؤسسه | موضوع | درباره arXivLabs
arXivLabs: پروژههای آزمایشی با مشارکت جامعه
arXivLabs یک چارچوب است که به مشارکتکنندگان اجازه میدهد ویژگیهای جدید arXiv را مستقیماً روی وبسایت ما توسعه دهند و به اشتراک بگذارند. با این حال، افرادی و سازمانهایی که با arXivLabs کار میکنند، به ارزشهای باز بودن، جامعه، عالی بودن و حریم خصوصی دادههای کاربر پایبند هستند. arXiv به این ارزشها متعهد است و تنها با شرکتهایی که به آنها پایبند هستند همکاری میکند. آیا ایدهای برای پروژهای دارید که به جامعه arXiv ارزش اضافه کند؟ بیشتر درباره arXivLabs بیاموزید.
کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)