arXiv:2608.28576ترجمه شده

یادگیری مرزی اندازه-وزن برای استنتاج با افزایش مصنوعی

Chengpiao Huang، Kaizheng Wang

چکیده

داده‌های مصنوعی می‌توانند در شرایطی که داده‌های واقعی محدود هستند، به بهبود استنباط آماری کمک کنند. با این حال، استفاده نادرست از نمونه‌های مصنوعی به‌جای داده‌های واقعی، ممکن است منجر به سوگیری و نتایج غیرقابل اعتماد شود. ما یک چارچوب کلی برای استنباط تقویت‌شده با داده‌های مصنوعی در مجموعه‌ای از وظایف مرتبط توسعه داده‌ایم. این چارچوب، تقویت‌سازی مصنوعی را بر اساس تعداد مشاهدات مصنوعی و وزن آن‌ها توصیف می‌کند. عنصر کلیدی چارچوب ما، مرز اندازه-وزن است که برای هر وزن، بزرگ‌ترین اندازه نمونه مصنوعی را مشخص می‌کند به‌طوری‌که همه اندازه‌های کوچک‌تر از آن، پوشش هدف حاشیه‌ای وظیفه را تأمین کنند. ما این مرز را از داده‌های وظایف تاریخی برآورد می‌کنیم و تضمین پوشش نمونه‌های محدود را برای همه پیکربندی‌های اندازه-وزن در یا زیر مرز برآوردشده، به‌طور همزمان ارائه می‌دهیم. در آزمایش‌هایی که از پاسخ‌های مدل‌های زبانی بزرگ برای تقویت داده‌های نظرسنجی استفاده شده است، روش ما به پوشش هدف دست می‌یابد و فاصله‌های اطمینان را به‌طور قابل‌توجهی کاهش می‌دهد.

متن کامل

آمار > روش‌شناسی arXiv:2608.28576v1 (stat.ME) [ارائه‌شده در ۲۸ آگوست ۲۰۲۶] **عنوان:** یادگیری مرز اندازه-وزن برای استنتاج تقویت‌شده با داده‌های مصنوعی **نویسندگان:** چنگ‌پیائو هوانگ، کایژنگ وانگ مشاهده نسخه PDF مقاله با عنوان «یادگیری مرز اندازه-وزن برای استنتاج تقویت‌شده با داده‌های مصنوعی»، نوشته چنگ‌پیائو هوانگ و هم‌نویس | مشاهده PDF | HTML (آزمایشی) **چکیده:** داده‌های مصنوعی می‌توانند استنتاج آماری را در شرایط کم‌بود داده‌های واقعی بهبود بخشند، اما رفتار ساده‌انگارانه با نمونه‌های مصنوعی به‌مثابه داده‌های واقعی می‌تواند سوگیری به وجود آورده و به استنتاج غیرقابل‌اعتماد منجر شود. ما چارچوبی عمومی برای استنتاج تقویت‌شده با داده‌های مصنوعی در یک جمعیت از وظایف مرتبط توسعه می‌دهیم. این چارچوب، تقویت مصنوعی را از طریق تعداد مشاهدات مصنوعی و وزن آن‌ها توصیف می‌کند. ستون فقرات چارچوب ما، یک مرز اندازه-وزن است که برای هر وزن، بزرگ‌ترین اندازه نمونه مصنوعی را تعیین می‌کند که همۀ اندازه‌های کوچک‌تر، پوشش حاشیه‌ای وظیفه‌محور را تضمین می‌کنند. ما این مرز را از وظایف تاریخی برآورد می‌کنیم و یک ضمانت پوشش با نمونه محدود را به‌صورت هم‌زمان برای تمامی پیکربندی‌های اندازه-وزن روی یا زیر مرز برآوردشده اثبات می‌کنیم. در آزمایش‌ها با استفاده از پاسخ‌های مدل‌های زبانی بزرگ برای تقویت داده‌های نظرسنجی، روش پیشنهادی ما به پوشش هدف دست می‌یابد و فاصله‌های اطمینان را به‌مرور قابل‌توجهی کاهش می‌دهد. **توضیحات:** ۲۲ صفحه، ۳ شکل، ۱ جدول **موضوعات:** روش‌شناسی (stat.ME)؛ هوش مصنوعی (cs.AI)؛ یادگیری ماشین (cs.LG)؛ یادگیری ماشین (stat.ML) **استناد:** arXiv:2608.28576 [stat.ME] (یا arXiv:2608.28576v1 [stat.ME] برای این نسخه) | https://doi.org/10.48550/arXiv.2608.28576 **سوابق ارسال:** از: چنگ‌پیائو هوانگ [مشاهده ایمیل] [v1] جمعه، ۲۸ آگوست ۲۰۲۶ ۱۷:۵۲:۳۳ UTC (182 KB) **ابزارهای کتابشناختی** ابزارهای کتابشناختی و استنادی | کاوشگر کتابشناختی | ابزارهای استناد هوشمند scite | کد، داده‌ها و رسانه‌ها | alphaXiv | CatalyzeX | DagsHub | GotItPub | Hugging Face | ScienceCast **دموها:** Replicate | Hugging Face Spaces | TXYZ.AI **مقالات مرتبط:** Influence Flower | CORE Recommender هم افراد و هم سازمان‌هایی که با arXivLabs همکاری می‌کنند، ارزش‌های ما یعنی گشودگی، جامعه‌محوری، برتری و حریم خصوصی داده‌های کاربران را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی که آن‌ها را رعایت می‌کنند همکاری می‌کند. آیا ایده‌ای برای پروژه‌ای دارید که ارزشی برای جامعه arXiv اضافه کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)