چکیده
دادههای مصنوعی میتوانند در شرایطی که دادههای واقعی محدود هستند، به بهبود استنباط آماری کمک کنند. با این حال، استفاده نادرست از نمونههای مصنوعی بهجای دادههای واقعی، ممکن است منجر به سوگیری و نتایج غیرقابل اعتماد شود. ما یک چارچوب کلی برای استنباط تقویتشده با دادههای مصنوعی در مجموعهای از وظایف مرتبط توسعه دادهایم. این چارچوب، تقویتسازی مصنوعی را بر اساس تعداد مشاهدات مصنوعی و وزن آنها توصیف میکند. عنصر کلیدی چارچوب ما، مرز اندازه-وزن است که برای هر وزن، بزرگترین اندازه نمونه مصنوعی را مشخص میکند بهطوریکه همه اندازههای کوچکتر از آن، پوشش هدف حاشیهای وظیفه را تأمین کنند. ما این مرز را از دادههای وظایف تاریخی برآورد میکنیم و تضمین پوشش نمونههای محدود را برای همه پیکربندیهای اندازه-وزن در یا زیر مرز برآوردشده، بهطور همزمان ارائه میدهیم. در آزمایشهایی که از پاسخهای مدلهای زبانی بزرگ برای تقویت دادههای نظرسنجی استفاده شده است، روش ما به پوشش هدف دست مییابد و فاصلههای اطمینان را بهطور قابلتوجهی کاهش میدهد.
متن کامل
آمار > روششناسی arXiv:2608.28576v1 (stat.ME) [ارائهشده در ۲۸ آگوست ۲۰۲۶]
**عنوان:** یادگیری مرز اندازه-وزن برای استنتاج تقویتشده با دادههای مصنوعی
**نویسندگان:** چنگپیائو هوانگ، کایژنگ وانگ
مشاهده نسخه PDF مقاله با عنوان «یادگیری مرز اندازه-وزن برای استنتاج تقویتشده با دادههای مصنوعی»، نوشته چنگپیائو هوانگ و همنویس | مشاهده PDF | HTML (آزمایشی)
**چکیده:** دادههای مصنوعی میتوانند استنتاج آماری را در شرایط کمبود دادههای واقعی بهبود بخشند، اما رفتار سادهانگارانه با نمونههای مصنوعی بهمثابه دادههای واقعی میتواند سوگیری به وجود آورده و به استنتاج غیرقابلاعتماد منجر شود. ما چارچوبی عمومی برای استنتاج تقویتشده با دادههای مصنوعی در یک جمعیت از وظایف مرتبط توسعه میدهیم. این چارچوب، تقویت مصنوعی را از طریق تعداد مشاهدات مصنوعی و وزن آنها توصیف میکند. ستون فقرات چارچوب ما، یک مرز اندازه-وزن است که برای هر وزن، بزرگترین اندازه نمونه مصنوعی را تعیین میکند که همۀ اندازههای کوچکتر، پوشش حاشیهای وظیفهمحور را تضمین میکنند. ما این مرز را از وظایف تاریخی برآورد میکنیم و یک ضمانت پوشش با نمونه محدود را بهصورت همزمان برای تمامی پیکربندیهای اندازه-وزن روی یا زیر مرز برآوردشده اثبات میکنیم. در آزمایشها با استفاده از پاسخهای مدلهای زبانی بزرگ برای تقویت دادههای نظرسنجی، روش پیشنهادی ما به پوشش هدف دست مییابد و فاصلههای اطمینان را بهمرور قابلتوجهی کاهش میدهد.
**توضیحات:** ۲۲ صفحه، ۳ شکل، ۱ جدول
**موضوعات:** روششناسی (stat.ME)؛ هوش مصنوعی (cs.AI)؛ یادگیری ماشین (cs.LG)؛ یادگیری ماشین (stat.ML)
**استناد:** arXiv:2608.28576 [stat.ME] (یا arXiv:2608.28576v1 [stat.ME] برای این نسخه) | https://doi.org/10.48550/arXiv.2608.28576
**سوابق ارسال:** از: چنگپیائو هوانگ [مشاهده ایمیل] [v1] جمعه، ۲۸ آگوست ۲۰۲۶ ۱۷:۵۲:۳۳ UTC (182 KB)
**ابزارهای کتابشناختی** ابزارهای کتابشناختی و استنادی | کاوشگر کتابشناختی | ابزارهای استناد هوشمند scite | کد، دادهها و رسانهها | alphaXiv | CatalyzeX | DagsHub | GotItPub | Hugging Face | ScienceCast
**دموها:** Replicate | Hugging Face Spaces | TXYZ.AI
**مقالات مرتبط:** Influence Flower | CORE Recommender
هم افراد و هم سازمانهایی که با arXivLabs همکاری میکنند، ارزشهای ما یعنی گشودگی، جامعهمحوری، برتری و حریم خصوصی دادههای کاربران را پذیرفتهاند. arXiv به این ارزشها متعهد است و تنها با شرکایی که آنها را رعایت میکنند همکاری میکند. آیا ایدهای برای پروژهای دارید که ارزشی برای جامعه arXiv اضافه کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)