چکیده
مدلهای زبانی بزرگ چگونه دانش اخلاقی را سازماندهی میکنند؟ این مدلها توانایی گستردهای در تشخیص محتوای اخلاقی دارند، اما این تشخیص تنها در سطحی آستانهای و ابتدایی صورت میگیرد. پرسش اصلی ما این است که آیا این مدلها فراتر رفته و بنیانهای اخلاقی را از یکدیگر متمایز میسازند و روابط بین آنها را بهصورتی هندسی سازماندهی میکنند. برای پاسخ به این پرسش، شش پروب خطی مستقل را بر مدلهای زبانی با وزنهای آزاد آموزش میدهیم؛ یکی برای هر دسته از نظریه بنیانهای اخلاقی (مراقبت/آسیب، انصاف/تقلب، آزادی/ستم، وفاداری/خیانت، اقتدار/سرپیچی، و تقدس/تحقیر). سپس بررسی میکنیم که جهتهای حاصل در فضای بازنمایی چگونه با یکدیگر مرتبطاند. یافتههای ما نشان میدهد که این جهتها نه در یک آشکارساز اخلاقی واحد ادغام میشوند و نه کاملاً از یکدیگر مستقلاند، بلکه تقریباً بیشینهی ابعاد مستقل را اشغال میکنند و در عین حال یک مؤلفه مشترک مثبت را به اشتراک دارند. این مؤلفه مشترک، امضای یکپارچگی است و نسبت به مجموعهای از مفاهیم غیراخلاقی که بهطور متناظر ساخته شدهاند، مختصِ حوزه اخلاق است (میانگین کسینوس زوجی ۰.۲۶ در برابر ۰.۰۱۳). این ساختار هندسی در معماریها و مقیاسهای مختلف مدلها سازگار باقی میماند و از مراحل نخستین پیشآموزش آغاز میشود، یعنی مدتها پیش از اشباع دقت پروب. ساختاری که مدل کشف میکند، هیچ نشانهای از تمایز فردگرایانه/پیوندی که نظریه بنیانهای اخلاقی پیشبینی میکند ندارد (اگرچه توان آماری این آزمون پایین است: تنها ۲۰ افراز نامزد وجود دارد)، بلکه بازتابدهنده آمارهای پیکره متنی است. با گسترش به معضلات اخلاقی، جهت هر معضل تا حدی از بنیانهای مؤلفه خود ترکیب میشود، به میزان ۲.۷ برابر خط پایه جفتنامتناظر، در حالی که بیشتر واریانس آن، ساختاری مختص به تعارض را رمزگذاری میکند. مدل، خودِ تنش اخلاقی را بازنمایی میکند، نه یک قضاوت از پیش حلشده.
متن کامل
علوم کامپیوتر > محاسبات و زبان
arXiv:2608.27402v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶]
**عنوان:** مدلهای زبانی چگونه دانش اخلاقی را سازماندهی و ساختاربندی میکنند
**نویسندگان:** اوریون ربلیتز-ریچاردسون
مشاهده PDF مقاله با عنوان «How Language Models Organize and Structure Moral Knowledge»، توسط اوریون ربلیتز-ریچاردسون
مشاهده PDF
HTML (آزمایشی)
**چکیده:** مدلهای زبانی بزرگ (LLMs) چگونه دانش اخلاقی را سازماندهی میکنند؟ این مدلها محتوای اخلاقی را در سطحی گسترده تشخیص میدهند، اما تشخیص صرف، آستانهای پایین به شمار میرود. در این پژوهش میپرسیم آیا این مدلها فراتر رفتهاند، بنیانهای اخلاقی گوناگون را از یکدیگر تمیز میدهند و روابط میان آنها را به شکلی هندسی سازماندهی میکنند. ما شش پروب خطی مستقل را بر مدلهای زبانی با وزنهای باز آموزش میدهیم—یکی برای هر دسته از نظریه بنیانهای اخلاقی (MFT): مراقبت/آسیب، انصاف/تقلب، آزادی/ستم، وفاداری/خیانت، اقتدار/سرکشی، و قداست/تحقیر—و بررسی میکنیم که بردارهای حاصل چگونه در فضای بازنمایی با یکدیگر مرتبطاند. درمییابیم که این بردارها نه در یک آشکارساز اخلاقی واحد فرو میریزند و نه از یکدیگر جدا میشوند؛ بلکه تقریباً تعداد حداکثری از ابعاد مستقل را در بر میگیرند، در حالی که یک مؤلفه مشترک مثبت نیز میان آنها به اشتراک گذاشته میشود. این مؤلفه مشترک، نشانه یکپارچگی است و در مقایسه با مجموعهای از مفاهیم غیراخلاقی همتا که به همان شیوه ساخته شدهاند، مختص اخلاق است (میانگین کسینوس زوجی ۰.۲۶ در برابر ۰.۰۱۳). این هندسه در معماریها و مقیاسهای گوناگون سازگار است و رژیم یکپارچگی خود را در مراحل اولیه پیشآموزش مییابد، پیش از آنکه دقت پروب به اشباع برسد. ساختاری که مدل کشف میکند هیچ شاهدی از تمایز فردگرایانه/پیوندی که نظریه بنیانهای اخلاقی پیشبینی میکند، نشان نمیدهد (آزمون دارای توان آماری ناکافی: تنها ۲۰ افراز نامزد وجود دارد) و بازتابی از آمارهای پیکره متنی است. با گسترش تحلیل به معضلات اخلاقی، هر بردار معضل تا حدی از ترکیب بنیانهای مولفهای خود شکل میگیرد—۲.۷ برابر خط پایه جفتهای ناهمخوان—اما بخش عمده واریانس آن، ساختاری مختص تعارض اخلاقی را رمزگذاری میکند. به عبارت دیگر، مدل خودِ تنش اخلاقی را بازنمایی میکند، نه یک قضاوت از پیش حلشده را.
**توضیحات:**
موضوعات: محاسبات و زبان (cs.CL); هوش مصنوعی (cs.AI); یادگیری ماشین (cs.LG)
ردههای ACM: I.2.6; I.2.7
**استناد به صورت:** arXiv:2608.27402 [cs.CL] (یا arXiv:2608.27402v1 [cs.CL] برای این نسخه)
https://doi.org/10.48550/arXiv.2608.27402
برای اطلاعات بیشتر درباره DOI صادر شده توسط arXiv از طریق DataCite (در انتظار ثبت) مراجعه کنید.
**تاریخچه ارسال**
[نمایش ناشناس برای نویسنده] از: اوریون ربلیتز-ریچاردسون [مشاهده ایمیل]
[v1] پنجشنبه، ۲۷ اوت ۲۰۲۶، ۱۷:۳۰:۳۰ UTC (۲۲۱ کیلوبایت)
**ابزارهای کتابشناختی**
ابزارهای کتابشناختی و استنادی
کاوشگر کتابشناختی
تغییر وضعیت کاوشگر کتابشناختی (کاوشگر چیست؟)
مقالات مرتبط
تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟)
نقشههای ادبیات
تغییر وضعیت نقشههای ادبیات (نقشههای ادبیات چیست؟)
scite.ai
تغییر وضعیت استنادهای هوشمند scite (استنادهای هوشمند چیست؟)
**کد، داده، رسانه**
کد، داده و رسانه مرتبط با این مقاله
alphaXiv
تغییر وضعیت alphaXiv (alphaXiv چیست؟)
پیوندها به کد
تغییر وضعیت CatalyzeX، یابنده کد برای مقالات (CatalyzeX چیست؟)
DagsHub
تغییر وضعیت DagsHub (DagsHub چیست؟)
GotitPub
تغییر وضعیت Gotit.pub (Gotit.pub چیست؟)
Huggingface T
تغییر وضعیت Hugging Face (Huggingface چیست؟)
ScienceCast
تغییر وضعیت ScienceCast (ScienceCast چیست؟)
نمایشها
نمایشها
Replicate
تغییر وضعیت Replicate (Replicate چیست؟)
Spaces
تغییر وضعیت Hugging Face Spaces (Spaces چیست؟)
Spaces
تغییر وضعیت TXYZ.AI (TXYZ.AI چیست؟)
**مقالات مرتبط**
سیستمهای پیشنهاددهنده و ابزارهای جستجو
پیوند به Influence Flower
Influence Flower (گلهای تأثیرگذاری چیست؟)
سیستم پیشنهاددهنده اصلی
تغییر وضعیت CORE Recommender (CORE Recommender چیست؟)
نویسنده
مجله
مؤسسه
موضوع
**درباره arXivLabs**
arXivLabs: پروژههای آزمایشی با همکاران جامعه
arXivLabs چارچوبی است که به همکاران امکان میدهد تا ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs همکاری میکنند، ارزشهای ما—از جمله آزادی، جامعهمحوری، برتری، و حریم خصوصی دادههای کاربران—را پذیرفتهاند. arXiv به این ارزشها متعهد است و تنها با شرکایی همکاری میکند که به آنها پایبند باشند. آیا ایدهای برای پروژهای دارید که برای جامعه arXiv ارزشآفرین باشد؟ درباره arXivLabs بیشتر بدانید.
کدام نویسندگان این مقاله تأییدکننده هستند؟
| غیرفعال کردن MathJax (MathJax چیست؟)