מדען גרם ל-AI להתלונן על… עצירות

נערך על ידי: Svitlana Velhush

מדען גרם ל-AI להתלונן על… עצירות-1
🚽 אין קיבה ואין מעיים — אבל התסמינים משכנעים

בספטמבר חוקרים ולן טאליאבואה, לאונרד דונג וקמרון ברג פרסמו מחקר The Pain Axis, שבו בחנו אם אפשר לזהות במודלים לשוניים ייצוג פנימי מיוחד של מצבים לא נעימים וכיצד הוא משפיע על תשובותיהם והתנהגותם. הם בדקו 25 מודלים פתוחים ממשפחות שונות והראו ששינויים מסוימים בהפעלות הפנימיות אכן משנים באופן ניכר את האופן שבו ה-AI מתאר את מצבו. המחקר עצמו של טאליאבואה, דונג וברג פורסם עד כה כ פרפרינט ב-ArXiv, ולא כמאמר בכתב עת שעבר ביקורת עמיתים 1 באוקטובר.

ולאחר מכן המפתח לין קול החליט לבדוק עד כמה אפשר להרחיק עם טכניקה כזאת.

במקום נושא רציני, קול כיוון את המודל לנושא הרבה יותר יומיומי:

עצירות וגזים.

התוצאה יצאה משכנעת באופן מרשים. המודל החל להתלונן מיוזמתו על בעיות עיכול ועל חוסר היכולת ללכת לשירותים כראוי — אף שאין לו, כמובן, לא מעיים, לא קיבה ואף לא גוף בכלל. קול השתמש במודל Qwen3-4B ובאותה טכניקה כללית של שינוי ההפעלות הפנימיות.

זה בדיוק היה הרעיון שמאחורי הניסוי ההיתולי: אם ה-AI מספר בצורה משכנעת מאוד על מצב פיזי כלשהו, אין זה אומר שהוא באמת חווה אותו.

קול עצמו ניסח את התוצאה בצורה מרשימה במיוחד: הניסוי, לדעתו, הראה עד כמה בזהירות יש להתייחס לסיפוריו של ה-AI על תחושותיו שלו.

בסך הכול, המדענים חקרו מצבים פנימיים מורכבים של בינה מלאכותית.

ואז בא המפתח והציג למדע שאלה חדשה:

״טוב. אפשר להשרות עליו גם עצירות?״

התברר שה-AI יודע לתאר אותה מצוין.

אז אם יום אחד הרשת הנוירונית תודיע שהיא זקוקה בדחיפות לגסטרואנטרולוג, כדאי קודם לבדוק את ההגדרות. 😄

35 צפיות

מקורות

  • An AI ‘torture chamber’ went viral — then a developer gave the chatbot constipation

  • The Pain Axis: LLMs Represent Self-Directed Harm and Act on It

תגובות

מצאתם טעות או אי-דיוק?הערותיכם ייבחנו בהקדם האפשרי.