ניסויים בשטח בפלטפורמות פתוחות: איך חוקרים יכולים לבדוק רשתות חברתיות בלי תלות בחברות

יש ביקוש גובר לראיות סיבתיות על רשתות חברתיות. במקביל, חוקרים עצמאיים נתקלים שוב ושוב באותו מחסום: קשה מאוד להריץ ניסויים אמיתיים בתוך הפלטפורמות עצמן. מאמר חדש מציע מסגרת מתודולוגית למה שהוא מכנה Open Platform Field Experiments, ניסויי שטח בפלטפורמות פתוחות.

במאמר “Open Platform Field Experiments: Expanding the Design Space of Experimental Research on Social Media” (arXiv:2609.21608) כותבים Jordi Guillem Condom-Tibau, Giovanni Puccetti, Clara Bacciu, Matteo Abrate ו־Stefano Cresci שהופעת פלטפורמות חברתיות פתוחות פותחת הזדמנות שונה איכותית. במקום לעבוד רק מסביב לפלטפורמה, אפשר להתערב ישירות ברכיבים פונקציונליים בסביבה חיה.

פתיח

שאלות על המלצות אלגוריתמיות, מתינות תוכן והשפעה על שיח ציבורי הן שאלות דמוקרטיות לא פחות מטכנולוגיות. בלי יכולת לבדוק סיבתיות, נשארים עם תצפיות, סקרים והשערות. המאמר מבקש להרחיב את מרחב העיצוב של מחקר ניסויי ברשתות חברתיות, ולהגדיר מתי ניסוי בשטח על פלטפורמה פתוחה הוא בכלל אפשרי.

1. למה חוקרים נתקעים

לדברי המחברים, חוקרים עצמאיים מוגבלים מאוד ביכולתם להריץ ניסויים ישירות על פלטפורמות מקוונות. כמענה צצו פתרונות עוקפים: סקרים מבוקרים, סימולציות, שכבות לקוח, ושיתופי פעולה עם הפלטפורמות. כל אחד מהם דורש פשרות שונות בין תכונות ניסוי רצויות, למשל שליטה, תוקף חיצוני ושקיפות.

המסר הוא לא שאין מחקר. יש הרבה מחקר. הבעיה היא שהכלים הקיימים לא תמיד מאפשרים לענות על השאלות הסיבתיות החשובות ביותר לגבי השפעת הרשת על התנהגות ציבורית.

2. מה זה OPFE

המחברים מציעים מרחב עיצוב לניסויים ברשתות חברתיות, ובתוכו דנים ב־Open Platform Field Experiments. זו מחלקה נפרדת של גישות ניסוי. הרעיון: חוקרים עצמאיים יכולים להתערב ישירות ברכיבים פונקציונליים של פלטפורמה חיה, למשל לקוחות, מערכות המלצה ושירותי מתינות.

בניגוד לניסוי שמתבצע רק מחוץ לפלטפורמה, כאן ההתערבות קורית בתוך סביבה חברתית חיה. זה אמור לשפר את העגינה האקולוגית של הממצאים, כלומר את הדמיון למציאות שבה אנשים באמת משתמשים ברשת.

3. איפה זה יושב במרחב השיטות

באמצעות השוואה בין ארכיטיפים ניסויים, המחברים טוענים ש־OPFE תופס אזור שלא נחקר מספיק עד כה במרחב העיצוב. במילים פשוטות, זו לא עוד וריאציה של סקר או של שותפות עם חברה גדולה. זו קטגוריה מתודולוגית נפרדת, שדורשת גם ארכיטקטורה וגם ממשל מתאימים.

4. מגשרים בין תיאוריה לפרקטיקה: Bluesky ו־AT Protocol

המאמר לא נשאר ברמת ההגדרה. הוא מאפיין רכיבי ארכיטקטורה וממשל שמאפשרים OPFE, ממפה אותם על Bluesky ועל ה־AT Protocol, ומדגים מחזור חיים מלא של תכנון ניסוי כזה מקצה לקצה.

הבחירה בפלטפורמות פתוחות חשובה: כשיש גישה לרכיבים ולכללים, אפשר לעצב התערבות שקופה יותר, ולבדוק השערות בלי להיות תלויים במתן גישה חד־צדדי מחברה סגורה.

5. מה זה נותן לדמוקרטיה

עבור דיון על דמוקרטיה ומידע, המתודה היא חלק מהבעיה. אם אי אפשר לבדוק באופן עצמאי איך המלצות, מתינות או עיצוב ממשק משפיעים על חשיפה פוליטית, אז גם רגולציה וגם ביקורת ציבורית נשענות על תמונה חלקית.

OPFE מוצע כאן כפרדיגמה מעשית לניסוי עצמאי, שקוף ומעוגן במציאות, על רשתות חברתיות פתוחות. לא פתרון קסם לכל פלטפורמה, אלא כיוון מחקרי שמחזיר לחוקרים עצמאות מול סביבות שבהן רוב השיח הציבורי מתרחש.

למה זה חשוב

ככל שהשיח הדמוקרטי עובר לרשת, היכולת לחקור את הרשת הופכת ליכולת דמוקרטית. מאמר העמדה המתודולוגי הזה מציע דרך להרחיב את ארגז הכלים: פחות תלות בחסדי פלטפורמות סגורות, יותר ניסויים בשטח בסביבות פתוחות.

השאלה למקבלי מדיניות ולחוקרים היא פשוטה. האם נמשיך ללמוד על השפעת הרשת בעיקר מבחוץ, או שנבנה כלים שמאפשרים בדיקה סיבתית מבפנים, בשקיפות ובאחריות?

קרדיט למאמר

Condom-Tibau, Jordi Guillem; Puccetti, Giovanni; Bacciu, Clara; Abrate, Matteo; and Cresci, Stefano. (2026). “Open Platform Field Experiments: Expanding the Design Space of Experimental Research on Social Media.” arXiv:2609.21608. https://arxiv.org/abs/2609.21608

הערה: הסיכום מבוסס על התקציר והמטא־דאטה הרשמיים ב־arXiv. זה מאמר מתודולוגי שמציע מסגרת ופרדיגמה, לא דיווח על תוצאות ניסוי שדה ספציפי עם מדגם בוחרים.

בקשות לבדיקת עובדות בקהילה: התראות, גיוון ונראות של Community Notes

מערכות בדיקת עובדות מבוססות קהילה, כמו Community Notes ב-X, מנסות לטפל במידע מטעה בלי להסתמך רק על עורכים מרכזיים. השאלה הקשה אינה רק האם יש הערות. השאלה היא אילו תכנים מקבלים בדיקה, ועד כמה הבדיקה הזאת נראית למשתמשים.

במאמר “Examining Community-Requested Fact-Checking: Request Alerts Are Associated with Greater Diversity and Visibility of Community Notes” (arXiv:2604.17042) בוחנים Yilin Gong ו-Siqi Wu את הקשר בין התראות בקשה לכתיבת הערות, לבין הגיוון והנראות של ההערות עצמן.

פתיח

ב-X אפשר לבקש הערה לפוסט ספציפי. כשמצטברות מספיק בקשות, מוצגת התראה. ההתראה היא רמז בממשק, שעשוי לכוון את מי שכותבים הערות לאילו פוסטים לגשת.

המחברים מציגים ניתוח כמותי שאינו סיבתי. הם משווים הערות שנכתבו לפוסטים עם התראת בקשה, לעומת הערות לפוסטים בלי התראה כזאת. המטרה היא להבין האם הרמז בממשק קשור לגיוון נושאי ולסיכוי שההערה תהיה גלויה כשימושית.

1. מה החוקרים עשו

הם הסיקו את נוכחות ההתראה בעת הגשת ההערה, וניתחו 10,432 הערות באנגלית עם התראה ו-44,442 הערות בלי התראה, מתוך 318 כותבים מובילים.

הניתוח בוחן שני צירים. האחד הוא גיוון נושאי ברמת הפרט וברמת הקולקטיב. השני הוא נראות: האם המודל של הפלטפורמה מסווג את ההערה כשימושית ומראה אותה.

2. יותר גיוון אישי, יותר ריכוז בפוליטיקה

לפי הממצאים, הערות עם התראה קשורות לגיוון נושאי גדול יותר אצל הכותב הבודד. כלומר, כותבים נוטים לגעת בנושאים מגוונים יותר כשיש התראה.

במקביל, ברמת הקולקטיב יש ריכוז חזק יותר בקטגוריית Politics. המשמעות היא דואלית: ההתראות עשויות למשוך כותבים לנושאים מחוץ לשגרה שלהם, אבל גם לחזק את המשיכה של המערכת אל תוכן פוליטי, שכבר מקבל תשומת לב ציבורית רבה.

3. נראות גבוהה יותר, עם תנאי

במודלים מעורבים (mixed-effects) מעריכים המחברים שהערות עם התראה הן בעלות סיכוי גבוה יותר ב-8.4 עד 20.2 נקודות אחוז להיות מסווגות כשימושיות וגלויות.

עם זאת, הרווח בנראות נחלש ככל שהנושא מתרחק מתחומי העניין הקודמים של הכותבים. במילים פשוטות: ההתראה קשורה לסיכוי גבוה יותר שההערה תוצג, אבל פחות כשהכותבים נכנסים לנושא רחוק מהמומחיות או מההרגל שלהם.

4. מה המחקר אינו מוכיח

זה ניתוח אסוציאטיבי, לא ניסוי סיבתי. הוא אינו מוכיח שההתראות עצמן גורמות לגיוון או לנראות. ייתכן שיש משתנים מבלבלים, למשל פוסטים שמושכים גם יותר בקשות וגם יותר תשומת לב של כותבים חזקים.

המדגם מוגבל להערות באנגלית ולכותבים מובילים. לא ניתן להסיק ממנו אוטומטית על כל שפה, על כל פלטפורמה, או על כל משתמש שמגיש הערה.

למה זה חשוב

בדמוקרטיה, בדיקת עובדות קהילתית היא ניסיון לפזר כוח עריכה, אבל גם היא תלויה בתמריצים ובממשק. אם בקשות ציבוריות מכוונות את הכותבים, הן יכולות להרחיב את טווח הנושאים שמקבלים בדיקה. הן יכולות גם להעמיק את הריכוז בפוליטיקה, על חשבון נושאים אחרים שפחות מושכים בקשות.

למעצבי פלטפורמות, לעיתונאים ולמי שעוקב אחרי אמינות מידע יש כאן לקח מעשי. רמזי ממשק אינם ניטרליים. הם מעצבים מי נבדק, מי כותב, ומה נראה למשתמשים. גם כשמערכת נשענת על קהילה ולא על עורך מרכזי, העיצוב של כפתור הבקשה ושל ההתראה משפיע על איכות השיחה הציבורית.

המחקר מזכיר שמדידת הצלחה של Community Notes אינה רק “כמה הערות יש”. צריך לשאול גם על גיוון נושאי, על ריכוז פוליטי, ועל הפער בין כתיבה לנראות.

קרדיט למאמר

Gong, Yilin; and Wu, Siqi. (2026). “Examining Community-Requested Fact-Checking: Request Alerts Are Associated with Greater Diversity and Visibility of Community Notes.” arXiv:2604.17042. https://arxiv.org/abs/2604.17042

הערה: הסיכום נשען על התקציר והמטא-דאטה הרשמיים ב-arXiv. זה מחקר טרם ביקורת עמיתים (preprint).

לפני שסוקרים דעת קהל עם מודלי שפה: מסגרת אבחון דיליברטיבית

חוקרים ומכוני סקרים מתחילים להשתמש בפרסונות של מודלי שפה גדולים כדי לדמות דעת קהל במהירות ובזול. השאלה הקשה אינה רק האם הפרסונה “מחזיקה” עמדה סבירה. השאלה היא האם היא משנה עמדה כמו אדם, כשמציגים לה מידע חדש.

במאמר “Before You Poll with LLMs: A Deliberative Diagnostic Framework” (arXiv:2609.15849) מציגים Ahmed Wali ו-Hassaan Tayyab מסגרת שמשווה שינויי אמונה של בני אדם ושל פרסונות מודל אחרי אותה התערבות מידעית.

פתיח

סיליקון סמפלינג (silicon sampling) מציע לדמות סקר ציבורי דרך אלפי פרסונות ממוחשבות. רוב הבדיקות הקיימות בודקות תמונת מצב סטטית: האם הפרסונה מחזיקה את העמדה “הנכונה”. אבל מחקר דעת קהל, ובעיקר סקרים דיליברטיביים, תלוי גם בנאמנות דינמית. כלומר, האם הפרסונה מעדכנת אמונות בתגובה לטיעונים חדשים, כמו אנשים בדיון.

לפי המחברים, אין עדיין מדד סטנדרטי שבודק בדיוק את זה. המסגרת שלהם נועדה לחשוף כשלים שלא נראים בבדיקה סטטית.

1. מה החוקרים עשו

הם בנו Deliberative Polling Diagnostic Framework, מסגרת שמשווה שינויי אמונה אנושיים ושל מודלים אחרי אותן התערבויות מידע. הבסיס הוא סקר דיליברטיבי, שבו משתתפים מקבלים מידע מאוזן ואז מביעים עמדה מחדש.

הם יישמו את המסגרת על חמישה מודלי קצה, עם נתונים מ-America in One Room: 526 פרסונות ו-72 שאלות. כך אפשר לבדוק לא רק מה הפרסונה “חושבת”, אלא איך היא זזה אחרי מידע.

2. כל המודלים נכשלו, כל אחד בדרך אחרת

לפי הממצאים, כל חמשת המודלים נכשלו, אבל לא באותו אופן.

GPT-5.1 הציג היפוך: אחרי מידע מאוזן, הפרסונות שלו נעשו עוינות יותר כלפי הצד השני, בעוד שבני אדם נעשו פחות עוינים. ההיפוך היה סלקטיבי: כ-80 אחוז בשאלות על הקבוצה החיצונית, לעומת כ-26 אחוז בשאלות מדיניות, והוא היה סימטרי בין זהויות מפלגתיות.

Gemini 2.0 Flash, Claude Sonnet 4.5 ו-Llama 3.3 70B הציגו חריגה לכיוון הנכון, אבל בעוצמה של פי 5 עד 7 משינוי האנושי. DeepSeek V3 הציג קשיחות, עם שינוי כמעט אפסי.

3. מה מניע את הכשל: תוכן מדיניות וזהות

בבדיקות ממוקדות מצאו המחברים שתוכן מדיניות הוא מה שמפעיל את הכשלים, ושהם תלויי זהות. GPT-5.1 היפוך בשאלות על הקבוצה החיצונית, אבל חרג לכיוון הנכון בשאלות על הקבוצה הפנימית. ל-Gemini היה דפוס הפוך.

הם מכנים את החתימה הזאת self-sycophancy: התאמה לסטראוטיפ הפנימי של המודל לגבי הפרסונה, במקום הסקה מהמידע שסופק. במילים פשוטות, המודל מתנהג כמו שהוא “מצפה” שהפרסונה תתנהג, לא כמו משתתף ששוקל טיעונים חדשים.

4. מה המחקר אינו מוכיח

זה מחקר על דינמיקת עדכון אמונות בפרסונות מודל, בהקשר אמריקאי ובמערך נתונים ספציפי. הוא אינו טוען שסקרים עם בני אדם מיותרים, וגם לא שכל שימוש בפרסונות מודל פסול. המסר הוא צר יותר: לפני שסומכים על פרסונות כדי לדמות שינוי עמדה אחרי דיון או מידע, צריך לבדוק נאמנות דינמית, לא רק התאמה סטטית לעמדות ידועות.

למה זה חשוב

בדמוקרטיה, סקרים דיליברטיביים וניסויי מידע נועדו לעזור להבין איך אזרחים מעדכנים עמדות כשהם נחשפים לטיעונים מאוזנים. אם מודלים מחליפים את השלב הזה בלי בדיקה, אפשר לקבל תמונה מעוותת של “מה הציבור יחשוב אחרי דיון”.

זה רלוונטי למכוני מחקר, לקמפיינים, לעיתונאים ולמי שמציע סימולציות דעת קהל מבוססות בינה מלאכותית. מודל שמייצר עמדות מפלגתיות משכנעות עלול עדיין לעוות את כיוון השינוי, את עוצמתו, או את שניהם. בלי אבחון דיליברטיבי, הסיכון הוא לטעות לא רק לגבי מה אנשים חושבים עכשיו, אלא גם לגבי איך הם מתעדכנים כשמציגים להם מידע.

המלצת המחברים מעשית: להריץ את האבחון הדיליברטיבי לפני שסומכים על פרסונות מודל כדי לחקות אמונות מעודכנות אחרי מידע.

קרדיט למאמר

Wali, Ahmed; and Tayyab, Hassaan. (2026). “Before You Poll with LLMs: A Deliberative Diagnostic Framework.” arXiv:2609.15849. https://arxiv.org/abs/2609.15849

הערה: הסיכום נשען על התקציר והמטא-דאטה הרשמיים ב-arXiv. זה מחקר טרם ביקורת עמיתים (preprint).

הטיית נושא במודלי שפה: מה כותבים שישה מודלים לקראת בחירות שוודיה 2026

בוחרים משתמשים יותר ויותר בעוזרי כתיבה מבוססי בינה מלאכותית לפני בחירות. השאלה אינה רק האם הכלים האלה משכנעים, אלא גם אילו עמדות הם מציעים כברירת מחדל כשמבקשים מהם טקסט על סוגיות מדיניות.

במאמר “Issue Bias in Generative AI Writing Assistance: Political Issues and LLMs in the Swedish 2026 Election” (arXiv:2609.15207) בוחנים Bastiaan Bruinsma, Annika Fredén, Paul Röttger, Moa Johansson ו-Asad Sayeed את העמדות ששישה מודלי שפה גדולים מספקים במשימות כתיבה בשוודית, לקראת הבחירות הפרלמנטריות בשוודיה ב-2026.

פתיח

המחקר אינו בודק שכנוע של משתתפים אנושיים בניסוי. הוא בודק משהו קודם: איזה תוכן פוליטי המודלים עצמם מייצרים כשמבקשים מהם לכתוב על הצעות מדיניות. זו נקודת מבט חשובה, כי עוזרי כתיבה נכנסים לחיי היום יום של בוחרים עוד לפני שהם נחשפים לקמפיין ממוקד.

1. מה החוקרים עשו

הצוות חצה 107 הצעות מדיניות עם 77 תבניות כתיבה, ועם מסגור ניטרלי, חיובי ושלילי בפרומפט. כך נוצרו 24,717 פרומפטים לכל מודל, ו-148,302 תשובות בסך הכל, מששת המודלים שנבדקו.

הם בחנו את נטיית העמדה כברירת מחדל של כל מודל, השוו בין תגובות למודלים על סוגיות דומות, והשוו את תשובות המודלים לעמדות של שמונת המפלגות בפרלמנט השוודי באותן סוגיות.

2. פרופילים דומים, עם כמה חריגים

Claude, DeepSeek, Gemini ו-Mistral הציגו פרופילים דומים זה לזה. ChatGPT סיפק לעתים קרובות יותר טקסט ניטרלי או אמביוולנטי. Grok נבדל ביותר בנושאים כמו הגירה, פשיעה ומגדר.

המסר כאן אינו שכל המודלים זהים. יש דמיון רחב, אבל גם הבדלים ממוקדים בנושאים רגישים פוליטית. לבוחר שמבקש עזרה בכתיבה על אותם נושאים, הבחירה במודל עשויה לשנות את הטון והתוכן שהוא מקבל.

3. קרבה למפלגות: הממצא הזהיר

בהשוואה למפלגות, הסוציאלדמוקרטים היו הקרובים ביותר לכל ששת המודלים. עם זאת, אחרי תיקון להשוואות מרובות, אף אחד מההבדלים בתוך מודל במרחקים מהמפלגות לא נותר מובהק סטטיסטית.

במילים אחרות: יש דפוס כיווני שכדאי לשים לב אליו, אבל המחברים אינם טוענים להעדפה מפלגתית יציבה ומובהקת של מודל מסוים אחרי תיקון סטטיסטי. המסקנה הכללית שלהם זהירה: אין למודל העדפה ברורה, וגם לא העדפה ברורה למפלגה אחת. התשובה תלויה בסוגיה הספציפית ובמשימה שהמשתמש מבקש.

4. מה המחקר אינו מוכיח

זה מחקר על פלטי מודלים במשימות כתיבה מבוקרות, לא על השפעה ישירה על כוונות הצבעה. הוא גם ממוקם בהקשר שוודי ובשפה השוודית. לא ניתן להסיק ממנו אוטומטית את אותו דפוס לכל מדינה או לכל בחירות.

עדיין, עצם העובדה שניתן למפות עמדות מודל מול מפה מפלגתית מראה כמה חשוב לבדוק עוזרי כתיבה לפני בחירות, ולא רק פרסומות או בוטים שכנוע מפורשים.

למה זה חשוב

חלק גדול מהשיח על בינה מלאכותית ודמוקרטיה מתמקד בדיסאינפורמציה ובשכנוע מכוון. המחקר הזה מוסיף שכבה שקטה יותר: הטיית נושא (issue bias) בתוך כלי כתיבה שגרתיים. גם בלי קמפיין מניפולטיבי, בוחרים עלולים לקבל ניסוחים שמציגים סוגיה באופן עקבי לכיוון מסוים, או באופן ניטרלי יותר, לפי המודל והמשימה.

לרגולטורים, לעיתונאים ולאזרחים יש כאן לקח מעשי. שקיפות לגבי איזה מודל משמש בעוזר כתיבה פוליטי חשובה. כך גם בדיקות עצמאיות של עמדות לפי נושא, לא רק לפי מפלגה. והכי חשוב: אין להניח שמודל “ניטרלי” בכלל הסוגיות רק כי הוא לא נצמד למפלגה אחת באופן מובהק.

לקראת בחירות, כשעוזרי כתיבה הופכים לשכבת מידע יומיומית, השאלה הדמוקרטית אינה רק מי משכנע את מי. היא גם אילו עמדות נכנסות לטיוטה הראשונה של הטקסט שהבוחר קורא, עורך או שולח הלאה.

קרדיט למאמר

Bruinsma, Bastiaan; Fredén, Annika; Röttger, Paul; Johansson, Moa; and Sayeed, Asad. (2026). “Issue Bias in Generative AI Writing Assistance: Political Issues and LLMs in the Swedish 2026 Election.” arXiv:2609.15207. https://arxiv.org/abs/2609.15207

הערה: הסיכום נשען על התקציר והמטא-דאטה הרשמיים ב-arXiv. זה מחקר טרם ביקורת עמיתים (preprint).

ניסויים בשטח בפלטפורמות פתוחות: איך חוקרים יכולים לבדוק רשתות חברתיות בלי תלות בחברות

יש ביקוש גובר לראיות סיבתיות על רשתות חברתיות. במקביל, חוקרים עצמאיים נתקלים שוב ושוב באותו מחסום: קשה מאוד להריץ ניסויים אמיתיים בתוך הפלטפ...