חדשות כזב עם תיאוריה: כשמודלי שפה פוגשים מדעי החברה

מערכות לזיהוי חדשות כזב נעשות מדויקות יותר. אבל לעיתים קרובות קשה להבין למה הן החליטו כך, והן מנותקות מתיאוריות ותיקות על שכנוע, אמינות ושיפוט אנושי. בדמוקרטיה, זה לא פרט טכני. כשמפיצים מידע מטעה במהירות, גם טעות קטנה בזיהוי יכולה להשפיע על אמון הציבור ועל השיח הציבורי.

במאמר “Fake News Theories: Harnessing Disciplinary Insights for Computational Modeling, Detection, and Explanation” (arXiv:2609.30427) מציעים Zhaoyang Cao, Miriam Metzger ו Reza Zafarani מסגרת שמחברת בין תיאוריות מדעי החברה לבין זיהוי חישובי של חדשות כזב, גם בעזרת מודלי שפה גדולים.

פתיח

המחברים פותחים מהבעיה המוכרת. אנשים מצליחים לעיתים להבחין בין חדשות אמיתיות לכזב, אבל נפח המידע ברשת הופך בדיקה ידנית לבלתי מעשית. לכן נבנות מערכות אוטומטיות, מבוססות תוכן או מבוססות התפשטות ברשת. הבעיה היא שרבות מהן ממוקדות בביצועי חיזוי, ומספקות מעט הסבר שמיש לעיתונאים, לבודקי עובדות או למקבלי החלטות.

המאמר שואל שאלה ברורה. עד כמה אפשר להפוך אותות תיאורטיים מתחומי מדעי החברה לתכונות חישוביות שקופות, שיעזרו להבדיל בין חדשות כזב לחדשות אמיתיות. במקום להסתפק בייצוג לקסיקלי עשיר אבל אטום, הם בונים ייצוג קטן, מפורש, שכל רכיב בו מקושר לתיאוריה.

1. מתרגום תיאוריות לתכונות מדידות

המחברים סוקרים תיאוריות מתחומי תקשורת, פסיכולוגיה, כלכלה ומערכות מידע, וממיינים אותן לשלוש קבוצות: תוכן, מקור, ורשת. התוכן כולל למשל שפת ודאות, שליליות, קוהרנטיות, עקביות לוגית, ראיות תומכות, חזרתיות, מורכבות לשונית, עמימות, ופערי מידע בכותרות. המקור נשען על אמינות המוציא לאור. תיאוריות רשת נשארות ברקע התיאורטי, כי מאגרי הבנצ׳מרק שבדקו לא כללו נתוני התפשטות.

התרגום לחישוב אינו אחיד. חלק מהתכונות נמדדות בכלים סטטיסטיים מוכרים, כמו ניתוח סנטימנט או מדדי קריאות. אחרות נבנות בעזרת מודלי שפה, למשל זיהוי רטוריקה של מחסור, או ספירת חזרות סמנטיות על טענות. אחר כך מוזנות התכונות למסווג XGBoost, כדי לבדוק גם חיזוי וגם חשיבות יחסית של כל אות תיאורטי.

2. מה עובד בנתונים, ומה משתנה בין מאגרים

הניסויים נעשו על שלושה מאגרים מוכרים: ReCOVery, Fake_And_Real_News ו־GossipCop. תכונה בודדת מגיעה לרוב לטווח בינוני של יכולת הבחנה. כשמשלבים את התכונות יחד, הביצוע משתפר. ב־ReCOVery, למשל, המודל המשולב הגיע ל־AUC של כ־0.79 ול־F1 של כ־0.77.

המחברים מדגישים שהמטרה אינה לנצח ייצוג מלא של טקסט כמו TF-IDF. ייצוג לקסיקלי מלא יכול להיות מדויק יותר, כי הוא רואה את כל המילים. המסגרת שלהם מוותרת במכוון על חלק מהדיוק לטובת שקיפות תיאורטית. כשיש מטא־נתונים על המוציא לאור, אמינות המקור בולטת כאות חזק. מעבר לכך, מורכבות המידע, קוהרנטיות, עקביות לוגית והטיית שליליות חוזרות כתרומות יציבות יחסית בין מאגרים.

בתמונת התוכן עצמו, חדשות כזב נוטות להיות שליליות יותר, פשוטות יותר לשונית, עמומות יותר, ועם פערי מידע גדולים יותר בכותרות. אלה דפוסים שמתיישבים עם תיאוריות על תשומת לב ושכנוע, לא רק עם ציון סיווג.

3. אינטראקציה בין תיאוריות, בלי הבטחת קסם

ניתוח של שילובים מראה ששילוב כמה תיאוריות עוזר, אבל לא תמיד באופן דרמטי. שילובי שניים ושלושה רכיבים חזקים, למשל ודאות לשונית יחד עם ראיות תומכות, או מחסור יחד עם ראיות, משפרים מעט את הביצוע. עם זאת, הדירוג היחסי של התכונות אינו זהה בכל מאגר. מה שחזק במאגר אחד יכול להיות חלש באחר, בהתאם לנושא, לסגנון ולמטא־נתונים הזמינים.

זו נקודה חשובה לפריסה. מערכת שמסתמכת על תיאוריה אחת, או על אות יחיד שנראה חזק במאגר מסוים, עלולה להתבלבל בסביבה אחרת. גישה רב תיאורטית נותנת יותר נקודות אחיזה להסבר, גם כשהרווח החיזויי הנוסף צנוע.

למה זה חשוב

בדמוקרטיה, המאבק במידע מטעה אינו רק מרוץ לדיוק אלגוריתמי. הוא גם שאלה של אמון, אחריות והסבר. עיתונאי, בודק עובדות או רגולטור צריכים לדעת לא רק שפריט סומן כחשוד, אלא על סמך אילו אותות אנושיים מוכרים. מסגרת שמקשרת בין ציון המודל לבין תיאוריות על מקור, רגש, עמימות וראיות, מקלה על שיחה כזאת.

המאמר גם מציב גבול בריא לציפיות ממודלי שפה. הם משמשים כאן ככלי לחילוץ אותות תיאורטיים, לא כשופט שחור קופסה שמחליף שיפוט מוסדי. זו גישה שמתאימה היטב למרחב הציבורי: להשתמש ביכולת החישובית בלי לוותר על שפה משותפת עם מדעי החברה ועם מי שמנהל את הסיכון בפועל.

למי שבונה כלי אמינות, לפלטפורמות, ולמי שחושב על מדיניות מידע בבחירות ובשיח ציבורי, יש כאן לקח פשוט. אל תמדדו רק כמה המערכת צודקת. בדקו גם אם היא יכולה להצביע על אותות שקופים, מבוססי תיאוריה, שעמידים מספיק מעבר למאגר אחד. בלי זה, קל לבלבל בין מודל שמנצח בבנצ׳מרק לבין כלי שמחזק את ההגנה הדמוקרטית על מרחב המידע.

קרדיט למאמר

Cao, Zhaoyang; Metzger, Miriam; Zafarani, Reza (2026). “Fake News Theories: Harnessing Disciplinary Insights for Computational Modeling, Detection, and Explanation.” arXiv:2609.30427. https://arxiv.org/abs/2609.30427

הערה: הסיכום נשען על המאמר המלא בarXiv. זה מחקר טרם ביקורת עמיתים (preprint). הממצאים מגיעים ממאגרי בנצ׳מרק של חדשות כזב וממדידות תכונות תיאורטיות, וההעברה לפריסה מוסדית או לסביבות בחירות דורשת זהירות.

אין תגובות:

הוסף רשומת תגובה

כשטקסט מיוצר בלי תהליך: שני סוגי ניתוק של בינה יוצרת

כשאנחנו קוראים פסק דין, מכתב התנצלות או נימוק של רשות מינהלית, אנחנו לא מעריכים רק את המילים. אנחנו מניחים שמישהו חשב, שקל וכתב. בינה מלאכות...