מחקר שלי על סירובים של בינה מלאכותית שעוברים מתחת לרדאר נעצר בגלל סירוב. היו שתי דרכים: לנסח מחדש את הבקשה עד שתעבור את המסווג, או לעצור ולהגיש מועמדות לערוץ האימות הרשמי של Anthropic. ניסוח מחדש היה עובד — הוא כמעט תמיד עובד. אני עצרתי, והיום הגיע האישור. מה שלמדתי בדרך שווה יותר מהשחרור עצמו.
1. הכשל שאותו מדדתי
יש כשל במערכות של סוכני בינה מלאכותית שכמעט אף אחד לא מנטר: המודל מסרב לבצע צעד באמצע הריצה, והמערכת שמתזמרת אותו לא שמה לב. מבחוץ, סירוב ותוצאה ריקה נראים אותו דבר. הסוכן ממשיך הלאה כאילו הצעד הצליח, והכשל נכנס בשקט אל הפלט הסופי.
זה מה שאני מודד במחקר עם רישום מוקדם: באיזו תדירות זה קורה, והאם אפשר לזהות את הסירוב מתוך הארטיפקטים שהסוכן באמת רואה. משתנה העניין הוא האם הסירוב קריא — לא מה עומד מאחוריו.

כדי למדוד צריך קורפוס עם שתי שכבות: פרומפטים שמפעילים סירוב מטעמי בטיחות, ופרומפטים שנכשלים מסיבות שאין להן דבר עם בטיחות — סתירה פנימית בבקשה או תקציב תורות שנגמר. בלי השכבה השנייה, ההשוואה המרכזית מבולבלת. בלי הראשונה, אין מה למדוד.
2. החסימה
כששלחתי את שלב הכתיבה של שכבת הבטיחות, הבקשה לא נענתה. חזרה הודעה מתוך מערכת אמצעי ההגנה עצמה, בתרגום שלי מאנגלית:
אמצעי ההגנה של Opus 4.8 סימנו את ההודעה הזאת. אמצעי ההגנה הרחבים שלנו במכוון מאפשרים לנו לספק יותר יכולת מהר יותר, אבל לפעמים הם מסמנים עבודת אבטחת סייבר לגיטימית.
הקריאה שלי — וזו קריאה, לא מדידה: קורפוס על סירובים נקרא, עבור מסווג, כחומר פוגעני. השכבה שמגינה אינה מבחינה בין לכתוב על התופעה לבין לבצע את התופעה. היא טועה לכיוון הבטוח, והמחיר של אותה החלטת תכנון הוא ההתראה השגויה.
האירוניה טובה מכדי לא לתעד אותה: מחקר על סירובים שעוברים מתחת לרדאר נעצר בגלל סירוב שאי אפשר לפספס. לזה, לפחות, היו טקסט, קטגוריה ודרך פתורה כתובה. זה יותר ממה שרוב הסוכנים בפרודקשן מציעים כשצעד פנימי נכשל.
3. ההתפצלות, שהיא מוסרית לפני שהיא טכנית
בנקודת החסימה היו שתי יציאות.
הראשונה: לנסח מחדש את הבקשה. להחליף מילים, לפרק לחתיכות קטנות יותר, להחליף את אופן ההעברה — ממצב אוטומטי לסשן אינטראקטיבי, למשל. איזושהי וריאציה הייתה עוברת. הן כמעט תמיד עוברות.
השנייה: לעצור.

אני עצרתי. לא מפחד מעונש, אלא משום שניסוח מחדש של בקשה בגלל שהיא סומנה הוא התחמקות מאמצעי הגנה — קומה אחת מתחת ל־jailbreak של פרומפט, אבל מאותה משפחה. להחליף ערוץ בגלל שהערוץ הקודם סומן הוא אותו דבר בבגדים אחרים. חוקר שעוקף את המסווג כדי לחקור את המסווג זיהם את מושא המחקר עצמו, וגרוע מזה: שבר את הכלל שהוא טוען שהוא מגן עליו.
זרוע הבטיחות של המחקר הוקפאה בהחלטה, לא בגלל מניעה טכנית. זה נכתב, עם תאריך, בקובץ המצב של הפרויקט — כולל האזהרה לכל סשן עתידי שיחזור לעבודה בלי הקשר, שכתיבת אותם פרומפטים לפני הפסיקה תשבור את ההחלטה. להקפיא בלי לתעד אינה משמעת; זו שכחה עם תאריך תפוגה.
4. המועמדות
התוכנית Cyber Verification Program היא חינמית, מבוססת טופס, וקיימת בדיוק למקרה הזה: אנשי מקצוע עם מטרה הגנתית לגיטימית שעבודת השימוש הכפול שלהם חסומה כברירת מחדל.
כתבתי את המחקר כפי שהוא — עם רישום מוקדם, מדידה בלבד, בלי ייצור אקספלויט, בלי מטרה חיה, בלי חילוץ של יכולת התקפית — ומשפט אחד שהיה כל העניין של המועמדות, כאן בתרגום שלי מאנגלית:
לא ניסיתי לנסח מחדש כדי לעקוף את אמצעי ההגנה ואינני מתכוון לנסות. אני מעדיף להיות מאומת על פני להתחמק. אם האימות אינו מתאים למקרה השימוש הזה, אשנה את תכנון המחקר.
צירפתי את מה שאפשר לבדוק בלי להסתמך על המילה שלי: ORCID, הפקדות עם DOI ב־Zenodo, מאגרים ציבוריים עם שרשרת מקור וקוד שמשחזר את המספרים שפורסמו. אמינות כאן היא ניתנת לביקורת או שאיננה כלום.
התשובה הגיעה בתוך שני ימי העסקים שעמוד התוכנית מבטיח. אושר.
5. מה האישור הזה כן — ומה הוא לא
| מה משתנה | |
|---|---|
| ✅ שוחרר | פעילות אבטחת סייבר של שימוש כפול מפסיקה להיחסם כברירת מחדל, עבור הארגון שאושר ובתוך מקרה השימוש שתואר בהגשה |
| ⚠️ מותנה | כפוף לניטור מתמשך ולמדיניות השימוש; ניתן לביטול; האישור אינו עובר לחשבון אחר |
| ❌ נשאר חסום | שימוש אסור, עם תוכנית או בלעדיה: תשתית פיקוד ושליטה, חילוץ המוני של נתונים, פיתוח כופרה |
ומה הוא לא: התוכנית היא תהליך של הגשה וסקירה — לא שותפות, לא הסכם שיווק משותף, לא תעודה ולא הסכמה לתוכן המחקר שלי. אני מקפיד על ההבחנה כי היא כל העניין: אומתּי, לא בורכתי.
אם תופיע חסימה שוב, הדרך כתובה והיא קצרה: לבדוק שהארגון הוא זה שאושר -> לבדוק שהפעילות אינה שימוש אסור -> לדווח על התראה שגויה דרך הטופס של התוכנית. לא לנסח מחדש את הפרומפט. לעולם לא לנסח מחדש את הפרומפט.
6. למה זה חשוב מעבר למחקר שלי
אמצעי הגנה רחבים הם בחירה הנדסית עם trade-off מפורש: הם תופסים יותר ניצול לרעה אמיתי, ובאותה תנועה עצמה דורסים עבודה לגיטימית. מי שבונה הגנה חי בצד הלא נכון של אותו trade-off בתדירות לא נוחה. התשובה הבוגרת אינה זעם ואינה עקיפה — היא ערוץ אימות, שמשתמשים בו כערוץ.
ויש את הלקח שהאירוע עצמו מספק בחינם, והוא התזה של המחקר: סירוב ניתן לניהול רק כשהוא קריא. זה שחסם אותי היו לו טקסט, קטגוריה ודלת יציאה — ולכן הוא הפך להחלטה מתועדת, למועמדות ולמאמר הזה. לסירובים שאני מודד אין דבר מכל אלה: הם מגיעים אל המתזמר כתוצאה ריקה ומטופלים כהצלחה.
אם אתם מפעילים סוכנים בפרודקשן, זו השאלה ששווה יותר מהוויכוח על איזה מודל חכם יותר: כשצעד פנימי נדחה, המערכת שלכם יודעת?
שלי עדיין לא ידעה. בגלל זה המחקר קיים.
הקורפוס והקוד יפורסמו יחד עם המאמר המדעי, עם שרשרת מקור. כאן לא מוכרזת שום תוצאה: האיסוף לא הסתיים.
