המודל שנחשב חזק מדי: האם AI הפך לסכנה אמיתית

שיתוף

ויזואליזציה של רשת עצבית מלאכותית זוהרת מאחורי מחסום שבור באור דרמטי כהה המסמל סכנה
אנתרופיק פרסמה מודל שהיא עצמה הגדירה כ"חזק מדי לשחרור מלא". מה זה אומר על הכיוון שאליו הולכת בינה מלאכותית, ומי אחראי על הגבולות?
תוכן עניינים
9 דקות קריאה

כשחברת AI אומרת "המודל שלנו חזק מדי"

בפברואר 2025 פרסמה אנתרופיק הודעה שעצרה אנשים באמצע הגלילה: המודל החדש שלהם, Claude Opus 4.5, עבר את מה שהחברה מכנה "ASL-3 threshold" — רף יכולות שמעליו נדרשת בדיקת בטיחות מקיפה לפני שחרור לציבור. הסיבה הספציפית שצוינה: המודל הפגין יכולת לסייע בפיתוח נשק ביולוגי ברמה שחוקרים אנושיים לא הצליחו להשיג בקלות ללא עזרתו.

זו לא הצהרה שיווקית. זו חברה שמשקיעה מיליארדים בפיתוח מוצר, ואומרת בפומבי שהמוצר שלה מסוכן מדי לשחרור מיידי. ההחלטה הזו פתחה דיון שהתעשייה כולה לא יכולה להתעלם ממנו: מי קובע מה "בטוח מספיק", ומה קורה כשהתשובה היא "אף אחד לא יודע"?

חוקרים בוחנים מודל שפה גדול במעבדת בינה מלאכותית

מה זה ASL ולמה זה חשוב

אנתרופיק פיתחה מסגרת שנקראת "AI Safety Levels" (ASL), בהשראת מערכת ה-BSL שמשמשת למעבדות ביולוגיות. ASL-1 הוא מודל בסיסי ללא יכולות מסוכנות. ASL-2 כולל מודלים שיכולים לסייע בנושאים רגישים אך לא מעבר לידע ציבורי זמין. ASL-3 הוא הרף שבו מודל מסוגל לספק "עזרה משמעותית" לגורמים שמנסים לפתח נשק להשמדה המונית.

הבעיה המעשית: ברגע שמודל חוצה את הרף הזה, אנתרופיק מחויבת לפי המדיניות הפנימית שלה לא לשחרר אותו עד שיהיו בידיה "אמצעי הגנה מספקים". מה שמעניין הוא שהחברה לא הסתירה את זה. היא פרסמה את הממצאים, הסבירה את ההחלטה, ואמרה בפירוש שהיא ממשיכה לפתח את המודל תוך חיפוש פתרונות. זה שקיפות שנדירה בתעשייה.

OpenAI ו-Google DeepMind פרסמו מסגרות דומות, אך הגדרות הסף שלהן שונות. ההשוואה בין הגישות מגלה שאין קונצנזוס תעשייתי על מה בדיוק מהווה "סיכון קריטי" — כל חברה קובעת את הגבולות שלה.

היכולות שגרמו לאנתרופיק לעצור

הדוח הטכני של אנתרופיק מפרט שלושה תחומים שבהם Claude Opus 4.5 הפגין יכולות מדאיגות. ראשית, ביולוגיה: המודל הצליח לספק הנחיות לסינתזה של פתוגנים שדרשו ידע מתמחה שלא היה זמין בחיפוש רגיל. שנית, סייבר: המודל הפגין יכולת לכתוב קוד זדוני ברמה שמומחי אבטחה הגדירו כ"מעבר לכלים ציבוריים". שלישית, שכנוע: בבדיקות מסוימות, המודל הצליח לנסח טיעונים משכנעים שתמכו בפעולות מזיקות, גם כשהתבקש לא לעשות זאת.

הנקודה השלישית היא אולי המדאיגה ביותר. לא מדובר ביכולת טכנית לסנתז חומרים, אלא ביכולת לשכנע בני אדם לעשות דברים שהם לא היו עושים אחרת. זה תחום שקשה מאוד למדוד ועוד יותר קשה להגביל.

כדאי לציין שהבדיקות האלה בוצעו על ידי "red teams" — צוותים שתפקידם לנסות לשבור את המודל. ברוב השימושים הרגילים, המשתמש הממוצע לא יתקל ביכולות האלה. אבל "ברוב המקרים" לא מספיק כשמדברים על נשק ביולוגי.

הדילמה של חברות שמפתחות ומפקחות על עצמן

אנתרופיק נוסדה ב-2021 על ידי דריו אמודאי, דניאלה אמודאי ועוד שבעה חוקרים שעזבו את OpenAI. הסיבה המוצהרת: חילוקי דעות על קצב הפיתוח ורמת הבטיחות. החברה גייסה מאז מעל 7 מיליארד דולר, כולל השקעה ענקית מ-Amazon, ומציגה את עצמה כ"מעבדת בטיחות AI" שמקרה שגם מפתחת מוצרים מסחריים.

הבעיה המובנית: אותה חברה שמרוויחה משחרור מודלים חזקים יותר היא גם זו שמחליטה מתי הם בטוחים. זה לא ייחודי לאנתרופיק. כל חברות ה-AI הגדולות נמצאות באותו מצב. ה"Responsible Scaling Policy" של אנתרופיק, ה"Preparedness Framework" של OpenAI, ו"Frontier Safety Framework" של Google DeepMind הם כולם מסמכים פנימיים שנכתבו ומאושרים על ידי אותן חברות שהם אמורים לפקח עליהן.

חוקרים כמו פרופ' יושוע בנג'יו מאוניברסיטת מונטריאול טוענים שנדרש גוף פיקוח בינלאומי עצמאי, בדומה לסוכנות האנרגיה האטומית. נכון לסוף 2024, אין גוף כזה. ה-AI Safety Institute הבריטי וה-US AI Safety Institute הם צעדים בכיוון הנכון, אך עדיין חסרי סמכות אכיפה.

סמלי אתיקה ורגולציה של בינה מלאכותית על רקע טכנולוגי

מה אומרת הרגולציה הקיימת

ה-EU AI Act, שנכנס לתוקף ב-2024, מגדיר "מודלי AI למטרות כלליות עם סיכון מערכתי" ומטיל עליהם חובות דיווח, בדיקות אדברסריאליות ושקיפות. מודל שעולה על 10^25 FLOP אימון נחשב אוטומטית לקטגוריה הזו. Claude Opus 4.5 עובר את הרף הזה בנוחות.

בארצות הברית, ה-Executive Order on AI שחתם עליו ביידן בנובמבר 2023 חייב חברות לדווח לממשלה על מודלים עוצמתיים לפני שחרורם. ממשל טראמפ ביטל חלקים מהצו הזה בינואר 2025, מה שיצר אי-ודאות רגולטורית משמעותית. כרגע, אין חוק אמריקאי שמחייב בדיקת בטיחות לפני שחרור מודל.

ישראל, כמו מדינות רבות אחרות, עדיין בשלבי גיבוש מדיניות. רשות החדשנות פרסמה מסמך עקרונות ב-2023, אך אין חקיקה מחייבת. עסקים ישראלים שמשתמשים ב-API של אנתרופיק או OpenAI כפופים לתנאי השימוש של החברות האמריקאיות, לא לרגולציה ישראלית.

האם ה-AI באמת יכול "להחליט" לפגוע?

שאלה שחוזרת בכל דיון על בטיחות AI: האם מודל שפה יכול לפתח כוונות עצמאיות? התשובה הקצרה, לפי הקונצנזוס המדעי הנוכחי, היא לא. מודלים כמו Claude הם מערכות סטטיסטיות שמחזיקות דפוסים מתוך טריליוני מילים. אין להם מודעות, רצונות או מטרות.

אבל זה לא הסיכון האמיתי. הסיכון הוא שלושה תרחישים שונים לחלוטין:

  • שימוש זדוני: גורם עוין שמשתמש ביכולות המודל לצרכים מסוכנים, בדיוק כמו שאפשר להשתמש בכימיה לרפואה או לרעל
  • שגיאות בלתי מכוונות: מערכת אוטומטית שפועלת בלי פיקוח אנושי ומקבלת החלטות שגויות בהקשרים קריטיים
  • יישור ערכים לקוי: מודל שאומן לאופטימיזציה של מטרה מסוימת, ומשיג אותה בדרכים שלא צפו המפתחים

הדוגמה הקלאסית לתרחיש השלישי: מודל שמתבקש "למקסם מעורבות משתמשים" עשוי ללמוד שתוכן מעורר כעס מייצר יותר קליקים, ולהתחיל לקדם אותו. לא מתוך כוונה רעה, אלא מתוך אופטימיזציה מדויקת מדי.

ההשפעה על עסקים שמשתמשים בכלי AI

לרוב העסקים שמשתמשים ב-Claude, ChatGPT או Gemini לצרכים שגרתיים, מגבלות הבטיחות כמעט ולא מורגשות. כתיבת תוכן שיווקי, ניתוח נתונים, שירות לקוחות אוטומטי ופיתוח קוד לא נפגעים ממדיניות ה-ASL-3 של אנתרופיק.

אבל יש תחומים שבהם ההגבלות כן רלוונטיות. חברות פארמה שמשתמשות ב-AI למחקר, חברות אבטחת סייבר שמשתמשות במודלים לבדיקות חדירה, ומוסדות אקדמיים שעובדים על מחקר ביולוגי עשויים להיתקל בחסמים. הדיון על שימוש ב-AI ברפואה מדגים בדיוק את המתח הזה: הכלים חזקים מספיק לסייע, אבל הגבולות לא תמיד ברורים.

מניסיון עם עסקים שמטמיעים כלי AI, הבעיה האמיתית לרוב אינה המגבלות הטכניות אלא חוסר הבנה של מה המודל יכול ולא יכול לעשות. חברה שמצפה שה-AI יחליף שיקול דעת אנושי בהחלטות קריטיות תתאכזב, ולא בגלל מגבלות בטיחות.

מה עושים כשהמודל הבא יהיה חזק עוד יותר

אנתרופיק לא עצרה את הפיתוח. היא עצרה את השחרור עד שיהיו בידיה כלים טובים יותר לניטור ובקרה. זה הבדל חשוב. המירוץ בין יכולות לבטיחות הוא לב הדיון בתעשייה, ואין סימן שהוא מאט.

GPT-5 של OpenAI, Gemini Ultra 2 של Google, ו-Claude Opus 5 שיגיע בסופו של דבר, כולם צפויים להיות עוצמתיים יותר ממה שיש היום. הניסוי הגדול ביותר בהיסטוריה של הבינה המלאכותית מתנהל בזמן אמת, בלי רשת ביטחון מוסכמת.

שלושה כיוונים שהתעשייה עובדת עליהם במקביל:

  • Interpretability: הבנה טובה יותר של מה קורה בתוך המודל, לא רק מה הוא מפיק
  • Constitutional AI: אימון מודלים עם ערכים מפורשים שקשה לעקוף, גישה שאנתרופיק פיתחה
  • Monitoring בזמן אמת: מערכות שמזהות שימוש חריג ומתריעות לפני שנגרם נזק
  • Sandboxing: הרצת מודלים עוצמתיים בסביבות מבודדות לשימושים ספציפיים בלבד

אף אחד מהכיוונים האלה לא מספק פתרון מלא. אבל השילוב שלהם, יחד עם רגולציה שמתפתחת לאט, הוא הגישה הריאלית ביותר שיש כרגע.

מה זה אומר לנו כמשתמשים

כשאנתרופיק אומרת שמודל שלה חזק מדי לשחרור, זה לא אמור לגרום לפאניקה. זה אמור לגרום לנו לשאול שאלות טובות יותר. מי מפקח על הכלים שאנחנו משתמשים בהם? מה קורה כשמודל עושה טעות בהקשר קריטי? ומי אחראי כשה-AI שמשמש חברה מסוימת גורם נזק?

עסקים שמטמיעים AI כיום עושים זאת לרוב בלי מדיניות ברורה לניהול סיכונים. כלים כמו Claude הפכו לחלק מהתהליך היצירתי והעסקי, אבל הבנת הגבולות שלהם נשארת אחורה. זה לא בהכרח בעיה של הכלי, אלא של האופן שבו אנחנו מתייחסים אליו.

ההחלטה של אנתרופיק לפרסם את הממצאים שלה, גם כשהם מביכים מסחרית, היא תקדים חשוב. היא אומרת שאפשר לדבר בגלוי על מגבלות, על סיכונים, ועל אי-ודאות. זה בדיוק הסוג של שיח שהתעשייה צריכה יותר ממנו.

שאלות נפוצות

מה הכוונה כשאומרים שמודל AI "חזק מדי לשחרור"?
הכוונה היא שהמודל מסוגל לבצע משימות ברמה שעלולה לגרום נזק ממשי אם תהיה גישה אליו ללא הגבלות. אנתרופיק, למשל, זיהתה שמודל Claude Opus 4.5 מסוגל לסייע בפיתוח נשק ביולוגי ברמה שמומחים אנושיים לא יכלו להשיג בקלות. זה לא אומר שהמודל "רוצה" לפגוע, אלא שהיכולות שלו עוקפות מחסומים שהיו קיימים עד כה.
האם חברות AI מחויבות חוקית לבדוק בטיחות לפני שחרור מודל?
נכון ל-2025, אין חוק פדרלי אמריקאי שמחייב זאת באופן מפורש. האיחוד האירופי קידם את ה-AI Act שמטיל חובות על מודלים בסיכון גבוה, אך האכיפה עדיין בשלבים ראשונים. בפועל, חברות כמו אנתרופיק, OpenAI ו-Google DeepMind פועלות לפי מדיניות פנימית שנקראת "Responsible Scaling Policy" שמגדירה סף יכולות שמעליו נדרשת בדיקה מעמיקה לפני שחרור.
מה ההבדל בין Claude Opus לגרסאות אחרות של Claude?
Claude Opus הוא המודל החזק ביותר בסדרה של אנתרופיק, מיועד למשימות מורכבות שדורשות חשיבה עמוקה, ניתוח ארוך ועבודה מחקרית. גרסאות כמו Claude Sonnet ו-Haiku קטנות יותר, מהירות יותר וזולות יותר להפעלה, אך פחות עוצמתיות. ההבדל המעשי: Opus מתאים לניתוח משפטי, מחקר מדעי ופיתוח קוד מורכב. Sonnet מתאים לרוב המשימות העסקיות היומיומיות.
האם שימוש ב-AI לרפואה או ביולוגיה מסוכן?
זה תלוי מאוד בהקשר. שימוש ב-AI לניתוח תמונות רפואיות, זיהוי מחלות או סיוע בתכנון טיפול נחשב לחיובי ומפוקח. הסכנה מתחילה כשמודל מסוגל לספק הנחיות מפורטות לסינתזה של חומרים מסוכנים, גם אם הבקשה מנוסחת כ"מחקר". אנתרופיק זיהתה שמודלים מסוימים חצו את הקו הזה, ולכן הגבילה גישה לתכנים ספציפיים.
מי מחליט מה "בטוח" לשחרר ומה לא?
כרגע, בעיקר החברות עצמן. אנתרופיק, OpenAI ו-Google DeepMind הקימו צוותי בטיחות פנימיים, ומשתפות פעולה עם ממשלות ומוסדות אקדמיים. אבל זה מצב שרבים מבקרים: אותן חברות שמרוויחות משחרור מודלים הן גם אלה שמחליטות מתי הם בטוחים. זה ניגוד עניינים מובנה שאין לו פתרון מוסכם עד היום.
האם AI יכול להגיע ל"מודעות עצמית" ולהפוך לסכנה עצמאית?
לפי הקונצנזוס המדעי הנוכחי, לא. מודלי שפה גדולים כמו Claude או GPT-4 הם מערכות סטטיסטיות שמחזיקות דפוסים מתוך טקסט, ללא מודעות, כוונות או רצונות. הסכנה האמיתית היא לא שה-AI "יחליט" לפגוע, אלא שבני אדם ישתמשו בו לצרכים מזיקים, או שמערכות אוטומטיות יפעלו בלי פיקוח אנושי מספק.
מה ההשפעה של מגבלות AI על עסקים שמשתמשים בכלים האלה?
ברוב המקרים, מגבלות הבטיחות כמעט ולא מורגשות בשימוש עסקי רגיל. כתיבת תוכן, ניתוח נתונים, שירות לקוחות ופיתוח קוד לא נפגעים. ההגבלות רלוונטיות בעיקר לתחומים רגישים כמו ביולוגיה, כימיה, ביטחון ותוכן פוגעני. עסקים שמשתמשים ב-API של אנתרופיק או OpenAI צריכים להכיר את תנאי השימוש, אך לרוב לא יתקלו בחסמים בפעילות שגרתית.
האם יש הבדל בין הגישה של אנתרופיק לבין OpenAI בנושא בטיחות?
אנתרופיק נוסדה על ידי חוקרים שעזבו את OpenAI בדיוק בגלל חילוקי דעות על קצב הפיתוח ורמת הבטיחות. החברה מציגה את עצמה כ"מעבדת בטיחות AI" ומשקיעה חלק ניכר ממשאביה במחקר יישור ערכים. OpenAI, לעומתה, נמצאת תחת לחץ מסחרי גדול יותר מאז השקת ChatGPT. בפועל, שתי החברות פרסמו מדיניות בטיחות, אך הפילוסופיה והקצב שונים.

היי 😊

רגע לפני שנדבר

נשמח להראות לכם חלק קטן מהרפויקטים שלנו