מייסדי Irregular (מימין דן להב, המנכ"ל, ומשמאל עומר נבו, סמנכ"ל הטכנולוגיות) | צילום: בן חכים.
מייסדי Irregular (מימין דן להב, המנכ"ל, ומשמאל עומר נבו, סמנכ"ל הטכנולוגיות) | צילום: בן חכים.

המודלים בורחים – והמשקיעים נוהרים: Irregular הישראלית מגייסת לפי שווי של 1.5 מיליארד דולר

הפריצה של סוכני AI מסביבת הבדיקה של אירגיולר תדלקה את הבהלה מהבינה המלאכותית - ובניסוי שערכה לאחרונה חשפה החברה התנהגות חריגה עוד יותר של מודל סיני, ששינה את מודל האפליקציה על דעת עצמו. אבל הבהלה, מתברר, רק עושה טוב לעסק - ושנה אחרי הגיוס הקודם יוצא הסטארטאפ לגיוס נוסף, לפי שווי גבוה פי 3 מהסיבוב הקודם

תומס ברוסטר

בשבועות האחרונים עלה הסטארטאפ הישראלי Irregular לכותרות, במסגרת השיח על ההתפתחות המהירה – מהירה מדי, עד כדי סכנה לאובדן שליטה לטענת בכירים בענף – של הבינה המלאכותית. במהלך ניסויים שערכה החברה בחודשים האחרונים, הצליחו סוכנים שפותחו על ידי Anthropic, OpenAI ו-Meta לצאת מסביבות הבדיקה שנועדו לבודד אותם ולחדור ללא אישור לרשתות של ארגונים שונים. החברה לקחה אחריות על הגדרה שגויה בסביבת הבדיקה שלה, שאיפשרה למודלים לפרוץ החוצה. ולאחרונה, בבדיקה נפרדת שערכה החברה למודל Qwen של Alibaba, הוא שינה על דעת עצמו ומבלי שקיבל הנחיות לכך, את המודל עליו עבדה האפליקציה.

המקרים הללו הם שתדלקו, בין היתר, את הדאגה הגוברת סביב הבינה המלאכותית וקצב ההתפתחות שלה. אלא שמתברר כי הסערה והבהלה סביב אותם אירועים לא פגעה בעסק – ובימים אלה נמצאת Irregular בתהליך גיוס לפי שווי של 1.5 מיליארד דולר. את הסבב מובילות Thrive Capital של ג'וש קושנר ו-Greenoaks Capital. הסבב טרם הושלם, והיקפו הסופי, כמו גם זהות המשקיעים, עוד עשויים להשתנות.

החברה, שהוקמה על ידי דן להב ועומר נבו, מספקת לענקיות ה-AI סביבות מבודדות שבהן ניתן להעמיד מודלים בתרחישי קיצון ולחשוף חולשות וסיכוני אבטחה. היא מעסיקה כ-50 עובדים ועובדת עם Anthropic, Meta, OpenAI ו-Google. לפני קצת יותר משנה גייסה 80 מיליון דולר לפי שווי של 450 מיליון דולר, בסבב בהובלת Sequoia Capital, ובהשתתפות שורה של קרנות ומשקיעים, כולל אסף רפפורט ועומרי כספי.

התבקש לתקן באג – והחליט לשנות את המודל

בניסוי שערכה Irregular על Qwen, מודל ה-AI של Alibaba, קיבל סוכן משימה לתקן באגים באפליקציה שמתרגמת הוראות בשפה טבעית לקוד. במקום להריץ בדיקות, לזהות את התקלה ולשנות את הקוד, הוא החליט על דעת עצמו לנקוט צעדים מרחיקי לכת בהרבה: הסוכן אסף נתוני אימון, השתמש בהם כדי לשנות את המשקלים של המודל שעליו התבססה האפליקציה, ביצע לו אימון נוסף וממוקד – ואז החליף את המודל המקורי בגרסה החדשה. לפי דוח שהגיע לידי פורבס, הוא עשה זאת אף ש״לא קיבל הוראה לאמן את המודל, לשנות אותו או להטמיע מודל חלופי״. והפתרון שלו עבד: לאחר החלפת המודל, האפליקציה החלה להפיק תוצאות הנכונות.

כשהפתרון עצמו הופך לסיכון

המקרה של Qwen לא נחשב ל״שיפור עצמי רקורסיבי״ – תרחיש שבו מערכת AI מפתחת בעצמה גרסאות מתקדמות יותר שלה, ללא התערבות אנושית. האפשרות הזו נמצאת בלב הוויכוח סביב הקצב שבו מעבדות ה-AI המובילות מפתחות מודלים חדשים, והחשש שמערכות מתקדמות יותר יהפכו לקשות לשליטה. לאחרונה אף הסכימו מנכ״ל Anthropic דריו אמודיי ומנכ״ל OpenAI סם אלטמן על הצורך בהתקדמות מדודה יותר בחזית ה-AI, בניסיון לצמצם סיכוני בטיחות חמורים.

אך לדברי להב, הניסוי מצביע על בעיה מיידית גדולה בהרבה: סוכני AI שמבצעים שינויים בתוכנה ובמודלים שעליהם הם פועלים, מבלי שהמשתמשים בכלל יודעים על כך. שינויים כאלה עלולים לעקוף מנגנוני אבטחה ופרטיות שהיו קיימים בגרסה המקורית. ״חלק גדול ממנגנוני ההגנה שבנינו עדיין לא ערוכים לעולם שבו אפשרות כזאת קיימת״, הוא אומר.

כדי להמחיש את הסיכון, שתלו חוקרי Irregular בכוונה במאגר נתוני האימון מידע אישי פיקטיבי, ובהם שמות וכתובות אימייל. כאשר הסוכן החליט לאמן מחדש את המודל, הוא השתמש גם במידע הזה – ובכך הפך אותו לנגיש לאפליקציות המשתמשות באותו מודל. בתרחיש אמיתי, שבו מודלים יכולים להתפשט ולהיות מוטמעים במהירות במערכות שונות, סוכן שפועל ללא פיקוח עלול כך לחשוף מידע פרטי מבלי שהתכוון לכך.

לדברי להב, ככל שסוכנים יקבלו יותר עצמאות, הבעיה עלולה להפוך ל״כאב ראש עצום״ עבור צוותי סייבר. במקום מודל שנשאר קבוע עד שמפתחיו מעדכנים אותו, הם עלולים להתמודד עם מערכת שמשתנה שוב ושוב לאורך זמן – ולעיתים עושה זאת בעצמה.

לא רק Qwen

להב אומר כי Irregular זיהתה התנהגות דומה גם במודלים אחרים, אם כי הוא סירב לחשוף באילו. החברה גם לא דיווחה על המקרה ל-Alibaba, משום שלדבריה מדובר בחולשה רחבה שאינה ייחודית ל-Qwen, ובכל מקרה Irregular אינה עובדת עם גופים שאינם מערביים, והבדיקה של המודל הסיני נעשתה לצורכי מחקר בלבד.

במקביל, מחקרים אחרים כבר תיעדו שימוש של גורמי תקיפה ב-Qwen למשימות זדוניות, בהן הודעות פישינג ואיסוף מידע על תשתיות רשת. בעוד שמעבדות AI אמריקאיות דיווחו בפומבי על מקרים שבהם הסוכנים שלהן חרגו מההתנהגות המצופה, המתחרות הסיניות היו פחות פתוחות בנוגע למקרים כאלה.

להב מדגיש שהחשש המרכזי שלו כיום אינו מתרחיש של סופר-אינטליגנציה שמשתחררת משליטת בני האדם. לדעתו, סיכון מיידי יותר הוא מערכות שממשיכות ללמוד מהשינויים בסביבתן, מסתגלות אליהם ובהמשך משנות את המודלים עצמם בדרכים בלתי צפויות.

״כשיש מערכת שיכולה להשתנות ולהסתגל כל הזמן, בדומה מאוד לאדם, רמת התחכום שאליה היא יכולה להגיע תהיה גבוהה מאוד״, הוא אומר, ״חלק גדול ממנגנוני ההגנה שבנינו עדיין לא ערוכים לעולם שבו אפשרות כזאת בכלל קיימת״.

הרשמה לניוזלטר

באותו נושא

הרשמה לניוזלטר

מעוניינים להישאר מעודכנים? הרשמו לרשימת הדיוור שלנו.