Modulate: 100 מודלים קטנים מנצחים מודל ענק
Modulate מבוסטון גייסה 25 מיליון דולר בהובלת Future Ventures, וסך גיוסיה עומד על 60 מיליון דולר. החברה, שהוקמה ב-2017 על ידי בוגרי MIT, פיתחה ארכיטקטורה של 100 מודלים קטנים במקום מודל ענק אחד — מה שהביא אותה למקום הראשון בשני Leaderboards של Hugging Face. הפלטפורמה מנתחת יותר מ-10 מיליון שעות אודיו בחודש ומשרתת מרכזי שירות, מוסדות בריאות וארגוני אבטחה.

בעוד שכל התעשייה רודפת אחרי מודלים גדולים יותר, חברת Modulate מבוסטון הימרה על גישה הפוכה — והיא גייסה עכשיו 25 מיליון דולר כדי להוכיח שהיא צודקת. את סבב הגיוס הובילה Future Ventures, בהשתתפות Hyperplane (שהשקיעה כבר בסבב ה-seed) ו-Lakestar (שהובילה את סבב ה-Series A ב-2022). סך ההשקעות הכולל בחברה עומד על 60 מיליון דולר.
100 מודלים קטנים במקום מודל ענק אחד
השיטה של Modulate, שנקראת Ensemble Listening Model, בנויה על יותר מ-100 מודלי AI קטנים, שכל אחד מהם מתמחה בתחום ספציפי: ניתוח רגשות, זיהוי טון דיבור, זיהוי deepfake, זיהוי כוונה ואכיפת מדיניות. מתזמר חכם בוחר בזמן אמת אילו מודלים להפעיל לכל שיחה ומחבר את התוצאות. לדברי החברה, הארכיטקטורה הזו יעילה פי 1,000 מהעברת אותו אודיו למודל ענק אחד — מה שחוסך בעלויות מחשוב ומאפשר לאמן מודלים חדשים ולהוסיף אותם למערכת בלי להתחיל הכול מחדש.
וההוכחות בשטח: שניים מהמוצרים של החברה הגיעו למקום הראשון ב-Leaderboards של Hugging Face השנה. מודל התמלול שלהם כבש את הפסגה של Open ASR Leaderboard ביולי, ומודל זיהוי ה-deepfake, Velma Deepfake Detect, מוביל את ה-Speech Deepfake Arena עם דיוק של 98.9% בבדיקות ציבוריות. יותר מ-10 מיליון שעות אודיו עוברות דרך המערכת מדי חודש, והסך הכולל עבר לאחרונה את 600 מיליון השעות.
מ-Gaming ועד Deepfake Detection
Modulate נוסדה ב-2017 על ידי Mike Pappas ו-Carter Huffman, בוגרי MIT בפיזיקה. בהתחלה החברה התמקדה בעיוות קול לגיימינג, אחר כך עברה לניטור קולי — זיהוי הטרדה ו-predatory behavior בפלטפורמות גיימינג וסושיאל. עם עליית מודלי ה-AI הקוליים, החברה התרחבה לתחום הרחב יותר של ניתוח כוונה וזיהוי זיופים.
היום הפלטפורמה המרכזית, Velma, משרתת מגוון רחב של תעשיות. מרכזי שירות לקוחות משתמשים בה כדי להבין למה שיחה הצליחה או נכשלה — הרבה מעבר לתמלול בסיסי. מוסדות בריאות מזהים בעזרתה התחזות קולית של עובדים. ארגונים מוודאים שסוכני AI עומדים בדרישות הרגולציה. החברה מציינת שהטכנולוגיה שלה משמשת גם לניטור מתקפות סייבר דרך שיחות קוליות. המחיר נגיש — תמלול דרך ה-API הקיים עולה שלושה סנטים לשעה.
״הקול הופך לממשק הראשי של ה-AI, וזה יוצר בעיות חדשות שאי אפשר לפתור מתמלול,״ אמר Huffman. לדבריו, הניתוח הרגשי של Modulate הולך הרבה מעבר ל״חיובי/שלילי״ — אנשים יכולים להיות מנומסים כלפי סוכן AI אבל מאוד לא מרוצים, וזה משהו שמודל פשוט לא קולט.
לאן הולך הכסף?
החברה מתכננת לבנות SDKs ו-APIs חדשים שיקלו על מפתחים לשלב את היכולות, להרחיב את האינטגרציות עם שותפים ולהוסיף אנשי מחקר, הנדסה ויחסי מפתחים. כרגע עובדים בחברה 40–45 אנשים, ועוד 10 יצטרפו בקרוב. החברה גם מפתחת יכולות לפריסה on-premises ובמכשיר עצמו — מה שחשוב במיוחד כשמדובר בנתוני שמע רגישים.
Steve Jurvetson, שותף מייסד ב-Future Ventures, אמר של-Modulate יש ״יתרון טכנולוגי משמעותי ב-AI קולי״ ושהצורך בטכנולוגיה הזו מתרחב הרבה מעבר לשורשים שלה בגיימינג — לאבטחה ולבניית סוכנים קוליים.