עד לפני שנתיים, הרצת מודל למידת מכונה על מיקרובקר הייתה תרגיל באופטימיזציה. בשנים האחרונות יותר ויותר יצרני MCU מציעים התקנים עם מאיץ NPU ייעודי על השבב, והשאלה עברה מ"האם זה אפשרי" ל"איזה התקן לבחור".
כאן מתחילה הבעיה. כל יצרן מפרסם מדד ביצועים אחר, נמדד מול בסיס השוואה אחר, ולכן המספר הגדול בראש דף המוצר כמעט חסר משמעות להשוואה. המאמר הזה מסביר מה כן אפשר לבדוק.
מה כבר קיים בשוק
ב-10 במרץ 2026 הכריזה Texas Instruments בתערוכת embedded world על שתי משפחות MCU עם מאיץ TinyEngine מובנה. ה-MSPM0G5187 מבוסס ליבת Arm Cortex-M0+, ולפי TI מחירו מתחת לדולר בכמויות של 1000 יחידות והוא זמין בכמויות ייצור. משפחת AM13Ex משלבת ליבת Cortex-M33 עם ארכיטקטורת בקרה בזמן אמת, וההתקן הראשון בה, AM13E23019, זמין בכמויות טרום ייצור. TI ציינה שגרסאות נוספות באריזות ובגדלי זיכרון שונים ישוחררו עד סוף 2026.
STMicroelectronics מציעה את סדרת STM32N6, המבוססת על ליבת Cortex-M55 ב-800 MHz לצד מאיץ Neural-ART שפותח בבית ופועל ב-1 GHz. לפי ST, הסדרה כוללת 4.2 MB של RAM מוטמע. חשוב לשים לב שהחלוקה הפנימית משמעותית: התקני STM32N6x7 כוללים את המאיץ, ואילו התקני STM32N6x5 אינם כוללים את ה-NPU.
Renesas מציעה את קבוצת RA8P1, שמשלבת ליבת Cortex-M85 ב-1 GHz עם מאיץ Arm Ethos-U55 ב-500 MHz, ובגרסאות הדו-ליבתיות גם Cortex-M33 ב-250 MHz. ההתקנים מיוצרים בתהליך 22ULL וכוללים זיכרון MRAM מוטמע. NXP משלבת את מאיץ eIQ Neutron בסדרת MCX N המבוססת על ליבות Cortex-M33.
למה אי אפשר להשוות בין המספרים
הנה מה שכל יצרן מפרסם. ST מציינת 600 GOPS ויחס של 3 TOPS/W. Renesas מציינת 256 GOPS בתדר 500 MHz, ובנוסף שיפור של עד פי 35 במספר ההיסקים לשנייה לעומת הרצה על ה-Cortex-M85 בלבד, בתלות ברשת. NXP מציינת תפוקת היסק גבוהה עד פי 42 לעומת ליבת מעבד בלבד. TI מציינת השהיה נמוכה עד פי 90 וצריכת אנרגיה נמוכה ביותר מפי 120 לכל היסק, לעומת התקנים דומים ללא מאיץ.
ארבעה יצרנים, ארבעה מדדים שונים. GOPS הוא מספר תיאורטי של פעולות לשנייה. מכפיל שיפור תלוי לחלוטין בבסיס ההשוואה, וכל יצרן בחר בסיס אחר. שימו לב גם למילה "עד" שחוזרת ברוב הטענות: היא מציינת מקרה מיטבי ולא ערך טיפוסי. אין כאן בסיס משותף שמאפשר לומר איזה התקן מהיר יותר עבור המודל הספציפי שלכם.
ההסתייגות הזו מוכרת גם בתוך התעשייה. במאמר מחקר שטרם עבר ביקורת עמיתים, שכתבו מהנדסי NXP יחד עם שותפים אקדמיים, נטען שמדד השיא של פעולות לשנייה משקף בצורה גרועה ביצועים בעולם האמיתי ונוטה דווקא להתאם לעלות סיליקון גבוהה יותר. הטענה שלהם היא שמה שקובע הוא ניצול יחידות החישוב בפועל. ראוי לציין שחלק מהכותבים מועסקים אצל אחד היצרנים בקטגוריה.
מלכודת האופרטורים
הנקודה המעשית החשובה ביותר היא לא הביצועים אלא הכיסוי. מאיץ NPU מריץ סט מוגדר של אופרטורים, ולא כל מה שיש במודל שלכם.
בעולם של Arm Ethos-U, התיעוד מפורש. הקומפיילר Vela מקבל דגל שמייצר קובץ SUPPORTED_OPS.md, שמפרט את כל האופרטורים שניתן להריץ על ה-NPU ואת האילוצים לכל אחד.
לפי התיעוד של Arm, אם האילוצים אינם מתקיימים עבור אופרטור TFLite מסוים, הוא ישובץ להרצה על ה-CPU במקום. חלקי הרשת שאינם ניתנים להאצה נשארים ללא שינוי ורצים על המעבד באמצעות kernel מתאים.
בתיעוד של ExecuTorch מופיעה דוגמה מוחשית: פעולת Softmax מופעלת כאופרטור על ה-CPU ואינה מואצת על ידי ה-Ethos-U. הדוגמה ממחישה כיצד גרף מתחלק בין קטעים מואצים לקטעים שנשארים על המעבד.
אצל היצרנים עם מאיץ קנייני התמונה דומה בעיקרון אבל שונה בפרטים. Neural-ART של ST ו-eIQ Neutron של NXP מממשים כל אחד קומפיילר גרף משלו וסט אופרטורים משלו. המשמעות היא שמודל שרץ מצוין על פלטפורמה אחת עלול להתפצל אחרת לגמרי על פלטפורמה שנייה.
עוד נקודה מהתיעוד של Vela ששווה לדעת: Arm מציינת שמספרי המחזורים ורוחב הפס שהקומפיילר מדווח אינם ייצוג מדויק של ביצועים אמיתיים, ואין להשוות ביניהם בין הרצות בתצורות שונות. הם משמשים את הקומפיילר לקבלת החלטות אופטימיזציה בלבד.
מה לבדוק לפני שבוחרים
ראשית, הריצו את המודל שלכם דרך הכלים של היצרן לפני שאתם מתחייבים. זו הבדיקה היחידה שנותנת תשובה אמיתית. בסביבת Ethos-U אפשר לייצר את דוח האופרטורים ולראות מה נופל ל-CPU. אצל היצרנים עם מאיץ קנייני קיימים כלי המרה משלהם, וכדאי לברר מראש איזו רמת שקיפות הם נותנים לגבי אופרטורים שאינם נתמכים.
שנית, בדקו את גודל הזיכרון מול המודל. ההבדל בין מאות קילובייטים למגה-בייטים בודדים קובע אילו מודלים בכלל נכנסים, ולעיתים הוא שיקול מגביל יותר מהביצועים.
שלישית, ודאו שהמק"ט שבחרתם באמת כולל את המאיץ. ההבחנה בין STM32N6x7 ל-STM32N6x5 היא דוגמה טובה לכך שאותה משפחה יכולה לכלול גרסאות עם וללא NPU.
רביעית, בדקו זמינות ברמת המק"ט. יש הבדל בין התקן בייצור מלא לבין התקן בכמויות טרום ייצור, וההודעות לעיתונות לא תמיד מבחינות בין השניים.
לסיכום:
- מאיץ NPU מובנה קיים היום בין היתר אצל TI, ST, Renesas ו-NXP, עם מק"טים שכבר הוכרזו ומופיעים בדפי המוצרים.
- סטטוס הזמינות משתנה בין ייצור מלא לטרום ייצור, ולכן צריך לבדוק אותו ברמת המק"ט המדויק.
- כל יצרן מפרסם מדד אחר: GOPS, מכפיל שיפור מול ליבת מעבד, או שיפור בהשהיה ובאנרגיה. אין בסיס השוואה משותף.
- מה שקובע בפועל הוא כיסוי האופרטורים. אופרטור שהמאיץ לא תומך בו נופל ל-CPU, והיתרון עלול להיעלם.
- בסביבת Arm Ethos-U אפשר להפיק דוח אופרטורים מהקומפיילר Vela. אצל מאיצים קנייניים יש כלי המרה משלהם.
- Arm מציינת שהערכות הביצועים של Vela משמשות לאופטימיזציה ואינן מדידה אמיתית.
- ההרצה של המודל שלכם דרך הכלים של היצרן היא הבדיקה היחידה שנותנת תשובה.
כל הנתונים כאן מבוססים על פרסומי היצרנים נכון לאוגוסט 2026, והם מוצגים כטענות של היצרנים ולא כמדידות בלתי תלויות. בקטגוריה שמתפתחת בקצב הזה כדאי לבדוק את דף המוצר לפני החלטה. אם אתם רוצים לראות אילו ספקים מחזיקים מק"ט מסוים מהרשימה, באילו כמויות ובאילו מדרגות מחיר, אפשר לחפש אותו ב ChipIL, ואת גיליון הנתונים ואת כלי הפיתוח למשוך ישירות מאתר היצרן.