המחשב הקטן הזה הוא הפתרון של NVIDIA להרצת מודלים מקומיים – בדקנו את ה-Ascent GX10 של ASUS עם 128GB של זיכרון מערכת
עולם ה-AI המקומי מתקדם השנה בקצב מהיר במיוחד. אולי זה קורה כי יותר ויותר אנשים מבינים את היתרונות שבמימוש מודלים מקומיים, אולי זה קורה בשל עליית מחירי החומרה הגלובליים או פשוט ברצון להיות הבעלים היחיד של כל מה שקורה במכונה שמריצה מודל מקומי בלי לשתף את כל העולם במה שאנחנו עושים.
מבט מקרוב
בין שאר היתרונות, העלות באה לשכנע את המשתמש שכמעט כל העלות תהיה על החומרה, כאשר הורדה והתקנה של מודלים תישען על העיקרון שתמיד יהיה מי שישחרר מודלי AI מקומיים חזקים שנוכל להוריד אותם ולהתקין אותם בקלות על המכונה שלנו. אחד המקומות הבולטים שמרכזים את זה היום זה אתר Huggingface שמחזיק במאגר אדיר של מודלים. זה אתר שמתעדכן כמעט כל יום ומחוברות אליו תוכנות וכלים רבים שעוזרים למשתמש להחליט אילו מודלים מתאימים דווקא לו. לפעמים, אגב, זה פשוט עניין של ניסוי וטעיה. משתמשים יכולים לראות איזה הוא האפקטיבי ביותר עבורם.

לצורך כך, בנתה NVIDIA פלטפורמה אשר יכולות יצרניות שונות לקחת וליצור מהן מוצרי שולחן. ה-Ascent GX10 של ASUS הוא בדיוק כזה. מדובר על מחשב לפלטפורמת ה-DGX Spark של NVIDIA אשר מגיע עם ליבה גרפית מסוג GB10 לכל רכיבי המעגל המודפס שלצידה. הפלטפורמה הזאת, שמבוססת על ארכיטקטורה שנקראת NVIDIA Grace Blackwell היא פלטפורמה דלת מעטפת חום (הליבה עצמה כמעט תמיד נשארת מתחת ל-60W) שהתפקיד שלה הוא בעיקר לשמש להרצת מודלים מקומיים גדולים וקטנים כאחד. זו פלטפורמה מבוססת ARM בעלת ליבות A725 לצד ליבה גרפית.
בשביל להריץ מודלים מקומיים צריך זיכרון. בעוד שאין כאן זיכרון גרפי מתקדם דוגמת GDDR6 או GDDR7, כן יש שימוש בזיכרון LPDDR5x. זה זיכרון מערכת כללי מולחם בעל מהירות גבוהה משמעותית מזאת של זיכרון DDR5 סטנדרטי למחשבים, אך לא מהירה כמו זאת שתמצאו בכרטיסי RTX 50 למשל, שם נעשה שימוש ב-GDDR7.
נפח הזיכרון במחשב הזה מגיע ל-128GB של אותו זיכרון LPDDR5x, והוא מגיע בתעבורה של עד 273GB לשניה. בשביל לסבר את האוזן, נפח תעבורת הזיכרון מסוג GDDR7 אפילו בכרטיס מסך כמו RTX 5060 Ti עומד על 448GB לשניה. זאת, כמובן לצד ליבה גרפית עם כמות כפולה של ליבות עיבוד ומעטפת חום של מעל ל-150W לעבודה בתדרים גבוהים.

פלטפורמת GB10 של NVIDIA דומה במה שהיא מציעה גם במוצרים אחרים, ASUS היא אחת מאלה שקיבלו את המטרה לעצב את הקירור ואת האריזה שסביב הלוח המודפס הזה ולקרוא למוצר הזה Ascend GX10. בחלק האחורי אפשר למצוא מספר שקעי USB Type-C מהירים יחד עם אחד שמיועד גם לחיבור ספק הכח החיצוני. במידה ויש מסך HDMI אפשר לחבר את מחבר ה-HDMI ישירות, ובמידה ויש תצוגה שהיא תצוגת Type-C או DisplayPort, אפשר להשתמש באחד משלושת הממשקים המיועדים לזה. יש מחבר RJ45 לתקשורת קווית של עד 10Gbps וגם כרטיס רשת מובנה מסוג ConnectX-7 של NVIDIA. המטרה העיקרית בזה היא לא סתם לספק צמד ממשקי 100Gbps אופטיים, אלא גם לקבל ממשק שדרכו אפשר לחבר מחשבי DGX Spark נוספים בשביל ליצור רשת AI מקומית אחת גדולה.

תחתית המחשב מכילה את פתחי האוויר לגוף הקירור. ה-GX10 מרגיש "דחוס" ושוקל קילוגרם וחצי. אין ממשקים נוספים בצידי המחשב.

ה-GX10 מגיע עם ספק כח חיצוני של 240W במחבר USB Type-C. לא, צריכת החשמל של המחשב במאמץ אפילו לא מתקרבת למספר הזה. אני מניח שאם יכלו לבחור בתקן הספקה ב-USB פשוט בחרו בתקן המתקדם ביותר.
מערכת ההפעלה ושימוש
ה-DGX Spark מגיע עם גרסה מקוסטמת של Ubuntu 24.04 LTS. בקבלת המחשב וחיבורו תראו את מסך הפתיחה, שיוודא שאמצעי הקלט שלכם מחוברים. זאת החוויה שתצפו לכל בכל מחשב שמבוסס על פלטפורמת DGX Spark:



רישום חשבון מתבצע בצורה מקומית לאחר ההפעלה הראשונית ולאחר מכן אפשר להתחיל לעבוד. מערכת ההפעלה מגיעה עם דשבורד נחמד למרות שזה Ubuntu לכל עניין ודבר, אז אפשר תמיד להתקין כלים מתקדמים יותר.

הדשבורד מאפשר צפיה בשימוש זיכרון ומשאבים, ולהתנסות בכל מיני כלים נחמדים שיש לפלטפורמת DGX Spark להציע.

אנחנו התקנו ישר את הכלי LM Studio, שהוא כלי חינמי להרצת מודלים מקומיים אשר מבצע אינטגרציה נוחה עם ספריית המודלים של Huggingface בשביל להוריד את המודלים ולגורם להם לרוץ בצורה מקומית. היינו מתקינים את Cursor, אבל המודל העסקי שלהם השתנה לאחרונה לכלול מנוי בתשלום על הרצת מודלים מקומיים. חבל.

בחירת המודלים בעיקר מתקיימת בעולם שבו משתמש יכול לחפש ברשת את היעוד ואת החוזקות השונות של המודלים ולהוריד אותם. נפח המודל תלוי בכמות הפרמטרים שהוא מכיל, וישנן תכונות נוספות כמו קוואנטיפיקציה, שהיא תכונה שמכווצת את מימדי המודל בשביל לשפר את הנפח שהוא תופס בזיכרון. יותר פרמטרים = נפח גדול יותר של המודל = צריך יותר זיכרון שמיועד להרצת מודלים. פה יש לנו 128GB, אז האפשרויות מאוד רחבות. בתוכנה אפשר לראות במדויק את נפח הזיכרון שצריך כל מודל וכל גרסה שלו. יש מודלים של גוגל, של OpenAI, של Meta ושל Alibaba להורדה, לצד וריאציות מיוחדות של המודלים הללו על ידי משתמשי קהילה, ועוד כמה מודלים אחרים מיוחדים. הספריה גדולה, ו-"נזרקים" לשם מודלים מקומיים בקצב מכובד.

תוכנות כמו Mission Center שאתם רואים עוזרות לנו גם להבין את המדדים של הליבה הגרפית והזיכרון שלרשותה בזמן אמת. בדוגמה הזאת אפשר לראות צריכת חשמל של מעט פחות מ-50W ושימוש בכ-25GB של זיכרון מערכת כולל.

אפשר לראות גם כיצד פועלות 20 ליבות ה-Cortex A725 שבמעבד ה-GB10 של NVIDIA. במונחי ARM מדובר במעבד חזק למדי והוא מגיע לתדר של קרוב ל-4GHz במאמץ.
חשוב לזכור שמודלים מקומיים יכולים להיות שימושיים להמון דברים. לפעמים הדמיון של המשתמש הוא המגבלה למה שאפשר לעשות איתם. זה יכול להיות מודל שהוא סוכן AI שתפקידו לפקח על בית חכם, זה יכול להיות מודל שיעזור לכתוב ולבצע ביקורת לקוד של מתכנת, או אפילו מודל מקומי שנשען על תוכן ויזואלי שמגיע מהזרמת וידאו של מצלמות לצרכי זיהוי, בקרה וניתוח נתונים.
מבחני ביצועים
את מבחני הביצועים אנחנו עורכים עם שישה מבין המודלים המקומיים הפופולריים ביותר כיום, והביצועים ימדדו בשלב היצירה עצמו, ה-"ג'ינרוט". יחידת המידה היא טוקנים לשניה. טוקן היא יחידת עיבוד הקטנה ביותר שמודל יכול לקחת ולעבד כמידע בהתאם למודל עצמו. בכל מודל גודלו של "טוקן" וזמן העיבוד שלו יכול להיות שונה בהתאם לחומרה. את המבחנים אנחנו עורכים עבור בקשות בודדות, ולא מקביליות של מספר תרחישים במקביל בכל מודל.

מתחילים מ-Qwen3.8, מדובר במודל קלאסי להרצה מקומית דווקא במכשירים נטולי נפח זיכרון גדול במיוחד. זה מודל חכם שיכול להשען גם על מאיצים בעלי 16GB של זיכרון בלבד ולכן יש כאן רלוונטיות דווקא לכרטיסי המסך הסטנדרטיים שמציגים. באופן ברור לגמרי, מחשב מיני כמו ה-GX10 עם מעטפת החשמל המוגבלת שלו וזיכרון ה-LPDDR5x שלו לא יעמוד בקצב של מפלצות כאלה לצידו. אמנם, חשוב לציין שאם מריצים הרבה בקשות במקביל עבור מודל שכזה, הוא כנראה היחיד שישרוד בזכות אותם 128GB של זיכרון.
מעניין לראות שבשל גודל המודל הגבולי, נתקל ה-RTX 5060 Ti 16GB בקשיים להגיע למהירות רצויה ונשאר מאחורי ה-GX10.

הנה מודל קטן נוסף, כל כך קטן שהוא יכול להכנס אפילו לסמארטפונים. אפשר לראות כיצד כרטיסי מסך עם משאבים גבוהים משמעותית שיכולים להכיל את המולד מריצים אותו.

מודל GPT OSS של OpenAI עם 20 מיליארד פרמטרים נכנס כולו בשלושת כרטיסי המסך שהדגמנו, ולכן ביצועיהם יהיו גבוהים משמעותית, אפילו אצל ה-RTX 5060 Ti 16GB בהשוואה ל-GX10.

אז למה צריך 128GB של זיכרון במכונת AI מקומית? בדיוק מהסיבה הזאת. מודלים כמו Gemma 4 יכולים להגיע לנפח שפשוט גדול על רוב המאיצים הגראפיים כיום. מודלים שכאלה מניבים תוצר איכותי משמעותית בהשוואה למודלים הפשוטים, כמובן בתלות המטלה והפרויקט.

מודל Muse Glimmer 30b למשל כבר יכשיל מערכות עם מאיץ של 16GB בלבד למודלים, לפחות בקונפיגורציה הזאת. מה קורה כשהמודל גולש לזיכרון מערכת במקום גרפי? האטה משמעותית, כזאת מהסוג שעדיף להמנע ממנו.

אחד המודלים החמים היום לקוד מקומי הוא Qwen3.8 Flash Next. המודל הזה יכול להגיע גם ל-112GB, מה שהופך אותו לאקסקלוסיבי עבור מערכות עם 128GB או יותר, פחות או יותר. בקצב של 12 טוקנים לשניה, לפחות ה-GX10 רץ קדימה בזמן שפתרונות אחרים שבחנו לא קרובים ללהניע.
בעתיד הקרוב נוסיף חומרה נוספת לבחינת המודלים המקומיים שלנו כדי לתת תמונה הרבה יותר מעניינת על השוק. שווה להשאר מעודכנים.
תמורה ומחיר – ASUS Ascent GX10
חומרת AI מקומית למודלים התחילה יקרה ומאז רק הלכה ונהייתה יקרה עוד יותר. בעוד ה-GX10 בקונפיגורציית 128GB התחיל במחיר של כ-16,000 שקלים, הוא הפך ליקר משמעותית בשבועות האחרונים ומחירו חצה את רף 20,000 שקלים בשוק המקומי.

פתרון כמו ה-GX10 או כל פתרון DGX Spark הוא כזה שמאפשר 2 דברים עיקריים בהשוואה לחומרה סטנדרטית:
- הקצה מקבילית של מספר מודלים קטנים (מה שנקרא High concurrency)
- הרצה של מודל מאוד כבד
הנה משהו שה-GeForce שלכם כנראה לא יעשה. ניתן באמצעות נפח הזיכרון הזה לטעון מודל ולהריץ מספר גדול של בקשות במקביל. מרווח הנשימה ש-128GB מעניקים מאפשר עבודה במקביל על אותו הפרויקט, או עבודה על פרויקטים שונים בו-זמנית. לרוב, כח העיבוד הראשי מחוץ לזיכרון יגביל מעט, אבל נפח הזיכרון הכללי יאפשר דבר שכזה.
מה אפשר לעשות אחרת ב-20,000 שקלים? שאלה מורכבת. זה מוצר מאוד קומפקטי ונחמד עם הרבה זיכרון. אם המטרה היא להריץ מודלים גדולים במיוחד, באמת שאין הרבה. אפשר לבנות מחשב עם כרטיס בעל 16GB, או אפילו צמד אבל תהיו מאוד מוגבלים כשזה מגיע למודלים רציניים. אפשר לשקול את המתחרה, מוצר מבוסס מעבד Ryzen AI 395 MAX עם 128GB של זיכרון, אבל תצפו לקבל ביצועים נמוכים יותר, לעיתים בעשרות אחוזים.
חומרת גיימינג וחומרת AI מכוונות לנקודות מחיר קשוחות מסיבות ברורות, והסיבות הן בין ביתר בדיוק המוצרים הללו. בעבר הלא רחוק מחשב מבוסס צמד RTX 5090 היה יכול להגיע לאיזור 25-27 אלף שקלים, אבל הזמנים האלה עברו, ואנחנו לא יודעים מתי יחזרו.
יהיה מעניין לראות איך השוק יגיב למוצרים מהסוג הזה, אם בכלל. האם אפשר בכלל להשיק כרטיסי מסך בעלי נפח גבוה של זיכרון GDDR מכל סוג מבלי להגיע לעלויות מטורפות? לא כרגע לפחות. נראה שבתג המחיר שלו, ה-DGX Spark וספציפית מוצרים כמו ה-GX10 של ASUS הם הגיוניים למי שבאמת צריך נפח גדול של זיכרון להרצת מודלים, בין אם קטנים במקביל או גדולים בקצב שאפשר לעבוד איתו.



