נושא01
מה בדיוק OpenAI הודיעה
בסוף יולי 2026, פחות משלושה שבועות אחרי שהשיקה את משפחת GPT-5.6, OpenAI עשתה משהו שחברות AI כמעט אף פעם לא עושות - היא הוזילה את המוצר שלה בלי שאף אחד ביקש. Luna, הדגם הכי זול והכי מהיר במשפחה, ירד במחיר ב-80%: מ-1$ ל-20 סנט למיליון טוקנים בקלט, ומ-6$ ל-1.20$ בפלט. Terra, הדגם האמצעי, ירד ב-20% - מ-2.50$ ל-2$ בקלט ומ-15$ ל-12$ בפלט.
טוקנים, אם זה לא מוכר, הם פשוט 'חתיכות המילים' שהמודל קורא וכותב - כל בקשה שבוט שלכם שולח, וכל תשובה שהוא מקבל בחזרה, נספרת בטוקנים ומחויבת בהתאם. אז כשענף ה-API של OpenAI חותך 80% מהמחיר על הדגם שרוב האוטומציות בעולם רצות עליו, זו לא הערת שוליים - זו הודעה לכל עסק שמריץ בוטים, טפסים אוטומטיים או עיבוד טקסט בנפח גבוה.
יש דבר אחד שדווקא לא זז: המחיר של Sol, הדגם החזק והיקר במשפחה, נשאר בדיוק איפה שהיה. וזה בדיוק המקום שבו מתחיל הסיפור המעניין.
כשחברת AI מוזילה רק את הדגמים הזולים ומשאירה את החזק במחיר מלא, היא לא אומרת 'אנחנו נדיבים' - היא אומרת 'כאן התחרות נושכת'.
נושא02
אז למה דווקא עכשיו, ודווקא לונה?
לפי OpenAI, הסיבה הרשמית היא 'שיפורי יעילות' שהתגלו תוך כדי הפיתוח של GPT-5.6 עצמו - כולל שיפור ביכולת של המודל לשכתב ולייעל קוד ייצור, ושיפור בקצב יצירת הטוקנים. במילים פשוטות: הם למדו לגרום למודל לעבוד יותר בזול, אז הם מעבירים חלק מהחיסכון הלאה.
אבל התזמון מספר סיפור אחר. שלושה שבועות אחרי השקה זה קצב שאפילו ל-OpenAI לא אופייני. וזה קורה בדיוק ברגע שגוגל דוחפת את Gemini Flash-Lite לאותה שכבת מחיר, ו-DeepSeek ממשיך להציע דגמים זולים משמעותית על בסיס טוקן טהור. לונה היא בדיוק המודל שמתחרה שם - הדגם שמריצים ברקע, בהמוני קריאות, בלי שאף אחד רואה אותו. וזאת בדיוק השכבה שבה מלחמת המחירים האמיתית מתרחשת עכשיו.
Sol, לעומת זאת, לא הוזל - כי שם OpenAI לא מתחרה על מחיר. שם היא מתחרה על יכולת, על המוניטין של 'הכי חכם שיש'. וזו בעצם החלוקה שכל בעל עסק צריך להפנים: השכבה הזולה הפכה לשדה קרב, השכבה היקרה נשארת פרימיום.
נושא03
מה זה אומר בפועל אם אתם מריצים בוטים או אוטומציות
נניח שיש לכם סוכנות שמריצה בוט וואטסאפ שמסנן לידים לפני שהם מגיעים לאיש מכירות - הבוט קורא כל הודעה נכנסת, מחליט אם הליד רציני, שולף פרטים, ומעביר רק את מה שבאמת שווה זמן. הארכיטקטורה הנכונה לתהליך כזה היא לרוב 'משפך': דגם זול וקל עושה את המיון הראשוני על אלפי שיחות, ורק המקרים המורכבים עולים לדגם חזק ויקר יותר. עד עכשיו, הרבה עסקים ויתרו על הארכיטקטורה הזאת כי גם השכבה 'הזולה' עלתה מספיק כדי לכאוב על נפח גבוה. ירידה של 80% במחיר לונה הופכת בדיוק את הצעד הזה - להריץ מיון ראשוני על כל שיחה נכנסת, בלי לחשוב פעמיים - לזול משמעותית.
יש כאן נקודה שקל לפספס: ברוב האוטומציות, הפלט (הטקסט שהמודל כותב בחזרה) עולה הרבה יותר מהקלט. בוט שכותב תשובה, מנסח סיכום, או מייצר פלט מובנה לכל שיחה - צורך המון טוקני פלט. אצל לונה, גם הפלט זול פי חמישה מאיפה שהיה (מ-6$ ל-1.20$ למיליון). זה אומר שתהליכים שהיו יקרים במיוחד בגלל אורך התשובות - כמו כתיבת סיכומי שיחה אוטומטיים, תיוג תוכן בנפח, או הרצת בדיקות איכות על אלפי הודעות - הופכים פתאום למשהו שאפשר להריץ בלי לחשוב על התקציב בכל פעם.
המסקנה המעשית: אם עצרתם פרויקט אוטומציה כי החישוב לא הסתדר, שווה לחזור אליו ולבדוק אותו מחדש עם המספרים החדשים - מה שלא היה כדאי בחודש שעבר, יכול להיות כדאי מאוד היום.
נושא04
מה הסיפור הזה מספר על הכיוון של כל התעשייה
מלחמת המחירים הזאת כנראה לא תיעצר בלונה. ברגע שדגם אחד בשכבה הזולה מוזל ב-80%, גוגל, DeepSeek וכל השאר יצטרכו להגיב, וזה בדרך כלל מתגלגל למטה - כלומר עוד ועוד יכולת, במחיר שהולך ויורד. הכיוון ברור: הרצת תהליכים עסקיים שלמים ברקע כבר לא עניין של תקציב גדול, אלא של לדעת להרכיב את זה נכון. וזו בדיוק הנקודה שבה מי שמתחיל ללמוד לעבוד עם קלוד ומודלים דומים בלי רקע טכני - כמו בסדרה 'קלוד למתחילים מאפס' - מגלה שהוא כבר לא צריך לחכות שהמחיר 'יתאזן'. הוא כבר שם.
