המחשה של מערכת בינה מלאכותית לעיבוד וידאו ותוכן מולטימדיה
תמונה: נוצרה באמצעות AI עבור מערכת ITPortal

Google בונה במאי AI לסרטונים ארוכים ועקביים

רוב כלי הווידאו מבוססי הבינה המלאכותית יודעים לייצר קליפ קצר ומרשים. הבעיה מתחילה כשמבקשים מהם לספר סיפור שנמשך כמה דקות: הדמות מחליפה בגדים, החדר משנה צורה וחפצים נעלמים בין שוט לשוט.

מחקר חדש של Google Research, שפורסם ב־24 בספטמבר 2026, מציע לעבור ממודל שמייצר כל קטע בנפרד למערכת מרובת סוכנים שמתכננת את הסרט כולו, שומרת זיכרון חזותי ובודקת את התוצאה תוך כדי העבודה.

למה סרטון ארוך קשה יותר מקליפ קצר?

מודל וידאו יכול לייצר כמה שניות באיכות גבוהה, אך שרשרת של קליפים יוצרת שתי תקלות נפוצות. הראשונה היא Visual Drift: הפנים, הבגדים, האביזרים או מיקום החפצים משתנים ללא כוונה. השנייה היא הצטברות שגיאות, שבה פגם מוקדם בסטוריבורד משפיע על כל הסצנות הבאות.

לפי הפרסום הרשמי של Google Research, הפתרון אינו מודל יחיד גדול יותר, אלא שכבת תזמור שמחלקת את העבודה לכמה תפקידים ושומרת מצב משותף לאורך ההפקה.

כך עובד במאי ה־AI

המערכת מתחילה מסוכן מתזמר שבוחר כיוון יצירתי, מבנה סיפורי וסגנון חזותי. לאחר מכן סוכן קדם־הפקה בונה תסריט וסטוריבורד, וסוכני הפקה נפרדים מטפלים בפריימים מרכזיים, בווידאו, בקול ובמוזיקה.

בסיום, מודל מולטימודלי משמש כשופט. הוא בודק אם הסרט תואם להנחיה המקורית, מזהה חוסר עקביות ומחזיר משוב לסבב נוסף. כך המערכת אינה מסתפקת בתוצאה האחרונה, אלא משווה כמה גרסאות ובוחרת את הטובה ביותר.

ארבעה רכיבים שונים, בעיה אחת

  • Co-Director: מתכנן את האסטרטגיה היצירתית ואת חלוקת העבודה בין הסוכנים.
  • CANVAS: שומר זיכרון חזותי של דמויות, מקומות וחפצים כדי לצמצם שינוי בלתי רצוי בין סצנות.
  • A²RD: מייצר את הסרט מקטע אחר מקטע תוך מעקב אחר ההקשר וההתפתחות העלילתית.
  • VQQA: שואל שאלות על התוצאה, מזהה תקלות קומפוזיציה ועקביות ומשפר את ההנחיות לסבב הבא.

מה Google כבר הצליחה להדגים?

החוקרים הציגו סרטונים בני כמה דקות ואף הדגמה רציפה של עשר דקות שבה דמויות, תלבושות ומקומות נשמרים בצורה יציבה יותר לאורך זמן. עם זאת, מדובר במחקר ובמסגרות עבודה ניסיוניות, לא בהכרזה על כפתור חדש שזמין כעת לכל משתמש ב־Veo או ב־Gemini.

Google מדווחת על שיפור במדדי עקביות ובאיכות הסיפור מול שיטות בסיס שנבדקו במחקר. אין להסיק מכך שכל הפקה תעבוד ללא עריכה אנושית, או שהמערכת כבר מחליפה תסריטאי, עורך ובמאי.

מה זה אומר ליוצרי תוכן?

החידוש החשוב הוא המעבר מיצירת שוטים בודדים לניהול הפקה. אם הגישה תבשיל למוצר, היוצר יוכל להגדיר דמויות, עולם וסגנון פעם אחת, והמערכת תנהל את הרציפות, תזהה סטיות ותציע תיקונים.

היישומים האפשריים כוללים סרטוני הדרכה, קמפיינים, הדמיות מוצר וסיפורים ארוכים. במקביל נשארות שאלות של זכויות יוצרים, שקיפות וסימון תוכן סינתטי. Google מציינת שהמסגרת נשענת על מנגנוני בטיחות קיימים ובהם SynthID, אך גם סימון אינו פותר לבדו את כל שאלות המקור וההרשאה.

לקריאה נוספת: Qwen משלב טקסט, תמונה, קול ווידאו ו־מה עושה AI Integrator בעסק.

קרדיט תמונה: תמונה שנוצרה באמצעות AI עבור מערכת ITPortal.

דילוג לתוכן