
每個鏡頭都鎖定身分
上傳一張照片——或最多七張——Grok Imagine 會把它們當作身分錨點:同樣的臉孔、身形與輪廓貫穿每一個鏡頭。在網路上爆紅的「同一位女演員詮釋九種電影類型」混剪正是由這套引擎驅動,用來維持你的產品或角色前後一致也同樣出色。
用 xAI 的影片模型 Grok Imagine 1.5 讓照片動起來,這裡按秒計價最便宜。它對普通照片的改姿勢、換服裝指令照做不誤拒,被拒的任務一分不扣。
Grok Imagine 1.5 是 xAI 的圖生影片模型,2026 年 7 月 2 日起在這個工作台上線。它做的是讓畫面動起來,不是從零生成:起點永遠是至少一張照片,沒有純文字模式。多張參考圖會被合在一起當成同一個身分錨點來讀,而不是當成分開的幀——這就是它能讓一張臉在一組片子裡保持一致的原因。
天花板是 720p——沒有 1080p,也沒有 4K——所以凡是要放到電視上、或者當桌面端首屏大圖撐得住的活,它就是選錯了工具。每條片子都帶音訊回來,API 也沒暴露關掉它的開關,模型寫什麼配樂你就得收下什麼。上游的內容過濾每一次請求都會跑,關不掉。
xAI 的圖生影片模型能將你的照片動畫化為 1-15 秒的有聲短片,透過最多 7 張參考圖讓同一人物在每個鏡頭中都清晰可辨,每秒成本更低於平台上任何其他影片模型。

上傳一張照片——或最多七張——Grok Imagine 會把它們當作身分錨點:同樣的臉孔、身形與輪廓貫穿每一個鏡頭。在網路上爆紅的「同一位女演員詮釋九種電影類型」混剪正是由這套引擎驅動,用來維持你的產品或角色前後一致也同樣出色。

每秒定價低於我們平台上的任何其他模型——低到你可以放心自由迭代、測試迷因格式、批次產出社群短片,不必時時盯著餘額。每次生成前都會顯示確切的點數費用,生成失敗會自動退還點數。
透過生產管線在本站生成——2026 年 8 月 15 日的兩條工作室片段,加上來自 AI 接吻、擁抱、跳舞影片工具的十條場景片段,全部是 Grok Imagine 1.5 一次出片。起始照片本身也是本站模型的產出——沒有素材庫鏡頭。
The woman breathes gently and blinks, a few strands of hair drift in the light, subtle head turn toward camera, natural micro-expressions, the window light steady behind her.
Rain continues to fall on the wet cobblestones, steam drifting up from the grate, the sodium lamp flickering faintly, a slow push-in down the alley.
The couple shares a slow, deeply romantic kiss on the lips, eyes closed, his hand gently cradling her cheek. Subtle tender motion, camera holds a slow push-in. Stable faces, no extra people.
The couple kisses in falling rain under streetlight glow; raindrops streak and glisten, wet hair moves slightly. Cinematic slow motion, steady camera, stable faces, no extra people.
He gently pulls her close and softly kisses her forehead; she closes her eyes with a peaceful smile. Minimal tender motion, steady camera, stable faces, no extra people.
The woman and the younger adult version of herself hold each other in a warm hug, gently tightening the embrace, soft smiles and a slow blink. Tender slow motion, camera holds steady.
She rushes the last step into his arms and he lifts her slightly off the ground in a joyful reunion hug, both laughing with relief. Energetic then settling motion, gentle camera push-in.
The couple holds each other tightly in falling rain under streetlight glow, raindrops streaking, wet hair moving slightly. Cinematic slow motion, steady camera.
She hugs the dog close and it leans into her, tail wagging, as she laughs and presses her cheek to its fur. Light joyful motion, gentle handheld feel.
The woman dances a smooth sway — hips and arms flowing side to side in a relaxed rhythm, hair swinging gently, confident smile. Smooth rhythmic motion on the beat, steady camera.
She performs a crisp K-pop choreography sequence — sharp point moves, a hair flip and a spin into a final pose, stage lights sweeping. Precise rhythmic motion, gentle camera push-in.
The couple dances salsa — a led turn, her dress flaring, then back into closed hold, both laughing. Lively partner-dance motion, subtle orbital camera.
它讓照片動起來。下面這些活裡,這個約束是優勢,不是限制。
一張人像、一張產品圖、一張舊全家福——一張圖就是全部輸入。這一頁上的片子起點是一張靜態圖,終點是一個會呼吸、會眨眼的人。
每秒費率低到你可以把一個開場鏡頭跑五個變體,而不是在一個上面糾結。失敗的任務自動退還點數,所以一次被拒的嘗試不花錢。
傳最多七張同一個人的照片,並在提示詞裡引用它們。這就是讓一張臉在一段片子的鏡頭切換之間、以及一個系列的多段片子之間保持穩定的辦法。
在預訂任何資源之前,先讓一張產品圖動起來,看這個想法在動態裡讀不讀得通。它是試驗台,不是交付流水線。
沒有照片就出不了片——要做文生影片,從 Seedance 2.0 Mini 或 Wan 2.7 開始。而且 720p 就是這裡的上限:如果片子得扛住全螢幕或廣播等級的裁切,Wan 2.7 能渲到 1080p。
在這個工作區裡,這三個模型每秒各收多少點數,各自能做什麼、不能做什麼。
| Grok Imagine 1.5 | Seedance 2.0 Mini | Wan 2.7 | |
|---|---|---|---|
| 每秒點數 | 480p 5 · 720p 10 | 480p 15 · 720p 30(由參考影片驅動時為 10 和 20) | 720p 40 · 1080p 70 |
| 提供的解析度 | 480p, 720p | 480p, 720p | 720p、1080p——沒有 480p 這一檔 |
| 片長 | 1–15 秒 | 4–15 秒 | 2–15 秒 |
| 最便宜的單段片子 | 5 點數——480p 1 秒 | 60 點數——480p 4 秒 | 80 點數——720p 2 秒 |
| 最貴的單段片子 | 150 點數——720p 15 秒 | 450 點數——720p 15 秒 | 1,050 點數——1080p 15 秒 |
| 起點是 | 一張照片——永遠如此 | 文字、一張照片,或一組參考圖 | 文字、一張首幀照片,或一組參考圖 |
| 參考輸入 | 最多 7 張圖 | 最多 9 張圖外加 3 段影片 | 圖和影片合計最多 5 個 |
| 長寬比 | 5 種預設外加 auto | 沒有比例選擇器——輸出跟隨提示詞或來源照片 | 沒有比例選擇器——輸出跟隨提示詞或來源照片 |
| 我們實測的生成時間 | 未實測 | 每段約 3 分 19 秒,6 段全部一次過(2026 年 7 月) | 未實測 |
每秒費率、解析度檔位、片長和參考圖上限,都是 2026 年 8 月 20 日從真正給你帳戶扣費的計價程式碼裡讀出來的,不是從廠商頁面上抄的。最便宜和最貴那兩行,就是把該費率乘以每個模型能接受的最短和最長片長。計時是我們自己跑的,並註明了樣本量;凡是我們自己沒跑過的模型,格子裡就直說,不從別處借數字。
在同一個工作區中比較 Grok Imagine 1.5 與其他影片模型——一鍵即可切換。
| 模型 | grok-imagine-video-1-5-preview,來自 xAI——自 2026 年 7 月 2 日起在這裡可用 |
|---|---|
| 模式 | 只支援圖生影片。至少需要一張照片;沒有純文字模式。 |
| 參考圖片 | 每段片子最多 7 張,一起作為一個身分錨點使用 |
| 解析度 | 480p 和 720p。沒有 1080p 和 4K 這兩檔。 |
| 時長 | 1 到 15 秒,按整秒計——預設 8 秒 |
| 長寬比 | 1:1、16:9、9:16、3:2、2:3 或 auto——auto 跟隨你照片的構圖 |
| 音訊 | 隨片子一起生成。API 沒有暴露關掉它的參數,所以這裡沒有無聲這一檔。 |
| 點數 | 480p 每秒 5 · 720p 每秒 10——所以 1 秒的草稿 5 點數,720p 15 秒 150 點數 |
| 內容過濾 | 上游安全過濾對每一次請求都開啟,無法關閉(自 2026 年 7 月 18 日起) |
| 失敗的任務 | 自動退還點數 |
| 實測速度 | 沒測過——這一頁上的片子是在這裡生成的,但沒有計時 |
從空白的提示詞欄位到一支成片,只要三個步驟。
打開模型選擇器,選擇 Grok Imagine 1.5。在你花掉任何點數之前,面板就會顯示它的點數費用、解析度選項與時長上限。
寫清楚主體、動作,以及鏡頭怎麼運鏡。想讓影片從某張圖開始,就附上首影格。
下載成片、延長它,或送去進一步編輯。提示詞、模型與設定都會一併保存在你的歷史紀錄裡。
一個帳號,完整的圖像與影片生成工作流程。
用免費方案的每日點數執行 Grok Imagine 1.5,或升級以取得進階模型、更快的生成與 4K 輸出。
年繳 · $240/year
Grok Imagine 1.5 是 xAI 的圖生影片模型。你上傳 1-7 張照片並描述想要的動態,它會回傳一段 1-15 秒的有聲短片,且照片中的人物或主體全程清晰可辨。
不能——Grok Imagine 1.5 一律從至少一張圖片開始。如果你想要純文生影片,請使用 Seedance 2.0 Fast 或 Wan 2.7;也可以先生成一張靜態圖片,再到這裡讓它動起來。
480p 每秒 5 積分、720p 每秒 10 積分,按實際交付時長計——全站影片模型裡最低的按秒費率。生成前顯示準確費用,失敗或被拒的任務自動退款。
可以。在提示詞裡描述新的姿勢、衣著或動作,並讓照片作為身分錨點;模型會給同一個人換姿勢,而不是憑空造一個新人。普通人像和全身照都能接受——Grok 2.0 收緊過濾後,很多人換回的就是這一版。
xAI 會審核每個任務:色情或暗示性內容、未成年人、暴力和名人肖像會在渲染任何一幀之前被拒。被拒的任務立即釋放,不扣你的積分——你只為交付的片段付費。
上傳最多 7 張參考圖,並在提示詞中提及它們(例如 "Reference Image 1 as identity lock",即「將參考圖 1 作為身分鎖定」)。模型會讓該主體的臉孔與輪廓在短片的每個鏡頭中保持一致。
可以——短片包含生成的聲音。你可以把台詞與聲音提示直接寫進提示詞。
影片生成失敗會自動退還點數。
生成前後的工作都有一鍵工具——修飾、換風格、直接分享。
Enabled upstream content-safety filtering for all Grok Imagine generations.
Grok Imagine 1.5 integrated for image-to-video generation.