一鏡到底說完一個故事:ByteDance Seedance 2.5 把敘事結構搬進影片生成
ByteDance Seed · 2026-07-31
ByteDance Seed 團隊發布影片生成模型 Seedance 2.5,建立在 Seedance 2.0 的「統一多模態音畫聯合生成架構」之上。這一版把重點放在單次生成內的敘事結構,以及輸入端可參照的素材種類,而非單純拉長片長或提高解析度。單次生成即可組織出起承轉合,是這次架構調整的核心訴求。
核心改動
官方稱之為「一鏡到底創作」(one-take creation):模型能在單次最長 30 秒的生成裡,把多個邏輯相連的鏡頭組織成「設定、發展、轉折、收尾」的完整段落,並支援多輪銜接延伸,讓創作者用一致的視聽語言產出數分鐘長度的內容。與此同時,「彈性參照」(flexible referencing)讓單次生成可同時吃入:
- 最多 30 張圖片
- 10 段影片素材
- 10 段音訊素材
參照能力也擴及黏土渲染、動作參照與創意參照等複合情境,用於處理多主體同時出現的鏡頭。時間戳級別的音畫控制是另一項編輯能力,此外還包含具環境物理效果的綠幕合成,以及鏡頭視角編輯與以參照素材為基礎的局部重編輯。
影響範圍
目前 Seedance 2.5 已在即夢 AI(Jimeng AI)與豆包 Pro 上線,API 將透過 BytePlus ModelArk 釋出。官方部落格與產品首頁皆未附上量化基準測試數字,也沒有連結技術報告或論文。
給 AI 代理用的圖表語言:Flint 一份規格編譯成五種渲染後端
Microsoft Research · 2026-08-01
Microsoft Research 釋出 Flint,一個中介視覺化語言,目前最新版本為 0.4.0(2026-07-24),程式碼與說明文件位於 microsoft/flint-chart。它把「一份精簡規格」編譯成 Vega-Lite、ECharts、Chart.js、Plotly 與原生 Excel 圖表等多種輸出格式。
背景
用 Vega-Lite 或 D3 這類既有語法產圖時,agent 必須自行決定座標軸、間距、刻度、標籤與版面等大量細節,稍有差池就畫出錯誤或難以閱讀的圖表。Flint 把這些機制性決策自動化,改由資料、語意型別、圖表類型與欄位編碼共同推導出最佳設定,讓 agent 只需要描述「這是什麼資料」而不必操心「怎麼畫」。
規格細節
Flint 定義了 70 多種語意型別(如 Rank、Temperature、Price、Country),搭配下列 API 產生規格:
import { assembleVegaLite } from 'flint-chart';
const spec = assembleVegaLite({
data: { values: myData },
semantic_types: { weight: 'Quantity', mpg: 'Quantity', origin: 'Country' },
chart_spec: {
chartType: 'Scatter Plot',
encodings: { x: { field: 'weight' }, y: { field: 'mpg' }, color: { field: 'origin' } },
baseSize: { width: 400, height: 300 },
},
});同一份輸入换個函式呼叫即可切換後端,例如 assembleECharts、assembleChartjs、assemblePlotly;也有專屬的 flint-chart-mcp MCP server,讓 agent 能在對話環境裡直接建立、驗證並渲染圖表。非技術使用者也能直接編輯規格,不需理解底層渲染細節。
影響範圍
安裝方式為 npm install flint-chart,Python 套件「即將推出」,專案採 MIT 授權。0.4.0 版新增 38 種 Plotly 圖表類型與 18 種原生 Excel 範本,前一版 0.3.0 則加入動態圖表元件;研究論文標註為「即將發表」。
別再讓生成模型「和稀泥」:K 選一訓練法 Explorative Modeling 拆解平均化困局
Alexi Gladstone 個人研究部落格 · 2026-08-02
Alexi Gladstone 與 Yilun Du、Heng Ji 發表 Explorative Modeling(XM),對應論文掛在 arXiv 2607.27372,程式碼在 github.com/alexiglad/XM。這篇文章處理一個生成模型的老問題:用直接回歸訓練的模型,遇到一個輸入對應多種合理輸出時,會傾向把答案平均掉,產生模糊或無效的結果。
核心改動
擴散模型與自迴歸模型解決這個問題的方式,是把「生成」拆成很多個小步驟;XM 反過來把「訓練」拆成 K 個探索步驟,生成本身仍維持單步、端對端:
losses = []
for i in range(K):
generation = model.generate()
losses.append(loss_fn(generation, data))
min(losses).backward()每個訓練步驟讓模型產生 K 個候選輸出,分別計算與真實資料的損失,只對其中損失最小的候選反向傳播。模型因此能在 K 次嘗試中各自收斂到不同答案,而不是被迫平均,論文稱這種能力為「生成表達力」(generative expressivity);因為生成路徑仍是單步,不會出現多步生成常見的曝光偏差(exposure bias)。
規格細節
| 對照場景 | 指標 | 數字 |
|---|---|---|
| ImageNet 256 | 資料效率 | 減少 6.2 倍樣本需求 |
| RAE 基準 | FLOP 效率 | 降低 4.1 倍 |
| SiT 基準 | FLOP 效率 | 提升 52% |
| 影片模型 | FID / FVD | 提升逾 20% |
| 機器人行為複製 | 推論前向次數 | 1 次,對比 Diffusion Policy 的 100 次 |
| 世界模型 | 推論前向次數 | 平均 2.3 次,對比 Diffuser 的 192 次 |
隨模型規模與資料量放大,論文也觀察到 XM 相對優勢會持續擴大:參數規模增加時增益從 13% 提升到 23%,資料量增加時從 7% 提升到 36%。