AI 前沿 2026 年 8 月 2 日

2026-08-02 — ByteDance Seedance 2.5 一鏡到底影片生成、微軟 Flint 圖表語言與 K 選一訓練法 Explorative Modeling 同日登場

primary=https://seed.bytedance.com/en/blog/one-take-creation-flexible-referencing-introducing-seedance-2-5 primary=https://seed.bytedance.com/seedance2_5 primary=https://microsoft.github.io/flint-chart/ primary=https://github.com/microsoft/flint-chart primary=https://alexiglad.github.io/blog/2026/explorative_modeling/ primary=https://github.com/alexiglad/XM primary=https://arxiv.org/abs/2607.27372

一鏡到底說完一個故事:ByteDance Seedance 2.5 把敘事結構搬進影片生成

ByteDance Seed · 2026-07-31

ByteDance Seed 團隊發布影片生成模型 Seedance 2.5,建立在 Seedance 2.0 的「統一多模態音畫聯合生成架構」之上。這一版把重點放在單次生成內的敘事結構,以及輸入端可參照的素材種類,而非單純拉長片長或提高解析度。單次生成即可組織出起承轉合,是這次架構調整的核心訴求。

核心改動

官方稱之為「一鏡到底創作」(one-take creation):模型能在單次最長 30 秒的生成裡,把多個邏輯相連的鏡頭組織成「設定、發展、轉折、收尾」的完整段落,並支援多輪銜接延伸,讓創作者用一致的視聽語言產出數分鐘長度的內容。與此同時,「彈性參照」(flexible referencing)讓單次生成可同時吃入:

  • 最多 30 張圖片
  • 10 段影片素材
  • 10 段音訊素材

參照能力也擴及黏土渲染、動作參照與創意參照等複合情境,用於處理多主體同時出現的鏡頭。時間戳級別的音畫控制是另一項編輯能力,此外還包含具環境物理效果的綠幕合成,以及鏡頭視角編輯與以參照素材為基礎的局部重編輯。

影響範圍

目前 Seedance 2.5 已在即夢 AI(Jimeng AI)與豆包 Pro 上線,API 將透過 BytePlus ModelArk 釋出。官方部落格與產品首頁皆未附上量化基準測試數字,也沒有連結技術報告或論文。

原始來源:ByteDance Seed 官方部落格Seedance 2.5 產品頁

給 AI 代理用的圖表語言:Flint 一份規格編譯成五種渲染後端

Microsoft Research · 2026-08-01

Microsoft Research 釋出 Flint,一個中介視覺化語言,目前最新版本為 0.4.0(2026-07-24),程式碼與說明文件位於 microsoft/flint-chart。它把「一份精簡規格」編譯成 Vega-Lite、ECharts、Chart.js、Plotly 與原生 Excel 圖表等多種輸出格式。

背景

用 Vega-Lite 或 D3 這類既有語法產圖時,agent 必須自行決定座標軸、間距、刻度、標籤與版面等大量細節,稍有差池就畫出錯誤或難以閱讀的圖表。Flint 把這些機制性決策自動化,改由資料、語意型別、圖表類型與欄位編碼共同推導出最佳設定,讓 agent 只需要描述「這是什麼資料」而不必操心「怎麼畫」。

規格細節

Flint 定義了 70 多種語意型別(如 Rank、Temperature、Price、Country),搭配下列 API 產生規格:

import { assembleVegaLite } from 'flint-chart';

const spec = assembleVegaLite({
  data: { values: myData },
  semantic_types: { weight: 'Quantity', mpg: 'Quantity', origin: 'Country' },
  chart_spec: {
    chartType: 'Scatter Plot',
    encodings: { x: { field: 'weight' }, y: { field: 'mpg' }, color: { field: 'origin' } },
    baseSize: { width: 400, height: 300 },
  },
});

同一份輸入换個函式呼叫即可切換後端,例如 assembleEChartsassembleChartjsassemblePlotly;也有專屬的 flint-chart-mcp MCP server,讓 agent 能在對話環境裡直接建立、驗證並渲染圖表。非技術使用者也能直接編輯規格,不需理解底層渲染細節。

影響範圍

安裝方式為 npm install flint-chart,Python 套件「即將推出」,專案採 MIT 授權。0.4.0 版新增 38 種 Plotly 圖表類型與 18 種原生 Excel 範本,前一版 0.3.0 則加入動態圖表元件;研究論文標註為「即將發表」。

原始來源:Flint 官方網站GitHub 原始碼與說明文件

別再讓生成模型「和稀泥」:K 選一訓練法 Explorative Modeling 拆解平均化困局

Alexi Gladstone 個人研究部落格 · 2026-08-02

Alexi Gladstone 與 Yilun Du、Heng Ji 發表 Explorative ModelingXM),對應論文掛在 arXiv 2607.27372,程式碼在 github.com/alexiglad/XM。這篇文章處理一個生成模型的老問題:用直接回歸訓練的模型,遇到一個輸入對應多種合理輸出時,會傾向把答案平均掉,產生模糊或無效的結果。

核心改動

擴散模型與自迴歸模型解決這個問題的方式,是把「生成」拆成很多個小步驟;XM 反過來把「訓練」拆成 K 個探索步驟,生成本身仍維持單步、端對端:

losses = []
for i in range(K):
    generation = model.generate()
    losses.append(loss_fn(generation, data))
min(losses).backward()

每個訓練步驟讓模型產生 K 個候選輸出,分別計算與真實資料的損失,只對其中損失最小的候選反向傳播。模型因此能在 K 次嘗試中各自收斂到不同答案,而不是被迫平均,論文稱這種能力為「生成表達力」(generative expressivity);因為生成路徑仍是單步,不會出現多步生成常見的曝光偏差(exposure bias)。

規格細節

對照場景指標數字
ImageNet 256資料效率減少 6.2 倍樣本需求
RAE 基準FLOP 效率降低 4.1 倍
SiT 基準FLOP 效率提升 52%
影片模型FID / FVD提升逾 20%
機器人行為複製推論前向次數1 次,對比 Diffusion Policy 的 100 次
世界模型推論前向次數平均 2.3 次,對比 Diffuser 的 192 次

隨模型規模與資料量放大,論文也觀察到 XM 相對優勢會持續擴大:參數規模增加時增益從 13% 提升到 23%,資料量增加時從 7% 提升到 36%。

原始來源:作者部落格GitHub 程式碼arXiv 2607.27372


End of article
0
Would love your thoughts, please comment.x
()
x