专题追踪
视频生成模型
文生视频、图生视频、视频 VAE 与 DiT 加速:Wan、Sora、Veo、可灵、海螺、Seedance、Vidu、LTX、HunyuanVideo 等的发布、论文、benchmark 与推理框架支持。
176 条 · 127 个线程 · 更新 10-11 09:58 · 综述 2026-10-01 ~ 2026-10-08
本周综述 2026-10-01 ~ 2026-10-08
本周视频生成领域密集发布新旗舰与加速论文。产品侧,快手可灵 Kling 4.0 开启内测,主打 30 秒原生片段与多参考控制;生数科技发布 Vidu Q4 Preview;Seedance 2.5 API 文档登上 GitHub 热榜,Draft 模式降低试错成本。资本层面,可灵 AI 筹备港股 IPO,Kimi 母公司月之暗面估值约 500 亿美元,Higgsfield 估值 54 亿美元,DeepSeek 新一轮融资或达千亿元。推理加速方面,多篇论文聚焦少步生成与内存优化:TurboT2VA 通过联合蒸馏实现音视频生成提速 54 倍,DeCoPrune 对自回归视频扩散 KV Cache 剪枝,PARK 优化视频 DiT 稀疏注意力块检索,HetA-DiT 按 token 难度分配注意力。此外,PhysicsLENS、MindWorldBench 等基准揭示模型物理与心智推理短板,CCDF 针对监控深伪检测。噱头方面,部分 APK 下载站蹭热度,实质内容有限。
- Kling 4.0 开启内测:30 秒原生片段 + 多参考控制
- TurboT2VA:音视频生成提速 54 倍的联合蒸馏方案
- DeCoPrune / PARK:自回归视频扩散 KV Cache 剪枝与稀疏注意力优化
- 可灵 AI 筹备港股 IPO,Kimi 母公司估值约 500 亿美元
- PhysicsLENS、MindWorldBench 揭示视频生成物理与心智推理短板
现状表 模型维护,随周综述更新
| 模型 | 机构 | 日期 | 权重 | 规格 | 位置 |
|---|---|---|---|---|---|
| Kling 4.0 | 快手 | 2026-09-29 | 闭源 | 支持 30 秒原生片段与多参考控制 | 本周最新旗舰,时长与控制能力升级 |
| Seedance 2.5 | ByteDance | 2026-09-20 | 闭源 | 480P 验证 + 1080P 出图 Draft 模式,单图生成可交互 3D 世界 | Draft 模式降低试错成本,更新频繁 |
| Vidu Q4 Preview | 生数科技 | 2026-10-08 | 闭源 | 新一代 AI 视频模型,主打真实感表演 | 本周新发布,面向真实感视频生成 |
| Vidu S2 | 生数科技 | 2026-09-25 | 闭源 | 实时互动、实时改视频、空间视频,实时 720P 数字人生成 | 主打实时交互与编辑的闭源新旗舰 |
| MiniMax-H3 | MiniMax | 2026-09 | 闭源 | 全模态统一生成模型,强调物理世界推理 | 闭源全模态旗舰,社区衍生生态活跃 |
| LynnReal-Omni | LynnReal-AI | 2026-09 | 开源 | 32B 多模态扩散 Transformer,支持 4 步快速推理 | 开源少步数快速推理多模态视频框架 |
| DreamX-Creator | AMAP-ML | 2026-09 | 开源 | 2K 分辨率原生音视频协同生成 | 高德开源的原生高分辨率音视频模型 |
| LTX-2.5-22b | Lightricks | 2026-09 | 开源 | 22B 参数量,配动图生成 LoRA | 大参数量开源动图生成基模 |
| TurboT2VA | — | 2026-09-26 | 闭源 | 分布蒸馏 + 轨迹蒸馏联合方案,音视频生成提速 54 倍 | 本周少步生成加速代表性工作 |
| DeCoPrune | — | 2026-10-02 | 闭源 | 基于去噪一致性的自回归视频扩散 KV Cache 剪枝 | 推理内存优化的实用方向 |
| PARK | — | 2026-10-02 | 闭源 | 视频 DiT 稀疏注意力的精确块检索 | 长视频注意力效率优化 |
| HetA-DiT | — | 2026-09-28 | 闭源 | 按 token 难度自适应分配全局/稀疏注意力 | 异构注意力机制提升扩散效率 |
线程 同一模型 / 产品的多条进展
可灵AI 7
-
“视频大模型第一股”角逐:可灵AI拟赴港IPO,最快明年启动 - 新浪网
快手可灵 AI 拟赴港 IPO,最快 2027 年启动
视频生成头部玩家资本化,影响行业格局
-
【#曝快手可灵AI筹备赴港IPO#:已选定中金、高盛、瑞银承销,拟至少融资10亿美元】据财联社,快手旗下视频生成大模型可灵AI据悉计划最早明年赴港上市,至少融资10亿美元。知情人士透露,可灵AI已选择中金公司、高盛和瑞银为其香港IPO提供承销服务,目标最早于 - 手机新浪网
【#曝快手可灵AI筹备赴港IPO#:已选定中金、高盛、瑞银承销,拟至少融资10亿美元】据财联社,快手旗下视频生成大模型可灵AI据悉计划最早明年赴港上市,至少融资10亿美元。知情人士透露,可灵AI已选择中金公司、高盛和瑞银为其香港IPO提供承销服务,目标最早于 手机新浪网
-
机构看好港股新股市场继续火热 月之暗面、可灵AI或成下一批重磅IPO - 富途牛牛
机构看好港股新股市场继续火热 月之暗面、可灵AI或成下一批重磅IPO 富途牛牛
-
可灵AI选定多家投行冲刺港股,视频生成赛道资本化提速 - 手机网易网
可灵AI选定多家投行冲刺港股,视频生成赛道资本化提速 手机网易网
-
于越担任可灵AI首席执行官 - 东方财富
于越担任可灵 AI 首席执行官,快手调整 AI 组织架构。
可灵人事变动,对关注快手 AI 方向有参考价值。
-
快手组织变阵 程一笑兼任社区科学线 可灵AI迎来掌舵人 - 搜狐网
快手组织变阵,程一笑兼任社区科学线,可灵AI迎来掌舵人。
可灵AI高管变动,影响产品方向。
-
“看见微光”可灵AI公益影像大赛启动,作品征集持续至11月1日 - Sohu
快手可灵AI启动“看见微光”公益影像大赛作品征集。
营销赛事活动,跳过。
Vidu Q4 Preview 6
-
Shengshu Technology Launches Vidu Q4 Preview Version with Support for 4K Output - AIBase
生数科技发布 Vidu Q4 Preview,支持 4K 输出
国产视频生成模型重要版本,直接影响行业对标
-
生数科技发布视频生成模型Vidu Q4 Preview预览版本 - 凤凰网科技
生数科技发布视频生成模型 Vidu Q4 Preview 预览版。
国内头部视频生成模型新版本发布,直接影响竞品格局。
-
视频模型迎来“DeepSeek时刻”?生数科技发布 Vidu Q4 Preview 高表现力旗舰模型 - 凤凰网科技
生数科技发布 Vidu Q4 Preview 高表现力旗舰视频模型。
视频生成模型新发布,与工程师方向直接相关。
-
Vidu Q4 Preview发布:推动旗舰视频模型大规模应用落地 - 搜狐网
Vidu发布Q4 Preview,推动旗舰视频模型大规模应用落地。
Vidu为重要视频生成模型,Q4 Preview涉及产品化进展。
-
视频DeepSeek时刻?Vidu Q4 Preview背后的效率账与世界模型底气 - 搜狐网
生数科技 Vidu Q4 Preview 引发视频 DeepSeek 时刻讨论。
视频生成模型进展,与工程师方向相关。
-
Shengshu Technology Launches Vidu Q4 Preview, A Next-Generation AI Video Model Built for Lifelike Performances - GlobeNewswire
生数科技发布 Vidu Q4 Preview 新一代 AI 视频模型。
国产头部视频生成模型新版本,直接影响工程师关注方向。
Seedance 2.5 6
-
ok66oqyea0fi8zqv/seedance2.5-seedance-2.5-api-cn
seedance2.5 API 中文文档仓库登 GitHub 热榜(⭐ 90)。
Seedance 2.5 视频生成 API 文档,与视频生成方向相关。
-
Seedance 2.5 上线 Draft 模式:先用 480P 验证创意,满意再用 1080P 生成终版 - 新浪财经_金融信息服务商
Seedance 2.5 推出 480P 验证、1080P 出图的 Draft 模式。
典型两阶段级联生成优化产品方案,大幅节约推理成本。
-
Seedance 2.5 还能这么玩?只要一张图, 生成一个可随意摆弄的 3D 世界 - 爱范儿
爱范儿报道 Seedance 2.5 支持单图生成可交互的 3D 世界场景。
涉及 3D/世界生成的新玩法与交互落地,值得扫一眼技术形态。
-
ByteDance Unveils Seedance 2.5 AI Video Model - TechJuice
字节跳动推出Seedance 2.5视频生成模型,性能全面提升。
头部厂商核心视频生成模型更新,重点关注生成质量与架构。
-
SkyProduction天工工作台中秋国庆特惠第二波:Seedance 2.5 720P 低至0.27元/秒,全网地板价! - 财中社
天工工作台推出Seedance 2.5 720P生成节假日特惠折扣。
API调用商业促销,跳过。
-
用 Seedance 2.5 拍《沙丘 3》,我们替你把 AI 短片的坑全都踩过了 - 爱范儿
爱范儿分享基于Seedance 2.5进行AI视频短片制作踩坑经验。
提示词和内容生成实践,与模型及系统优化无关。
Kling 4.0 5
-
Enkio to Bring Next-Generation Kling 4.0 Video Generation Into Its AI Music Video Pipeline - openPR.com
Enkio 将 Kling 4.0 集成到其 AI 音乐视频流水线。
Kling 4.0 被第三方采用,但非官方发布,信息价值有限。
-
快手-W午后涨近3% 可灵AI全新模型Kling 4.0已开启内测|阿里巴巴|百度|腾讯|长镜头|中金 - 新浪财经
可灵 AI 全新模型 Kling 4.0 已开启内测。
视频生成模型新版本发布,直接影响相关优化工作。
-
可灵AI Kling4.0开启内测;豆包将推类似Muse的个人助理产品|未来商业早参 - mrjjxw.com
可灵 AI Kling 4.0 开启内测,豆包将推类似 Muse 的个人助理产品。
可灵新版本内测,对关注视频生成方向有参考价值。
-
Kling AI Previews Kling 4.0 With 30-Second Native Clips and Multi-Reference Control - Pandaily
Kling AI 预览 Kling 4.0:支持 30 秒原生片段与多参考控制。
主流视频生成模型重大版本更新。
-
加速“进化” 快手可灵发布Kling4.0 支持单次生成视频最长可达30秒 - 东方财富
快手可灵发布 Kling 4.0,支持单次生成视频最长 30 秒。
主流视频生成模型重要版本更新,直接影响竞品格局。
Seedance 3
-
Claude、GPT“跨界”做视频,Seedance们的护城河还牢吗? - 凤凰网科技
Claude、GPT 跨界做视频,Seedance 等视频模型护城河受挑战。
通用大模型进入视频生成赛道,影响竞争格局。
-
火山引擎×AMD 助力砹脉营销(A.M.A)以 Seedance 重塑汽车营销新范式 - Sohu
火山引擎与AMD合作助力砹脉营销利用Seedance进行汽车视频营销。
公关营销稿件,不含具体技术实现细节。
-
火山引擎×AMD助力砹脉营销(A.M.A)以Seedance重塑汽车营销新范式 - t.cj.sina.cn
火山引擎与 AMD 合作推动 Seedance 模型用于汽车营销。
商业合作与营销场景宣传稿,缺乏技术干货。
Google Vids 3
-
Google Vids unlocks free HD AI video generation for all personal Google accounts - Chrome Unboxed
Google Vids 向所有个人 Google 账号开放免费 HD AI 视频生成。
头部厂免费开放 HD 视频生成,直接影响产品竞争格局。
-
谷歌(GOOGL.US)Vids免费AI视频生成扩容:套餐订阅用户享高级功能与更高限额提供者智通财经 - 英为财情 Investing.com
智通财经/英为财情:谷歌 Vids 免费 AI 视频生成扩容,订阅用户享更高限额
权威财经媒体确认 Google 视频生成商业化策略变化
-
Alphabet将Google Vids的免费AI视频生成功能向所有用户开放 - 富途牛牛
富途牛牛:Alphabet 将 Google Vids 免费 AI 视频生成向所有用户开放
权威财经源确认 Google 视频生成全面开放策略
Veo 3 2
-
Veo 3 alternatives Latest APK Release - Học viện Nông nghiệp Việt Nam
Veo 3 alternatives Latest APK Release Học viện Nông nghiệp Việt Nam
-
Veo 3 pricing Android App Latest Release - Học viện Nông nghiệp Việt Nam
Veo 3 pricing Android App Latest Release Học viện Nông nghiệp Việt Nam
MiniMax H3 2
-
SOLRICKS/3D-Animation-Style-MiniMax-H3
image-to-video · likes 16 · trending 10
-
新一代全模态视频生成模型“MiniMax H3”在赣江新区首发 - 凤凰网江西
MiniMax 在赣江新区首发新一代全模态视频生成模型“MiniMax H3”。
视频生成模型的新发布,直接契合你对视频生成方向的关注。
Ego2Act 2
-
Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
Ego2Act:面向目标导向操作的 egocentric 视频生成评测基准,关注多步物理推理。
视频生成评测,与 3D/视频生成方向相关,但非模型/权重发布。
-
Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
Ego2Act 评估第一人称视频生成中的目标导向操作。
视频生成作为世界模拟器的重要基准。
Vidu 2
-
AIGC 驱动的内容生产力变革 --Vidu 多模态大模型的创新与实践|QCon 上海 - InfoQ-CN
InfoQ 报道 Vidu 多模态大模型创新与实践,AIGC 驱动内容生产力变革。
Vidu 多模态视频生成模型,与视频生成方向直接相关。
-
AIGC 驱动的内容生产力变革--Vidu 多模态大模型的创新与实践|QCon上海
QCon 上海分享 Vidu 多模态大模型创新与实践。
视频生成模型工程实践,可扫一眼。
Higgsfield 2
-
Higgsfield at $5.4 Billion: What the AI Platform Can Do and How Much Video Generation Costs - incrypted.com
Higgsfield 估值 54 亿美元,incrypted 分析其平台能力与视频生成成本。
视频生成行业动态,对关注视频生成方向有参考价值。
-
Video Generation Media Platform Higgsfield Launches Unified API for Over 50 Models, Pay-Per-Use Pricing Without Subscription Binding - ababnews.com
Higgsfield 推出支持 50 多款视频模型的统一 API 聚合平台。
偏商业聚合 API 服务,不涉及底层性能与模型自研细节。
Google Research 2
-
Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPost
Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation MarkTechPost
-
Automating coherent long-form video generation - Google Research
Google Research 发布「自动化长时连贯视频生成」研究。
Google 官方博客,对视频生成训练管线有参考价值。
时间线 最近 30 天
2026 年 10 月 11 日 · 周日
-
“视频大模型第一股”角逐:可灵AI拟赴港IPO,最快明年启动 - 新浪网
快手可灵 AI 拟赴港 IPO,最快 2027 年启动
视频生成头部玩家资本化,影响行业格局
-
Shengshu Technology Launches Vidu Q4 Preview Version with Support for 4K Output - AIBase
生数科技发布 Vidu Q4 Preview,支持 4K 输出
国产视频生成模型重要版本,直接影响行业对标
-
WorldGuide: Goal-Directed Video World Model for Procedural Task Execution
WorldGuide:面向程序化任务执行的目标导向视频世界模型,闭环生成与执行。
视频生成 + 世界模型 + 闭环控制,与其视频生成方向直接相关。
-
Zihan-Su/Self_Gradient_Forcing_Plus
Zihan-Su/Self_Gradient_Forcing_Plus 登上 GitHub 热榜(⭐ 91)
自回归视频生成,5s 训练窗口生成 24 小时视频
-
Veda-Sparse/Minimax-H3-R2VA-Veda-Preview
Veda-Sparse/Minimax-H3-R2VA-Veda-Preview 登上 HF 热榜(👍 13)。
文生视频模型,与生成模型方向相关。
2026 年 10 月 10 日 · 周六
-
生数科技发布视频生成模型Vidu Q4 Preview预览版本 - 凤凰网科技
生数科技发布视频生成模型 Vidu Q4 Preview 预览版。
国内头部视频生成模型新版本发布,直接影响竞品格局。
-
Fluid-Gen-Zero: Grounding Pretrained Video Generators in Physics without Training
Fluid-Gen-Zero:无需训练即可将物理仿真注入预训练视频生成器。
训练无关的物理感知视频生成,对 diffusion 优化有直接启发。
-
iCATS: Fast Video Generation via Interaction-Aware Sparse Attention and Timestep-Adaptive Sparsity
iCATS:通过交互感知稀疏注意力实现快速视频生成。
DiT 稀疏注意力加速,对 GPU kernel 优化有直接参考价值。
-
Conditional Residual Prediction: Improving Autoregressive Video Diffusion without a Bidirectional Teacher
提出 Conditional Residual Prediction,仅用图像模型初始化训练因果视频扩散模型,无需双向教师蒸馏。
直接改进自回归视频生成质量,对 streaming/长视频扩散训练有参考价值。
-
Parametric Trajectory Distillation for Few-Step Video Generation
提出 Parametric Trajectory Distillation (PTD),用多项式参数化教师轨迹段以改善少步视频生成蒸馏。
解决 few-step 蒸馏中轨迹曲率过高导致细节退化的问题,对加速扩散/Flow Matching 推理直接有用。
-
Memory Forcing: Attendable Mid-Horizon History for Streaming Video Generation
提出 Memory Forcing,通过 Archive & Working Banks 分区 KV 缓存解决流式视频生成的 mid-horizon 遗忘问题。
在固定显存下保留中期历史,对长视频 streaming 系统有工程价值。
-
Phase-aware video generation for physics-grounded dynamics and interactions
提出 PAVG,双分支 Phase-Aware Video Generator 分别建模固体/气体动力学并通过交叉注意力耦合。
显式建模多相物理交互,对物理一致的视频生成和世界模型有启发。
-
Enkio to Bring Next-Generation Kling 4.0 Video Generation Into Its AI Music Video Pipeline - openPR.com
Enkio 将 Kling 4.0 集成到其 AI 音乐视频流水线。
Kling 4.0 被第三方采用,但非官方发布,信息价值有限。
2026 年 10 月 9 日 · 周五
-
视频模型迎来“DeepSeek时刻”?生数科技发布 Vidu Q4 Preview 高表现力旗舰模型 - 凤凰网科技
生数科技发布 Vidu Q4 Preview 高表现力旗舰视频模型。
视频生成模型新发布,与工程师方向直接相关。
-
Vidu Q4 Preview发布:推动旗舰视频模型大规模应用落地 - 搜狐网
Vidu发布Q4 Preview,推动旗舰视频模型大规模应用落地。
Vidu为重要视频生成模型,Q4 Preview涉及产品化进展。
-
视频DeepSeek时刻?Vidu Q4 Preview背后的效率账与世界模型底气 - 搜狐网
生数科技 Vidu Q4 Preview 引发视频 DeepSeek 时刻讨论。
视频生成模型进展,与工程师方向相关。
-
Anthropic Adds Dashboards and Video Generation to Claude, Refreshes Small Model Lineup - BigGo Finance
Anthropic 为 Claude 新增 Dashboards 和视频生成功能,更新小模型阵容。
Claude 新增视频生成,与生成模型方向有一定关联。
-
北大博士世界模型初创公司获3000万美元融资,视频生成成本压缩至十分之一|赛道|仿真|训练|视觉|推理 - 手机新浪网
北大博士世界模型初创公司获 3000 万美元融资,视频生成成本压缩至十分之一。
世界模型+视频生成,成本突破值得关注。
-
Eloelo launches Dolphin AI video generation platform | Tap to know more | Inshorts - Inshorts
Eloelo 推出 Dolphin AI 视频生成平台。
新视频生成平台,但知名度较低。
-
AI软件周报:DeepSeek新一轮融资近1000亿;快手任命于越为可灵AI CEO;曝月之暗面完成IPO前融资… - iheima
AI周报:DeepSeek融资近千亿、可灵AI CEO任命、月之暗面IPO前融资。
行业动态汇总,含多条重要融资与人事信息。
-
首篇自回归视频生成Memory综述来了,港科大、城大、复旦、CMU、NYU、NTU等联合出品 - 搜狐网
港科大、城大、复旦、CMU等联合发布首篇自回归视频生成Memory综述。
自回归视频生成方向综述,对视频生成研究有参考价值。
2026 年 10 月 8 日 · 周四
-
Shengshu Technology Launches Vidu Q4 Preview, A Next-Generation AI Video Model Built for Lifelike Performances - GlobeNewswire
生数科技发布 Vidu Q4 Preview 新一代 AI 视频模型。
国产头部视频生成模型新版本,直接影响工程师关注方向。
-
CCDF: A Benchmark Dataset for Deepfake Detection in Real-World Surveillance Footage
arXiv:2610.07939v1 Announce Type: new Abstract: Due to rapid advances in Generative AI, commercial video generation tools can be used to produce fabricated…
-
Backend-Agnostic Sparse Attention for Fast High-Resolution Visual Generation
arXiv:2610.08772v2 Announce Type: new Abstract: Diffusion Transformers (DiTs) have achieved strong performance in image and video generation, but the quadratic…
-
Rethinking Visual Provenance: Detection and Watermarking Across Direct Visual Generation and LLM-Driven Code Rendering
arXiv:2610.08137v1 Announce Type: cross Abstract: AI systems create images and videos with image/video generation models or by writing code and graphics…
-
ACG-WAM: World-Action Modeling via Action-Conditioned Geometric Latent Prediction
arXiv:2610.06965v1 Announce Type: new Abstract: World action models jointly learn visual predictionand robot actions, providing a way to use observations…
-
DeepSeek新一轮融资或达千亿元;快手可灵AI计划最早明年赴港上市|未来商业早参 - https://www.mrjjxw.com/
DeepSeek 新一轮融资或达千亿元;可灵 AI 计划明年赴港上市。
头部模型公司融资与 IPO 动态,行业重要信息。
-
《怪物史莱克》编剧也来了!这家AI影视公司,视频模型全球第二!
某 AI 影视公司视频模型全球第二,聘请《怪物史莱克》编剧。
视频生成赛道动态,与 3D/视频生成方向相关。
-
Kimi's parent reportedly preparing for Hong Kong IPO at around $50 billion valuation! Kling AI is on its way too - Binance
Kimi 母公司筹备港股 IPO,估值约 500 亿美元。
头部 AI 公司 IPO 动态,行业关注度高。
-
Claude、GPT“跨界”做视频,Seedance们的护城河还牢吗? - 凤凰网科技
Claude、GPT 跨界做视频,Seedance 等视频模型护城河受挑战。
通用大模型进入视频生成赛道,影响竞争格局。
-
Diverse Motion Customization via Control-based Dynamic Optimization
arXiv:2610.07911v2 Announce Type: new Abstract: Despite recent advances in video generation, motion customization remains challenging due to content leakage,…
2026 年 10 月 7 日 · 周三
-
快手-W午后涨近3% 可灵AI全新模型Kling 4.0已开启内测|阿里巴巴|百度|腾讯|长镜头|中金 - 新浪财经
可灵 AI 全新模型 Kling 4.0 已开启内测。
视频生成模型新版本发布,直接影响相关优化工作。
-
【#曝快手可灵AI筹备赴港IPO#:已选定中金、高盛、瑞银承销,拟至少融资10亿美元】据财联社,快手旗下视频生成大模型可灵AI据悉计划最早明年赴港上市,至少融资10亿美元。知情人士透露,可灵AI已选择中金公司、高盛和瑞银为其香港IPO提供承销服务,目标最早于 - 手机新浪网
【#曝快手可灵AI筹备赴港IPO#:已选定中金、高盛、瑞银承销,拟至少融资10亿美元】据财联社,快手旗下视频生成大模型可灵AI据悉计划最早明年赴港上市,至少融资10亿美元。知情人士透露,可灵AI已选择中金公司、高盛和瑞银为其香港IPO提供承销服务,目标最早于 手机新浪网
-
机构看好港股新股市场继续火热 月之暗面、可灵AI或成下一批重磅IPO - 富途牛牛
机构看好港股新股市场继续火热 月之暗面、可灵AI或成下一批重磅IPO 富途牛牛
-
可灵AI选定多家投行冲刺港股,视频生成赛道资本化提速 - 手机网易网
可灵AI选定多家投行冲刺港股,视频生成赛道资本化提速 手机网易网
2026 年 10 月 6 日 · 周二
-
Spatial Memory Intelligence: Endowing World Models with Understanding-Driven Long-Term Memory
SMI:为世界模型赋予理解驱动的长程空间记忆。
长视频生成的记忆管理,直接影响训练效率。
-
SymRegFlow: Symmetry-Regularized Flow Matching for Video World Models
SymRegFlow:对称正则化 Flow Matching 用于多视角世界模型。
Flow Matching 视频生成核心方法改进。
-
TRAC: Trajectory-aware Reuse and Adaptive Correction for Efficient Autoregressive Video Generation
TRAC:轨迹感知复用与自适应校正用于高效自回归视频生成。
训练无关的 AR 视频生成加速框架。
-
Custom Forcing: Training-Free Subject Customization for Autoregressive Video Generation
Custom Forcing:训练无关的自回归视频生成主体定制。
KV Cache 复用实现实时视频定制,工程价值高。
-
A Simulation-Grounded Agentic VLM Framework for Wildfire Monitoring and Reporting
模拟驱动的 VLM 框架用于野火监测。
VLM 应用研究,与视频生成关联较弱。
-
Imagine the Future, Internalize the Gist: Efficient VLA Reasoning via Internalized Spatiotemporal Imagination
IG-VLA:通过内化时空想象实现高效 VLA 推理。
机器人方向,与视频生成关联有限。
2026 年 10 月 5 日 · 周一
-
v0 ai for video generation APK Download for Mobile - Học viện Nông nghiệp Việt Nam
v0 ai for video generation APK Download for Mobile Học viện Nông nghiệp Việt Nam
-
Veo 3 alternatives Latest APK Release - Học viện Nông nghiệp Việt Nam
Veo 3 alternatives Latest APK Release Học viện Nông nghiệp Việt Nam
-
SOLRICKS/3D-Animation-Style-MiniMax-H3
image-to-video · likes 16 · trending 10
-
Sora 2 Android Software Installer - Học viện Nông nghiệp Việt Nam
Sora 2 Android Software Installer Học viện Nông nghiệp Việt Nam
2026 年 10 月 4 日 · 周日
-
Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
Ego2Act:面向目标导向操作的 egocentric 视频生成评测基准,关注多步物理推理。
视频生成评测,与 3D/视频生成方向相关,但非模型/权重发布。
-
Honeycomb: Constant-Size Scene Memory Representation for Video World Models
Honeycomb:基于 HexMemory 低秩表示的恒定大小场景记忆,用于视频世界模型。
视频世界模型记忆机制,与视频生成相关,但非直接可用的模型/权重。
-
ok66oqyea0fi8zqv/seedance2.5-seedance-2.5-api-cn
seedance2.5 API 中文文档仓库登 GitHub 热榜(⭐ 90)。
Seedance 2.5 视频生成 API 文档,与视频生成方向相关。
2026 年 10 月 3 日 · 周六
-
李飞飞:当视频生成、NVIDIA都自称世界模型,我们需要一个分类法|OpenAI|Genie|Sora|强化学习|英伟达_手机新浪网 - 新浪财经
李飞飞谈视频生成与世界模型分类法,引发行业讨论。
权威观点,有助于厘清世界模型概念边界。
-
DramaAgent: Agentic Storytelling Video Generation
DramaAgent 提出分层智能体长视频生成框架。
长视频叙事一致性是视频生成核心难题。
-
Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
Ego2Act 评估第一人称视频生成中的目标导向操作。
视频生成作为世界模拟器的重要基准。
-
Token-Level Video Reinforcement Learning
TVRL 提出 Token 级视频强化学习方法。
细粒度视频生成优化,直接影响训练效率。
-
Generative Cinematographer: Composing Camera and Object Motion in 3D
GenCine 将单图提升为可编辑 3D 场景,联合控制相机路径和前景物体 3D 运动。
直接解决 3D+视频生成中相机与物体联合控制难题,对 3D 生成工作高度相关。
-
VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation
VideoWeaver 提出 agent 框架和 benchmark,动态组合技能并生成超长视频。
长视频生成的 agent 化方案,对视频生成系统工程落地有参考价值。
-
SAGA: Stable Acceleration Guidance for Autoregressive Video Generation
SAGA 提出训练无关的稳定加速 guidance,解决自回归视频生成的时序漂移问题。
直接针对自回归扩散视频生成的 flicker/jitter 问题,训练优化高度相关。
-
Soundwich: Video Generation with Layered and Controllable Audio
Soundwich 实现视频生成中多音轨独立可控。
音视频联合生成,训练无关框架。
-
Towards Subject Consistency over Dynamic Subject Sets in Video Generation
DynSC-Eval 提出动态主体集视频一致性评估。
视频生成评估方法,关注主体一致性。
-
PhysicsLENS: Diagnosing Physical Property Blindness in Video Generation Models
PhysicsLENS 诊断视频生成模型的物理属性盲区。
视频物理合理性评估,对世界模型很关键。
-
PickMoment: Continuous-Time Single-Image-to-Video via Learning Deblurring and Blur-to-Video
PickMoment 提出连续时间单图到视频生成方法。
图像到视频生成新思路,与 MeanFlow 类比。
2026 年 10 月 2 日 · 周五
-
LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation
arXiv论文:LongTake,长视频生成的两阶段训练管线。
直接解决长视频扩散生成质量问题。
-
No Corners Cut: State-Grounded Transitions for Mid-Stream Prompt Switches in Video Generation
arXiv论文:SEGUE,流式视频生成中提示切换的状态忠实过渡。
解决流式生成中prompt切换的关键问题。
-
PARK: Accurate Block Retrieval for Sparse Attention in Video Diffusion Transformers
arXiv论文:PARK,视频DiT稀疏注意力的精确块检索。
直接优化DiT视频生成的注意力计算效率。
-
DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency
arXiv论文:DeCoPrune,自回归视频扩散的KV Cache剪枝。
直接优化自回归视频生成的推理效率。
-
Uncertainty-Aware Consistency Distillation for Few-Step Video Generation
arXiv论文:不确定性感知一致性蒸馏用于少步视频生成。
提升视频蒸馏质量,直接影响推理速度。
-
Utopai Studios Launches PAI Production Platform and Utopai X Video Model - awn.com
Utopai Studios 发布 PAI 制作平台和 Utopai X 视频模型。
新视频生成模型发布,但非知名机构,热度待观察。
-
FrameMorrow: Future-guided Frame Selection with Prospective Tokens for Long-Horizon Video Generation
arXiv论文:FrameMorrow,面向未来的帧选择用于长视频生成。
长视频生成历史选择策略,有一定参考价值。
-
MindWorldBench: Evaluating Mental-State-to-Behavior Reasoning in Image-to-Video Generation
arXiv论文:MindWorldBench,心理状态到行为的视频生成评测。
新评测基准,偏认知推理非核心方向。
-
VR-JEPA: Learning Contrastive-State Latent Guidance for Generation-based Video Reasoning
arXiv论文:VR-JEPA,对比态潜在引导的视频推理生成。
视频推理生成,偏推理非核心优化方向。
-
GLARE: Generating Listening Heads with Appropriate Reactions
GLARE 研究生成对话中听众自然反应,构建约 147 小时 speaker-listener 配对数据集。
视频生成下游应用,但与核心方向关联较弱。
-
ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
ViTeX-Bench 提出视频场景文本编辑基准,关注时序一致性与局部编辑保真度。
视频编辑评测,与扩散/生成方向相关但非核心。
-
Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
Physis-Lang 用自演化物理语言作为视频世界模型的共享可优化表示。
视频世界模型新思路,与生成模型方向相关。
-
PISCO: Precise Video Instance Insertion with Sparse Control
PISCO 研究视频中精确实例插入,保持场景完整性与物理一致性。
视频生成精细控制,与扩散模型应用相关。
2026 年 10 月 1 日 · 周四
-
AIGC 驱动的内容生产力变革 --Vidu 多模态大模型的创新与实践|QCon 上海 - InfoQ-CN
InfoQ 报道 Vidu 多模态大模型创新与实践,AIGC 驱动内容生产力变革。
Vidu 多模态视频生成模型,与视频生成方向直接相关。
-
反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元 - 智源社区
RunningHub 发布增强版 H3,反超 Seedance 2.0,1 秒 0.1 元。
视频生成成本突破,对关注视频生成性价比有直接参考价值。
-
AgenticGen:当广告视频生成学会"看数据说话" - 科技行者
AgenticGen:广告视频生成结合数据分析能力。
Agent 驱动的视频生成新方法,与视频生成方向直接相关。
-
于越担任可灵AI首席执行官 - 东方财富
于越担任可灵 AI 首席执行官,快手调整 AI 组织架构。
可灵人事变动,对关注快手 AI 方向有参考价值。
-
可灵AI Kling4.0开启内测;豆包将推类似Muse的个人助理产品|未来商业早参 - mrjjxw.com
可灵 AI Kling 4.0 开启内测,豆包将推类似 Muse 的个人助理产品。
可灵新版本内测,对关注视频生成方向有参考价值。
-
快手组织变阵 程一笑兼任社区科学线 可灵AI迎来掌舵人 - 搜狐网
快手组织变阵,程一笑兼任社区科学线,可灵AI迎来掌舵人。
可灵AI高管变动,影响产品方向。
-
Higgsfield at $5.4 Billion: What the AI Platform Can Do and How Much Video Generation Costs - incrypted.com
Higgsfield 估值 54 亿美元,incrypted 分析其平台能力与视频生成成本。
视频生成行业动态,对关注视频生成方向有参考价值。
2026 年 9 月 30 日 · 周三
-
Kling AI Previews Kling 4.0 With 30-Second Native Clips and Multi-Reference Control - Pandaily
Kling AI 预览 Kling 4.0:支持 30 秒原生片段与多参考控制。
主流视频生成模型重大版本更新。
-
AIGC 驱动的内容生产力变革--Vidu 多模态大模型的创新与实践|QCon上海
QCon 上海分享 Vidu 多模态大模型创新与实践。
视频生成模型工程实践,可扫一眼。
-
5亿元押注可灵,基石资本重仓AI视频生成赛道 - Moomoo
基石资本 5 亿元押注可灵,重仓 AI 视频生成赛道。
视频生成赛道大额融资动态。
2026 年 9 月 29 日 · 周二
-
加速“进化” 快手可灵发布Kling4.0 支持单次生成视频最长可达30秒 - 东方财富
快手可灵发布 Kling 4.0,支持单次生成视频最长 30 秒。
主流视频生成模型重要版本更新,直接影响竞品格局。
-
AWS Trainium Runs Real-Time AI Video Generation Without NVIDIA: NKI Kernel Playbook Published - Tech Times
AWS Trainium 实现实时 AI 视频生成,发布 NKI Kernel Playbook。
非 NVIDIA GPU 上跑视频生成的 kernel 优化实践,直接相关。
2026 年 9 月 28 日 · 周一
-
MVAgent: Multi-Agent Video Generation via Consistent Condition Construction and Shot-Level Policy Optimization
MVAgent:多智能体协作管线,通过typed conditioning解决多镜头视频生成一致性问题。
直接解决多镜头视频生成中角色/布局一致性问题,对视频生成工程师有参考价值。
-
Where and When to Force: Routed Forcing for Streaming Avatars
Routed Forcing:解决Self Forcing中DMD导致streaming avatar动态坍缩的问题。
直接改进streaming avatar生成的动态多样性,对扩散蒸馏和实时生成有参考价值。
-
Where Compute Matters: Heterogeneous Attention for Efficient Video Diffusion
HetA-DiT:异构注意力机制,按token难度自适应分配全局/稀疏注意力计算。
直接优化视频扩散模型的注意力计算效率,对GPU kernel和推理优化有直接影响。
-
DyMD: Preserving Interaction Dynamics through Distribution Matching Distillation in Few-Step Video World Models
DyMD:解决DMD蒸馏视频世界模型时抑制机器人-物体交互动态的问题。
揭示DMD在少步视频生成中丢失交互动态的机理并提出改进,对扩散蒸馏有直接参考价值。
-
Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation - MarkTechPost
Google Research Introduces an AI Video Co-Director: 4 Agentic Frameworks for Coherent, Minutes-Long Video Generation MarkTechPost
-
Veo 3 pricing Android App Latest Release - Học viện Nông nghiệp Việt Nam
Veo 3 pricing Android App Latest Release Học viện Nông nghiệp Việt Nam
-
TrafficImag: A Benchmark for Counterfactual Roadside Traffic Video Generation
TrafficImag:首个反事实路边交通视频生成基准,含9002张标注图和7043条视频。
新基准但偏自动驾驶感知,与生成模型训练优化关联有限。
-
Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models
DyMoS:通过重新平衡参考帧自注意力解决I2V模型运动不足问题。
分析I2V模型运动抑制的注意力机制原因,对视频生成质量优化有参考价值。
-
Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation
Auteur:语言驱动的人物中心电影化镜头控制生成方法。
视频生成中摄像机控制新方法,对3D/视频生成工程师有参考价值。
-
NavGen: Visual Generative Models as a Scalable Data Engine for Embodied 3D Navigation
NavGen:用高保真视觉生成模型作为具身3D导航的可扩展数据引擎。
生成模型用于导航数据增强,偏具身智能,与视频生成训练关联弱。
-
Keep the Future, Drop the Rollout: RIFT for World Action Models
RIFT:世界动作模型中复用固定最终K/V缓存替代完整rollout,降低部署延迟。
减少世界模型推理延迟,对推理优化有一定参考价值。
-
Grounded Action Model: 3D Grounding as a Foundation for Robotics
Grounded Action Model:以3D grounding为基石的机器人基础模型新范式。
机器人基础模型新范式,偏具身智能,与视频生成/GPU优化关联弱。
2026 年 9 月 27 日 · 周日
-
Google Just Made Free 1080p AI Video Generation Available to Anyone - Decrypt
Google 向所有用户免费开放 1080p AI 视频生成(Decrypt 报道)。
Google 视频生成服务重大策略变化,直接影响行业竞争格局。
-
WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
WanPE:397B 参数 prompt 增强模型,用 105 万视频训练,提升文生视频导演级规划。
大规模 prompt 增强方案,对视频生成工作流有直接参考价值。
-
SurgVeo:面向手术视频生成的专家引导基准与合理性金字塔框架——揭示生成式AI从视觉保真到手术逻辑的鸿沟 - 生物通
SurgVeo 提出面向手术视频生成的专家引导基准与合理性金字塔框架。
视频生成在垂直领域的评估基准,对生成质量评估有参考。
-
Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview
Minimax-H3-T2VA-Veda-8NFE-600Step-Preview 登上 HF 文生视频热榜(likes 17)。
Minimax 新预览模型,关注视频生成能力演进。
2026 年 9 月 26 日 · 周六
-
音视频生成提速54倍!TurboT2VA:分布蒸馏与轨迹蒸馏的联合蒸馏方案 - 智源社区
TurboT2VA:分布蒸馏+轨迹蒸馏联合方案,音视频生成提速 54 倍。
蒸馏加速视频生成,对推理优化有参考价值。
-
ViRDM: Taming Representation Distribution Matching for Few-Step Causal Video Generation
ViRDM:将表示分布蒸馏用于少步因果视频生成,去掉 teacher-critic 栈。
少步视频生成蒸馏新方法,对加速推理有直接价值。
-
AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
AV-GRPO:用模态解耦的扩散 RL 做联合音视频生成。
扩散模型 RL 后训练用于音视频生成,技术方向高度相关。
-
Accelerating Video Diffusion via Training-Free Trajectory Routing
TRACK:训练无关的轨迹感知路由,大小模型异构去噪加速视频扩散。
免训练加速视频扩散推理,对 GPU 推理优化有直接价值。
-
Training Object Permanence in World Models
WROP:用认知科学启发的数据集训练视频模型的物体永久性。
视频生成模型物理推理能力研究,方向相关。
-
WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
WanPE:397B 参数 prompt 增强模型,用于文本到视频生成的电影级分镜规划。
直接面向视频生成 pipeline,prompt 增强可提升生成质量。
-
AI Video Generation Gets Human: A New Survey Maps the Field’s Biggest Hurdles - bioengineer.org
新综述梳理 AI 视频生成领域的核心障碍。
视频生成方向综述,可快速了解领域痛点。
-
Seedance 2.0 and Seedance 2.5: The latest innovations in AI video generation - London Daily News
Seedance 2.0 和 2.5 发布,推进 AI 视频生成。
字节视频生成模型新版本,关注竞争格局。
2026 年 9 月 25 日 · 周五
-
Google Vids unlocks free HD AI video generation for all personal Google accounts - Chrome Unboxed
Google Vids 向所有个人 Google 账号开放免费 HD AI 视频生成。
头部厂免费开放 HD 视频生成,直接影响产品竞争格局。
-
OpenRouter Highlights New Benchmarks for AI Video Model Performance - TipRanks
OpenRouter 发布 AI 视频模型性能新基准。
新 benchmark 直接影响模型选型与优化方向评估。
-
音视频生成提速54倍!TurboT2VA:分布蒸馏与轨迹蒸馏的联合蒸馏方案 - 搜狐网
TurboT2VA:分布蒸馏+轨迹蒸馏联合方案,音视频生成提速 54×。
蒸馏加速直接可用于训练/推理性能优化。
-
Latent evolving World Action Model
arXiv 论文 Latent evolving World Action Model:分析 VDM 表征对 WAM 动作生成的影响。
直接研究 VDM 训练效率与动作建模,对训练优化有强参考。
-
Automating coherent long-form video generation - Google Research
Google Research 发布「自动化长时连贯视频生成」研究。
Google 官方博客,对视频生成训练管线有参考价值。
-
实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招 - 风闻
Vidu S2 发布:支持实时互动、实时改视频与空间视频。
国产头部视频模型大更新,可关注其工程实现。
-
The Past Frames the Future: Memory for Autoregressive Video Generation - alphaXiv
alphaXiv 论文:用 Memory 改进自回归视频生成。
自回归视频生成架构研究,可启发训练侧优化。
2026 年 9 月 24 日 · 周四
-
谷歌(GOOGL.US)Vids免费AI视频生成扩容:套餐订阅用户享高级功能与更高限额提供者智通财经 - 英为财情 Investing.com
智通财经/英为财情:谷歌 Vids 免费 AI 视频生成扩容,订阅用户享更高限额
权威财经媒体确认 Google 视频生成商业化策略变化
-
Alphabet将Google Vids的免费AI视频生成功能向所有用户开放 - 富途牛牛
富途牛牛:Alphabet 将 Google Vids 免费 AI 视频生成向所有用户开放
权威财经源确认 Google 视频生成全面开放策略
-
QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for World Models and Video Generation
QuantWM 提出 2-bit KV Cache 量化方法,解决世界模型和视频生成的时序闪烁问题。
KV Cache 量化直接影响视频生成推理显存与性能,与工作直接相关。
-
TBC Neuron-Derived AI Video Model: 5x Faster on AWS [2026] - tech-insider.org
Tech Insider 称 TBC 神经元衍生 AI 视频模型在 AWS 上快 5 倍
涉及推理加速,但来源非一手,谨慎参考
2026 年 9 月 23 日 · 周三
-
The Biological Computing Partners With AWS To Launch AI Video Model With 5x Faster Generation And 80% Lower Costs - Pulse 2.0
Biological Computing 联手 AWS 推出提速5倍的视频生成模型。
宣称推理提速5倍且降本80%,涉及重大推理性能优化。
-
Seedance 2.5 上线 Draft 模式:先用 480P 验证创意,满意再用 1080P 生成终版 - 新浪财经_金融信息服务商
Seedance 2.5 推出 480P 验证、1080P 出图的 Draft 模式。
典型两阶段级联生成优化产品方案,大幅节约推理成本。
-
Accurate Motion Estimation with B\'ezier Control Point for Efficient Frame Interpolation
ABC-Inter结合贝塞尔控制点与解耦光流估计实现高效高保真插帧。
视频插帧与光流估计模块优化,关注推理延迟与运动平滑度可看。
2026 年 9 月 22 日 · 周二
-
4DGS-Fixer: Generative Sparse-View 4D Gaussian Splatting with Iterative Refinement Guided by Video Diffusion Priors
论文提出 4DGS-Fixer,结合视频扩散先验与迭代细化,解决稀疏视角 4DGS 几何初始化不足问题。
结合 4DGS 与扩散先验的动态重建,直接契合 3D/视频生成方向。
-
JEPA Guided Diffusion: Predictive Vision-Language Conditioning for Generative Traffic Forecasting
论文提出 JEPA 引导的扩散框架,解耦潜在动力学表征学习与视频扩散生成,大幅降低交通预测训练开销。
解耦 JEPA 与扩散视频生成的端到端优化思路,对生成模型系统设计极具参考价值。
-
CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
论文提出 CompAdapt 框架,通过神经动力学复合运动建模提升 T2V 扩散模型的物理规律一致性与泛化性。
针对视频扩散模型物理一致性缺陷的架构改进,属视频生成前沿。
-
MT-WAM: Reorienting the One-Pass Predictive Representation Toward Action Generation
论文提出 MT-WAM,利用单次视频 DiT 前向抽取表征,并加入 2D 点轨迹与双流结构直接指导动作生成。
DiT 单次前向表征与动作结合,涉及 DiT 架构重构与高效推理。
-
视频生成模型到底会不会“思考”?我们测了27个任务给出答案 - 科技行者
科技行者设计27个任务评测主流视频生成模型在物理规律认知与因果推理上的能力。
系统剖析视频生成模型的真实物理与推理极限,契合研究方向。
-
The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
提出时序上下文路由机制,解决剧本驱动音视频联合生成中镜头切换与台词对齐不准的问题。
音视频联合多模态生成中的时序对齐问题,对视频生成控制细节有参考价值。
2026 年 9 月 21 日 · 周一
-
Seedance 2.5 还能这么玩?只要一张图, 生成一个可随意摆弄的 3D 世界 - 爱范儿
爱范儿报道 Seedance 2.5 支持单图生成可交互的 3D 世界场景。
涉及 3D/世界生成的新玩法与交互落地,值得扫一眼技术形态。
-
论文周报丨Vidu S2实现实时720P数字人生成与视频编辑;NCP-ArchPreview探索LLM隐空间预训练新范式...速览一周AI前沿论文 - 智源社区
智源论文周报介绍 Vidu S2 实时 720P 视频生成及 LLM 隐空间预训练新范式。
包含实时视频生成与隐空间架构研究,与生成模型方向高度契合。
2026 年 9 月 20 日 · 周日
-
Runway wants to turn AI video generation into a live stream you control in real time - the-decoder.com
Runway计划将AI视频生成转向实时可交互的流式输出。
实时流式生成对自回归与扩散推理延迟提出极限算子要求。
-
ByteDance Unveils Seedance 2.5 AI Video Model - TechJuice
字节跳动推出Seedance 2.5视频生成模型,性能全面提升。
头部厂商核心视频生成模型更新,重点关注生成质量与架构。
-
I tested the generation speed of the Intel graphics card 'Intel Arc Pro B70 Creator 32GB,' which has 32GB of VRAM and costs less than 300,000 yen, by running the local LLM 'Qwen3.8 27B' and the video generation AI 'MiniMax H3.' - GIGAZINE
GIGAZINE 实测 Intel Arc Pro B70 32GB 显卡运行 MiniMax H3 视频生成及 Qwen 模型的生成速度。
提供非英伟达硬件上大显存运行视频生成模型的实测参考。
-
论文周报丨Vidu S2实现实时720P数字人生成与视频编辑;NCP-ArchPreview探索LLM隐空间预训练新范式...速览一周AI前沿论文 - 智源社区
智源论文周报介绍 Vidu S2 实现实时 720P 数字人生成与视频编辑等技术进展。
涉及实时高清视频生成与编辑的架构方案,值得留意。
-
Abiray/MiniMax-H3-Singularity-GGUF
图生视频模型 MiniMax-H3-Singularity-GGUF 登上 HF 热榜(⭐ 16)。
视频扩散/Flow 模型的 GGUF 量化实践值得工程关注。
-
vpakarinen/asmr-trigger-audio-h3-lora
文生视频 LoRA 微调权重 asmr-trigger-audio-h3-lora 登上 HF 热榜(⭐ 13)。
视频生成特定音频触发 LoRA,可扫一眼效果。
-
智象团队以技术使命感支撑团队及视频生成世界模型研发 - 微博
微博博主发文宣传智象团队研发视频生成与世界模型的企业使命感。
纯团队公关宣传文案,无任何技术价值。
-
百万视频生成中……又到了许我耀眼最佳赏味期 #一分钟精选视频扶持计划# - k.sina.com.cn
社交媒体娱乐向视频扶持计划与影视剧宣发内容。
娱乐营销内容,与模型技术完全无关。
-
#科技# 【ECCV2026 现场】视频生成看起来很逼真,但模型真懂物理吗? - Sohu
搜狐报道 ECCV 现场学者针对当前视频生成模型是否真正理解物理规律的圆桌讨论。
泛学术探讨与观点汇总,缺乏深入系统或架构方案。
-
【ECCV2026 现场】视频生成看起来很逼真,但模型真懂物理吗? - Sohu
ECCV2026研讨视频生成模型对物理规律理解与真实性局限。
探讨生成模型物理一致性瓶颈,关涉评测与网络归纳偏置。
-
SkyProduction天工工作台中秋国庆特惠第二波:Seedance 2.5 720P 低至0.27元/秒,全网地板价! - 财中社
天工工作台推出Seedance 2.5 720P生成节假日特惠折扣。
API调用商业促销,跳过。
-
用 Seedance 2.5 拍《沙丘 3》,我们替你把 AI 短片的坑全都踩过了 - 爱范儿
爱范儿分享基于Seedance 2.5进行AI视频短片制作踩坑经验。
提示词和内容生成实践,与模型及系统优化无关。
-
“看见微光”可灵AI公益影像大赛启动,作品征集持续至11月1日 - Sohu
快手可灵AI启动“看见微光”公益影像大赛作品征集。
营销赛事活动,跳过。
-
TikTok Expands AI Video Generation Tools in Symphony Ad Suite - TechJuice
TikTok在Symphony广告套件中扩展AI视频生成工具。
广告商业化工具更新,缺乏底层架构价值。
-
BarneyD66/clipmivo-tools
ClipmivoAI视频生成接口与CLI工具库登上GitHub新仓库榜(⭐ 66)。
仅为应用层周边调用封装,非核心生成算法或算子工程。
-
火山引擎×AMD 助力砹脉营销(A.M.A)以 Seedance 重塑汽车营销新范式 - Sohu
火山引擎与AMD合作助力砹脉营销利用Seedance进行汽车视频营销。
公关营销稿件,不含具体技术实现细节。
2026 年 9 月 19 日 · 周六
-
Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
论文提出 Video DeltaNet,结合局部 Softmax 与帧级线性显存注意力加速实时视频生成。
直击视频扩散模型注意力算力瓶颈,混合注意力设计对算子优化极具价值。
-
WarmBloodAban/Minimax-h3_Singularity
图生视频模型 WarmBloodAban/Minimax-h3_Singularity 登上 HF 热榜。
视频生成模型热榜条目,可关注生成质量与架构。
-
【ECCV2026 现场】视频生成看起来很逼真,但模型真懂物理吗? - sohu.com
ECCV 现场研讨视频生成模型的物理世界表征与理解能力。
探讨视频模型物理规律准确度,涉及世界模型前沿瓶颈。
-
realrebelai/FastH3-V2_GGUFs
FastH3-V2 GGUF 量化版登上 HF 文生视频热榜(likes 14)。
视频生成模型量化格式,关注边缘推理与低资源显存优化。
-
Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model
构建物理世界推理评估框架,系统评测多模态统一模型 MiniMax-H3。
关注多模态生成模型在物理世界推理上的能力,可作为评测参考。
-
LynnReal-AI/LynnReal-Omni
四步快速推理多任务全能视频生成框架LynnReal-Omni登上GitHub热榜(⭐ 193)。
四步蒸馏推理与流式长视频生成,直接关联推理优化方向。
-
CZMartin22/TaoMate-H3-3step-ComfyUI
TaoMate-H3 3步快速推理 ComfyUI 流程登上 HF 热榜(likes 31)。
少步数蒸馏快速采样,涉及生成模型采样加速技巧。
-
Lightricks/LTX-2.5-22b-LoRA-Cinemagraph
Lightricks 发布 LTX-2.5 动图生成 LoRA 并登上 HF 热榜。
知名团队 LTX 视频系列衍生权重,微动态生成参考。
-
TaoLiveAIGC/TaoMate-H3
TaoMate-H3 登上 HF 文生视频热榜(likes 94)。
社区视频生成模型权重,可扫一眼其生成画质与推理成本。
-
coll3879xx-cyber/dola-render-gateway
开源项目 dola-render-gateway 定位为高性能视频生成网关与会话协调器。
涉及视频生成服务的调度与推理会话管理,可参考其工程架构。
-
delaprada/Mask-Forcing
Mask Forcing 官方代码开源,通过双噪声掩码展开优化自回归视频扩散蒸馏。
聚焦自回归视频扩散模型的蒸馏与采样加速,技术相关度高。
-
AMAP-ML/DreamX-Creator
高德2K分辨率原生音视频协同生成项目DreamX-Creator登上GitHub热榜(⭐ 303)。
原生音视频联合生成,涉及多模态DiT架构及高分辨率算子需求。
-
wide-trace/open-higgsfield
统一图文生视频Studio前端项目open-higgsfield登上GitHub热榜(⭐ 3202)。
多视频生成模型聚合工作台,偏前端集成可按需扫一眼。
-
视频生成模型架构演变:从GAN到Diffusion再到DiT - 微博
微博博主发文梳理视频生成模型从GAN、Diffusion到DiT的架构演变。
泛科普盘点,无新增技术干料可跳过。
-
火山引擎×AMD助力砹脉营销(A.M.A)以Seedance重塑汽车营销新范式 - t.cj.sina.cn
火山引擎与 AMD 合作推动 Seedance 模型用于汽车营销。
商业合作与营销场景宣传稿,缺乏技术干货。
-
Text to Video AI Latest Android App Download - Học viện Nông nghiệp Việt Nam
越南某农业学院网站出现 AI 文生视频安卓应用下载推广。
垃圾营销链接,与核心技术毫无关联。
-
必赢体育线上网赌网址_游戏资讯_字节跳动新一代视频模型 30秒一次生成关键能去油腻感 - 体坛
博彩站点转载字节跳动新一代视频模型生成效果相关资讯。
黑产SEO转载抓取源,非权威首发。
-
Video Generation Media Platform Higgsfield Launches Unified API for Over 50 Models, Pay-Per-Use Pricing Without Subscription Binding - ababnews.com
Higgsfield 推出支持 50 多款视频模型的统一 API 聚合平台。
偏商业聚合 API 服务,不涉及底层性能与模型自研细节。
-
yabo888体育平台入口下载发布:AI视频生成速度飙升300%,199元/月起-体坛网_体坛+ - 体坛
某博彩体育平台借 AI 视频生成速度飙升进行导流宣传。
非法博彩推广垃圾资讯,请直接忽略。
-
全球首发 | 乐彩9123-购彩大厅 正式上线:AI视频生成进入实时交互时代,电影级效果触手可及 - 体坛
涉博彩违规引流营销信息假借AI视频生成名义发布。
垃圾营销与博彩引流信息,直接跳过。
-
3U国际娱乐_游戏资讯_字节跳动新一代视频模型 30秒一次生成关键能去油腻感 - 体坛
娱乐博彩站点转载字节跳动视频生成模型相关动态。
与上一条重复且来源为黑产SEO站。
-
WarmBloodAban/Minimax_H3_LoRAs
Minimax_H3_LoRAs 登上 HF 图生视频热榜(likes 13)。
社区零散 LoRA 权重,热度较低且缺乏技术细节。
-
letorig/video-generator-client
聚合生数、快手、MiniMax、Wan等视频API的异步客户端登上GitHub热榜(⭐ 535)。
API调用封装Wrapper,不涉及训练与底层优化。
-
JOKER141/BUNNY_H3_Conditioning_Bridge
BUNNY_H3_Conditioning_Bridge 登上 HF 文生视频热榜(likes 22)。
社区小众条件桥接权重,热度较低,暂无深入价值。
-
vpakarinen/natural-face-speech-h3-lora
人脸语音驱动 LoRA 登上 HF 文生视频热榜(likes 27)。
社区个性化小 LoRA,对通用系统优化及模型结构无参考意义。
-
Cripacx/mediagen
mediagen 开源,为 Claude Code 等 Agent 提供图文视频生成 MCP 服务端与 CLI。
上层多模态 API 聚合工具,与底层性能优化无关,可跳过。
2026 年 9 月 16 日 · 周三
-
全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
智象未来发布首个原生全模态、物理规律导向的视频生成模型HiDream-O1-Video-1.0。
视频生成模型的重要进展,直接契合你对视频生成和物理规律建模的关注。
-
LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
提出基于 32B 多模态扩散 Transformer 的原生视频生成框架 LynnReal-Omni。
涉及大规模视频生成与扩散 Transformer,高度契合关注点。
2026 年 9 月 14 日 · 周一
-
新一代全模态视频生成模型“MiniMax H3”在赣江新区首发 - 凤凰网江西
MiniMax 在赣江新区首发新一代全模态视频生成模型“MiniMax H3”。
视频生成模型的新发布,直接契合你对视频生成方向的关注。
-
Recreating a 70-year love story frame by frame
Google AI 博客展示了通过逐帧渲染重现 70 年爱情故事的视频生成案例。
涉及视频生成应用,可了解大厂在视频生成领域的最新视觉效果。