AI 信息雷达
2026 年 10 月 2 日 · 周五
30 条 · 来自 55/55 个源 · 必看 10 / 值得看 20 / 其余 0 · AI 摘要(LongCat-2.0)
当天新发现 6 个活动,已归入 活动清单 →
必看 10
-
v0.5.21
SGLang 发布 v0.5.21,新增 DeepSeek-V4.1、Qwen-Image 2.1、FLUX 3 Action 等模型支持及 PD 实例动态切换。
推理框架重大更新,直接支持多个扩散/生成模型。
-
PyTorch’s latest blog covers Jagged Flash Attention on NVIDIA B200 with TLX. On GEM’s jagged shapes, the TLX kernel is a
PyTorch 博客:B200 上 Jagged Flash Attention 用 TLX,前向快 13%、反向快 50%。
直接涉及 GPU attention kernel 优化,与工作高度相关。
-
Optimizing Jagged Flash Attention with TLX: The Road Toward SOTA FA4 on Blackwell
PyTorch 博客:在 NVIDIA Blackwell B200 上用 TLX 优化 Jagged Flash Attention,迈向 SOTA FA4。
直接涉及 GPU attention kernel 优化,与工作高度相关。
-
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
Hugging Face 发布 OLMo-core 3,面向大规模 MoE 的开源可扩展训练基础设施。
直接影响 MoE 训练效率,与 GPU 训练优化高度相关。
-
Google announces Argon, the Gemini 4 flagship AI model after months of delays - Emirates 24|7
Google 发布 Gemini 4 旗舰模型 Argon。
重要基础模型发布,可能影响训练/推理生态。
-
LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation
arXiv论文:LongTake,长视频生成的两阶段训练管线。
直接解决长视频扩散生成质量问题。
-
No Corners Cut: State-Grounded Transitions for Mid-Stream Prompt Switches in Video Generation
arXiv论文:SEGUE,流式视频生成中提示切换的状态忠实过渡。
解决流式生成中prompt切换的关键问题。
-
PARK: Accurate Block Retrieval for Sparse Attention in Video Diffusion Transformers
arXiv论文:PARK,视频DiT稀疏注意力的精确块检索。
直接优化DiT视频生成的注意力计算效率。
-
DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency
arXiv论文:DeCoPrune,自回归视频扩散的KV Cache剪枝。
直接优化自回归视频生成的推理效率。
-
Uncertainty-Aware Consistency Distillation for Few-Step Video Generation
arXiv论文:不确定性感知一致性蒸馏用于少步视频生成。
提升视频蒸馏质量,直接影响推理速度。
值得看 20
-
Utopai Studios Launches PAI Production Platform and Utopai X Video Model - awn.com
Utopai Studios 发布 PAI 制作平台和 Utopai X 视频模型。
新视频生成模型发布,但非知名机构,热度待观察。
-
AMD以82亿美元收购世界模型开发商World Labs - 搜狐网
AMD以82亿美元收购世界模型开发商World Labs。
重大行业收购,影响AI生态格局。
-
Context Language Models
Hacker News 讨论 Context Language Models。
可能涉及长上下文模型技术,值得扫一眼。
-
Broadcom’s $42 billion deal with Anthropic: Key details to know - The News International
Broadcom 与 Anthropic 签署 420 亿美元芯片租赁协议。
涉及 AI 芯片基础设施格局变化,影响算力供给。
-
首次!中国大模型进入OpenAI企业“采购单” - 手机新浪网
中国大模型首次进入 OpenAI 企业采购单。
行业格局变化信号,但无具体技术细节。
-
v0.31.0rc3: [Model Runner V2] Support randomized dummy inputs (#58411)
vLLM 发布 v0.31.0rc3,Model Runner V2 支持随机虚拟输入。
推理框架更新,对部署扩散/生成模型有参考价值。
-
AIsphere Launches PixVerse R2, a Real-Time World Model That Remembers What Happens in a Session - pandaily.com
AIsphere发布PixVerse R2实时世界模型,可记忆会话内容。
新模型发布,但非知名机构,影响有限。
-
Audible World Models: Spatially Aware Sound Generation for 3D Worlds
arXiv论文:Audible World Models,3D世界声音生成框架。
3D世界生成相关,但偏音频非核心方向。
-
FrameMorrow: Future-guided Frame Selection with Prospective Tokens for Long-Horizon Video Generation
arXiv论文:FrameMorrow,面向未来的帧选择用于长视频生成。
长视频生成历史选择策略,有一定参考价值。
-
MindWorldBench: Evaluating Mental-State-to-Behavior Reasoning in Image-to-Video Generation
arXiv论文:MindWorldBench,心理状态到行为的视频生成评测。
新评测基准,偏认知推理非核心方向。
-
VR-JEPA: Learning Contrastive-State Latent Guidance for Generation-based Video Reasoning
arXiv论文:VR-JEPA,对比态潜在引导的视频推理生成。
视频推理生成,偏推理非核心优化方向。
-
LOCI: Spatial Linear Memory for Streaming World Models
LOCI 提出混合空间记忆架构,在视频世界模型中同时保留 KV cache 与循环记忆。
视频生成/世界模型方向,对长视频生成有参考价值。
-
GLARE: Generating Listening Heads with Appropriate Reactions
GLARE 研究生成对话中听众自然反应,构建约 147 小时 speaker-listener 配对数据集。
视频生成下游应用,但与核心方向关联较弱。
-
ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
ViTeX-Bench 提出视频场景文本编辑基准,关注时序一致性与局部编辑保真度。
视频编辑评测,与扩散/生成方向相关但非核心。
-
Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
Physis-Lang 用自演化物理语言作为视频世界模型的共享可优化表示。
视频世界模型新思路,与生成模型方向相关。
-
World-as-Graph: Relational World Modeling Through Latent Space Graphs
World-as-Graph 提出基于图的物体中心世界模型,引入关系归纳偏置。
世界模型架构研究,与视频生成方向相关。
-
The Planning Limits of Latent World Models
研究潜空间世界模型在机器人规划中的失效边界,基于五种自监督视觉骨干。
世界模型理论分析,与核心工程方向关联较弱。
-
MotionWeave: Learning Motion-Centered Future Dynamics for Vision-Language-Action Policies
MotionWeave 提出运动中心的未来动态框架,用于 VLA 策略的 action-chunk 预测。
视频-动作建模研究,与生成方向关联有限。
-
PISCO: Precise Video Instance Insertion with Sparse Control
PISCO 研究视频中精确实例插入,保持场景完整性与物理一致性。
视频生成精细控制,与扩散模型应用相关。
-
Language-Conditioned World Modeling for Visual Navigation
研究语言条件视觉导航,发布含 39,016 条轨迹的 LCVN 数据集。
具身导航方向,与核心生成方向关联较弱。