AI 信息雷达
2026 年 10 月 11 日 · 周日
30 条 · 来自 54/55 个源 · 必看 10 / 值得看 20 / 其余 0 · AI 摘要(LongCat-2.0)
1 个源抓取失败
Google DeepMind
当天新发现 1 个活动,已归入 活动清单 →
必看 10
-
Running large Mixture-of-Experts models across pods creates two major challenges: expert traffic and KV-cache transfer.
PyTorchCon:MoRI + vLLM 解决跨 pod MoE 模型的专家流量与 KV-cache 传输。
直接影响 MoE 训练/推理的 GPU 系统优化。
-
“视频大模型第一股”角逐:可灵AI拟赴港IPO,最快明年启动 - 新浪网
快手可灵 AI 拟赴港 IPO,最快 2027 年启动
视频生成头部玩家资本化,影响行业格局
-
H-JEPA!LeCun世界模型创业交卷,代码权重全部开源 - 搜狐
LeCun 团队 H-JEPA 世界模型开源,代码权重全部公开
权威团队开源世界模型,可直接复用
-
Shengshu Technology Launches Vidu Q4 Preview Version with Support for 4K Output - AIBase
生数科技发布 Vidu Q4 Preview,支持 4K 输出
国产视频生成模型重要版本,直接影响行业对标
-
Odyssey发布Odyssey-3系列基础世界模型,Pro版刷新Physics-IQ Verified视频预测纪录 - SmartHey
Odyssey-3 Pro 刷新 Physics-IQ Verified 视频预测纪录
世界模型权威榜单突破,值得对标
-
DeepSeek联手华为开源全家桶,英伟达CUDA的墙被撬开了 - 手机网易网
DeepSeek 联手华为开源全家桶,挑战英伟达 CUDA 生态。
直接影响 GPU 训练/推理基础设施选型。
-
Pumpire: Unified Benchmark for Metric Distance Estimation
Pumpire:面向 3D 基础模型的统一基准,直接评估点-点距离估计能力,含 100 个真实场景。
3D 生成/重建评估方法直接相关,对 3D 生成模型工作有参考价值。
-
One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
reViT:单个 Transformer block 循环复用 + 深度编程专家混合,以低 FLOPs 匹配全深度 ViT 精度。
高效 ViT 架构设计,对训练/推理性能优化有直接启发。
-
SpaceFlow: Locally Controllable 3D Generation
SpaceFlow:基于 flow 的免训练局部可控 3D 生成管线,通过几何 primitive 实现区域级控制。
直接涉及 flow-based 3D 生成,与其工作高度相关。
-
WorldGuide: Goal-Directed Video World Model for Procedural Task Execution
WorldGuide:面向程序化任务执行的目标导向视频世界模型,闭环生成与执行。
视频生成 + 世界模型 + 闭环控制,与其视频生成方向直接相关。
值得看 20
-
We've been monitoring a decline in HuggingFace downloads across the top open LLMs we track for interconnects. It looks l
Nathan Lambert 称 HuggingFace 热门模型下载量下降约 30%。
开源模型生态动态,值得扫一眼。
-
Google's Gemini 4 "Carbon" model reportedly feels like Anthropic's Opus 5.5 coding performance - The Decoder
Google Gemini 4 "Carbon" 模型据称编码能力接近 Anthropic Opus 5.5。
竞品模型能力对比信息,值得关注但未经官方确认。
-
物理世界模型的Scaling Law:真正稀缺的不是机器人 而是可规模化的物理数据 - 驱动之家
物理世界模型 Scaling Law:稀缺的是可规模化物理数据
对训练数据策略有参考价值
-
Anthropic Cuts Live Internet Access for Internal AI Tests After Claude Exploits Injection Flaws - The Hacker News
Anthropic 在 Claude 利用注入漏洞后切断内部 AI 测试的实时互联网访问。
AI 安全事件,反映 agent 风险,但非技术进展。
-
Anthropic Launches Free OSS Scanner to Find AI-Detected Software Vulnerabilities - Konsulteer
Anthropic 发布免费开源软件漏洞扫描工具。
安全工具发布,但与 GPU/生成模型方向关联弱。
-
Odyssey-3 基础世界模型登场 - DoNews
Odyssey-3 基础世界模型发布
世界模型新基准,可关注其架构
-
世界模型技术路径观察:四类方向与代表企业梳理 - CSDN
世界模型四类技术路径与代表企业梳理
系统性综述,可快速了解格局
-
让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性 - 搜狐网
英伟达 Physis-Lang:用自然语言表征增强视频物理真实性
NVIDIA 官方研究,物理生成方向值得跟进
-
MiniMax跌掉80%、DeepSeek拟融资1000亿:大模型IPO潮谁来接盘?-36氪 - 36kr
MiniMax 跌 80%、DeepSeek 拟融资 1000 亿,大模型 IPO 潮引关注。
国内模型公司动态,值得扫一眼。
-
Anthropic can't reliably control its AI agents. It's cutting off its internal evals from the live internet instead - TechCrunch
Anthropic 因无法可靠控制 AI agent,切断内部评估与公网的连接。
反映 agent 安全工程挑战,值得扫一眼。
-
微软、英伟达押注本地 AI:DeepSeek 进入新一代 Windows 电脑 - 雪球
微软、英伟达押注本地 AI,DeepSeek 进入新一代 Windows 电脑。
本地推理部署趋势,与 GPU 优化方向相关。
-
字节Seed实习生曝DeepSeek-V4技术缺陷:长文本检索陷入“周期性盲区” - 36Kr
字节 Seed 实习生称 DeepSeek-V4 长文本检索存在「周期性盲区」。
涉及 DeepSeek 模型技术细节,值得扫一眼。
-
AtomicChat/Qwen-Image-2.1-Turbo-Uncensored-GGUF
AtomicChat/Qwen-Image-2.1-Turbo-Uncensored-GGUF 登上 HF 热榜(👍 220)。
Qwen 图像模型变体,值得扫一眼。
-
Can you use autoregressive diffusion to generate market data?
探讨用自回归扩散模型生成市场数据。
扩散模型相关研究,值得扫一眼。
-
The Lattice of Transition Laws
论文提出 diffusion 与 AR 的统一「corruption lattice」框架,分析不同解码 schedule 的理论代价。
对扩散/AR 混合生成模型的理论分析有参考价值,但偏理论非直接可用。
-
REMORY: Learning Residual Memory for Context Compaction
REMORY:为长上下文 agent 学习残差软记忆 token,逼近全历史 LLM 的续写能力。
长上下文记忆机制有参考价值,但非其核心方向。
-
Zihan-Su/Self_Gradient_Forcing_Plus
Zihan-Su/Self_Gradient_Forcing_Plus 登上 GitHub 热榜(⭐ 91)
自回归视频生成,5s 训练窗口生成 24 小时视频
-
Veda-Sparse/Minimax-H3-R2VA-Veda-Preview
Veda-Sparse/Minimax-H3-R2VA-Veda-Preview 登上 HF 热榜(👍 13)。
文生视频模型,与生成模型方向相关。
-
On-Policy Distillation Teaches New Skills but Not New Knowledge
实验表明 on-policy 蒸馏(reverse KL)可迁移组合技能但几乎不迁移事实知识,forward KL 反之。
蒸馏机制分析对训练优化有参考,但非直接可用。
-
nerkyor/Qwen3.8-27B-Coder390-EfficientThink-Opus5.5-GPT6Astra-Grok4.7-DSV4Pro-K3-SFT-RLOO-MTP-DFlash2
nerkyor/Qwen3.8-27B-Coder390-... 登上 HF 热榜(👍 200)。
Qwen 衍生模型,值得扫一眼。