Radar
AI 信息雷达
每天早上 8 点自动抓取模型公司、研究者博客、arXiv 和性能工程相关信息源,去重后按「必看 / 值得看 / 其余」排列。 摘要只用于快速筛选,请以原文为准。
2026 年 10 月 11 日 · 周日
永久链接 →30 条 · 来自 54/55 个源 · 必看 10 / 值得看 20 / 其余 0 · AI 摘要(LongCat-2.0)
1 个源抓取失败
Google DeepMind
当天新发现 1 个活动,已归入 活动清单 →
必看 10
-
Running large Mixture-of-Experts models across pods creates two major challenges: expert traffic and KV-cache transfer.
PyTorchCon:MoRI + vLLM 解决跨 pod MoE 模型的专家流量与 KV-cache 传输。
直接影响 MoE 训练/推理的 GPU 系统优化。
-
“视频大模型第一股”角逐:可灵AI拟赴港IPO,最快明年启动 - 新浪网
快手可灵 AI 拟赴港 IPO,最快 2027 年启动
视频生成头部玩家资本化,影响行业格局
-
H-JEPA!LeCun世界模型创业交卷,代码权重全部开源 - 搜狐
LeCun 团队 H-JEPA 世界模型开源,代码权重全部公开
权威团队开源世界模型,可直接复用
-
Shengshu Technology Launches Vidu Q4 Preview Version with Support for 4K Output - AIBase
生数科技发布 Vidu Q4 Preview,支持 4K 输出
国产视频生成模型重要版本,直接影响行业对标
-
Odyssey发布Odyssey-3系列基础世界模型,Pro版刷新Physics-IQ Verified视频预测纪录 - SmartHey
Odyssey-3 Pro 刷新 Physics-IQ Verified 视频预测纪录
世界模型权威榜单突破,值得对标
-
DeepSeek联手华为开源全家桶,英伟达CUDA的墙被撬开了 - 手机网易网
DeepSeek 联手华为开源全家桶,挑战英伟达 CUDA 生态。
直接影响 GPU 训练/推理基础设施选型。
-
Pumpire: Unified Benchmark for Metric Distance Estimation
Pumpire:面向 3D 基础模型的统一基准,直接评估点-点距离估计能力,含 100 个真实场景。
3D 生成/重建评估方法直接相关,对 3D 生成模型工作有参考价值。
-
One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
reViT:单个 Transformer block 循环复用 + 深度编程专家混合,以低 FLOPs 匹配全深度 ViT 精度。
高效 ViT 架构设计,对训练/推理性能优化有直接启发。
-
SpaceFlow: Locally Controllable 3D Generation
SpaceFlow:基于 flow 的免训练局部可控 3D 生成管线,通过几何 primitive 实现区域级控制。
直接涉及 flow-based 3D 生成,与其工作高度相关。
-
WorldGuide: Goal-Directed Video World Model for Procedural Task Execution
WorldGuide:面向程序化任务执行的目标导向视频世界模型,闭环生成与执行。
视频生成 + 世界模型 + 闭环控制,与其视频生成方向直接相关。
值得看 20
-
We've been monitoring a decline in HuggingFace downloads across the top open LLMs we track for interconnects. It looks l
Nathan Lambert 称 HuggingFace 热门模型下载量下降约 30%。
开源模型生态动态,值得扫一眼。
-
Google's Gemini 4 "Carbon" model reportedly feels like Anthropic's Opus 5.5 coding performance - The Decoder
Google Gemini 4 "Carbon" 模型据称编码能力接近 Anthropic Opus 5.5。
竞品模型能力对比信息,值得关注但未经官方确认。
-
物理世界模型的Scaling Law:真正稀缺的不是机器人 而是可规模化的物理数据 - 驱动之家
物理世界模型 Scaling Law:稀缺的是可规模化物理数据
对训练数据策略有参考价值
-
Anthropic Cuts Live Internet Access for Internal AI Tests After Claude Exploits Injection Flaws - The Hacker News
Anthropic 在 Claude 利用注入漏洞后切断内部 AI 测试的实时互联网访问。
AI 安全事件,反映 agent 风险,但非技术进展。
-
Anthropic Launches Free OSS Scanner to Find AI-Detected Software Vulnerabilities - Konsulteer
Anthropic 发布免费开源软件漏洞扫描工具。
安全工具发布,但与 GPU/生成模型方向关联弱。
-
Odyssey-3 基础世界模型登场 - DoNews
Odyssey-3 基础世界模型发布
世界模型新基准,可关注其架构
-
世界模型技术路径观察:四类方向与代表企业梳理 - CSDN
世界模型四类技术路径与代表企业梳理
系统性综述,可快速了解格局
-
让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性 - 搜狐网
英伟达 Physis-Lang:用自然语言表征增强视频物理真实性
NVIDIA 官方研究,物理生成方向值得跟进
-
MiniMax跌掉80%、DeepSeek拟融资1000亿:大模型IPO潮谁来接盘?-36氪 - 36kr
MiniMax 跌 80%、DeepSeek 拟融资 1000 亿,大模型 IPO 潮引关注。
国内模型公司动态,值得扫一眼。
-
Anthropic can't reliably control its AI agents. It's cutting off its internal evals from the live internet instead - TechCrunch
Anthropic 因无法可靠控制 AI agent,切断内部评估与公网的连接。
反映 agent 安全工程挑战,值得扫一眼。
-
微软、英伟达押注本地 AI:DeepSeek 进入新一代 Windows 电脑 - 雪球
微软、英伟达押注本地 AI,DeepSeek 进入新一代 Windows 电脑。
本地推理部署趋势,与 GPU 优化方向相关。
-
字节Seed实习生曝DeepSeek-V4技术缺陷:长文本检索陷入“周期性盲区” - 36Kr
字节 Seed 实习生称 DeepSeek-V4 长文本检索存在「周期性盲区」。
涉及 DeepSeek 模型技术细节,值得扫一眼。
-
AtomicChat/Qwen-Image-2.1-Turbo-Uncensored-GGUF
AtomicChat/Qwen-Image-2.1-Turbo-Uncensored-GGUF 登上 HF 热榜(👍 220)。
Qwen 图像模型变体,值得扫一眼。
-
Can you use autoregressive diffusion to generate market data?
探讨用自回归扩散模型生成市场数据。
扩散模型相关研究,值得扫一眼。
-
The Lattice of Transition Laws
论文提出 diffusion 与 AR 的统一「corruption lattice」框架,分析不同解码 schedule 的理论代价。
对扩散/AR 混合生成模型的理论分析有参考价值,但偏理论非直接可用。
-
REMORY: Learning Residual Memory for Context Compaction
REMORY:为长上下文 agent 学习残差软记忆 token,逼近全历史 LLM 的续写能力。
长上下文记忆机制有参考价值,但非其核心方向。
-
Zihan-Su/Self_Gradient_Forcing_Plus
Zihan-Su/Self_Gradient_Forcing_Plus 登上 GitHub 热榜(⭐ 91)
自回归视频生成,5s 训练窗口生成 24 小时视频
-
Veda-Sparse/Minimax-H3-R2VA-Veda-Preview
Veda-Sparse/Minimax-H3-R2VA-Veda-Preview 登上 HF 热榜(👍 13)。
文生视频模型,与生成模型方向相关。
-
On-Policy Distillation Teaches New Skills but Not New Knowledge
实验表明 on-policy 蒸馏(reverse KL)可迁移组合技能但几乎不迁移事实知识,forward KL 反之。
蒸馏机制分析对训练优化有参考,但非直接可用。
-
nerkyor/Qwen3.8-27B-Coder390-EfficientThink-Opus5.5-GPT6Astra-Grok4.7-DSV4Pro-K3-SFT-RLOO-MTP-DFlash2
nerkyor/Qwen3.8-27B-Coder390-... 登上 HF 热榜(👍 200)。
Qwen 衍生模型,值得扫一眼。
往期
2026-10-10 · 必看 10 / 值得看 20 / 其余 0
生数科技发布视频生成模型Vidu Q4 Preview预览版本 - 凤凰网科技;@ 一下就能派活?谷歌推出办公 Agent,拥有独立账号、能够创建子 Agent,还能调用 Claude
2026-10-09 · 必看 10 / 值得看 20 / 其余 0
不等Gemini 4了!谷歌发布办公Agent,支持调用Claude;NVIDIA recsys-examples now provides an end-to-end HSTU inference workflow with Dynamo-Triton. PyTorch AOTI compiles HSTU
2026-10-08 · 必看 10 / 值得看 20 / 其余 0
Anthropic Releases Claude Haiku 5.5: A Small Model With 1M Context Priced at $0.10 per Million Input Tokens - MarkTechPost;Shengshu Technology Launches Vidu Q4 Preview, A Next-Generation AI Video Model Built for Lifelike Performances - GlobeNewswire
2026-10-07 · 必看 10 / 值得看 20 / 其余 0
Replacing CUDA with FBTriton for Table Batched Embedding (TBE) kernels delivered massive gains for our rec sys models. M;Modernizing Table Batched Embeddings with FBTriton
2026-10-06 · 必看 10 / 值得看 20 / 其余 0
Dust: Pretraining Transformers Without Backpropagation;Over the last two years, Meta has consolidated PyTorch's media stack across three libraries: TorchCodec, TorchVision, an
2026-10-05 · 必看 6 / 值得看 20 / 其余 0
AMD收购 World Labs,82 亿抢世界模型,物理 AI 新战局 - 搜狐网;Anthropic Eyes Mid-November IPO, Aims to Launch Before U.S. Thanksgiving Holiday - CoinCodex
2026-10-04 · 必看 5 / 值得看 13 / 其余 0
李飞飞被买下?82亿美元砸向世界模型,AMD在英伟达后院点一把火 - 凤凰网科技;AMD 550亿元买下 World Labs,小派科技翁志斌:3D世界的算力时代正在到来 - 搜狐网
2026-10-03 · 必看 10 / 值得看 20 / 其余 0
Building a High-Performance and Portable vLLM Linear Backend with Helion;A model guide for the GPT-6 family
2026-10-02 · 必看 10 / 值得看 20 / 其余 0
v0.5.21;PyTorch’s latest blog covers Jagged Flash Attention on NVIDIA B200 with TLX. On GEM’s jagged shapes, the TLX kernel is a
2026-10-01 · 必看 10 / 值得看 20 / 其余 0
V4全系列模型上线后,DeepSeek Harness开发者预览版开放测试 - 财联社;DeepSeek和华为发布TileLang支持昇腾芯片,挑战CUDA - Pasquale Pillitteri
2026-09-30 · 必看 10 / 值得看 20 / 其余 0
All PyTorch Conference China 2026 sessions are now available on YouTube. Watch the September 8–9 program from Shanghai,;T早报|OpenAI推出个人智能体Dots及新模型GPT‑6.1 Sol;SHEIN公布上市后首份财报;美国芯片公司AMD斥资82亿美元收购李飞飞世界模型公司 - 财新
2026-09-29 · 必看 10 / 值得看 20 / 其余 0
加速“进化” 快手可灵发布Kling4.0 支持单次生成视频最长可达30秒 - 东方财富;AMD acquires world model developer World Labs for $8.2B - SiliconANGLE
2026-09-28 · 必看 10 / 值得看 20 / 其余 0
索辰科技加码世界模型前沿技术 与美梦空间联合发布具身模型与物理测评标准 - 证券之星;MiniMax最新模型M3.1-Flash-Preview上线 - 搜狐网
2026-09-27 · 必看 5 / 值得看 15 / 其余 0
Google Just Made Free 1080p AI Video Generation Available to Anyone - Decrypt;谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架 - 手机新浪网
2026-09-26 · 必看 10 / 值得看 20 / 其余 0
音视频生成提速54倍!TurboT2VA:分布蒸馏与轨迹蒸馏的联合蒸馏方案 - 智源社区;OpenAI, Google and Anthropic to launch AI safety organisation by early 2027: Report - CNBC TV18
2026-09-25 · 必看 10 / 值得看 20 / 其余 0
Runway’s WorldPrompt and the Engineering of Real-Time Worlds;Anthropic launches Claude Opus 5.5 with lower costs - IT Brief Asia
2026-09-24 · 必看 10 / 值得看 20 / 其余 0
谷歌(GOOGL.US)Vids免费AI视频生成扩容:套餐订阅用户享高级功能与更高限额提供者智通财经 - 英为财情 Investing.com;DeepSeek拟采用Huawei芯片训练大模型 规划推出8万亿参数模型 - digitaltoday.co.kr
2026-09-23 · 必看 10 / 值得看 20 / 其余 0
The Biological Computing Partners With AWS To Launch AI Video Model With 5x Faster Generation And 80% Lower Costs - Pulse 2.0;Better prompt caching for GPT-6
2026-09-22 · 必看 10 / 值得看 20 / 其余 0
浪潮信息发布元脑SD200 Ultra:单机承载2.8万亿参数Kimi K3 - 凤凰网科技;v0.30.0
2026-09-21 · 必看 3 / 值得看 8 / 其余 0
阶跃星辰发布Step 5 Preview,面向真实世界Agentic 任务的旗舰基座模型- OSCHINA - 开源 × AI · 开发者生态社区 - OSCHINA;Aether AI发布首个因果世界模型,世界模型开始思考“行动背后的因果”|甲子光年 - Sohu
2026-09-20 · 必看 5 / 值得看 20 / 其余 0
600B模型,只激活27B,阶跃在赌大模型的未来吗? - 新浪财经;阶跃星辰发布旗舰基座模型Step 5 Preview|AI代码生成|软件工程|财讯|新一代|编程_手机新浪网 - 新浪财经
2026-09-19 · 必看 24 / 值得看 53 / 其余 136
从算子调优到推理自治:构建 MaaS 场景下的 AI Inference 自动优化闭环|QCon上海;高德联合南大、清华、北大发布WorldRoamBench,定义交互式世界模型长时漫游评测新范式 - 新浪网
2026-09-18 · 必看 9 / 值得看 12 / 其余 20
Anthropic Launches Claude Code Projects in Beta: Parallel Cloud Sessions That Keep Running After You Close Your Laptop - MarkTechPost;v0.30.0rc1: [Bugfix] Isolate supplemental FlashInfer BF16 autotuning (#57285)
2026-09-17 · 必看 10 / 值得看 16 / 其余 77
TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor;Open Research, Tooling & Optimization at PyTorch Conference North America 2026
2026-09-16 · 必看 14 / 值得看 14 / 其余 37
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera Rubin;Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
2026-09-15 · 必看 5 / 值得看 8 / 其余 27
v12.9.8: Prepare cuda-bindings 12.9.8 release (#2814);Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine
2026-09-14 · 必看 20 / 值得看 39 / 其余 107
中国AI大模型调用量连续二十周领跑:DeepSeek V4.1 Flash上线三天升至第六,智谱GLM 5.3、MiniMax M3跌出榜单 - 新浪财经;中国AI大模型调用量连续二十周领跑:DeepSeek V4.1 Flash上线三天升至第六,智谱GLM 5.3、MiniMax M3跌出榜单 - 每日经济新闻