更新于 2026-10-08T07:37:23+00:00 · 实际模型:LongCat-2.0(4 个仓库的 24 个阶段降级到 gemini-3.1-pro-preview)
6 个候选任务
SGLang(sgl-project/sglang,LMSYS 非营利组织托管)是高性能大模型与多模态模型推理服务框架,2024 年初以 RadixAttention 前缀缓存起家,README 自称支撑全球 40 万+ GPU、日产数万亿 token,被 xAI、NVIDIA、AMD、Cursor 及各大云厂采用,2025/03 加入 PyTorch 生态…
experimental/sgl-router 路由策略与可观察性方向
★ 36502 · 最近推送 2026-09-28
- 补全 sgl-router cache_aware / load_based 策略单元测试与边界用例
- 补全 SamplingParams 上界校验(top_k / logprobs / n)
- 修复 DisallowedTokensLogitsProcessor 跨请求 batch 语义
查看任务卡与实施方案 →
3 个候选任务
SGLang-Omni 是 sgl-project 下的多阶段(multi-stage)推理服务运行时,专门面向 omni 模型、语音 / TTS 模型以及统一多模态模型。它把一次生成拆成多个异构阶段——预处理、编码器、自回归引擎、talker、解码器、vocoder、聚合器——分别匹配不同的调度器与传输后端,对外暴露 OpenAI 兼容的 `/v1/aud…
Apple Silicon / MLX 后端负责人(sglang_omni_mlx/ + models/*/mlx/ + Apple Silicon 测试与基准)
★ 1323 · 最近推送 2026-10-08
- [Apple Silicon] 为 Fun-ASR TorchMPS runner 补 request builder 单元测试
- [Apple Silicon] 新增 Apple Silicon runtime_metrics 基准脚本(Qwen3-ASR MLX)
- [RFC] Full-Duplex Recoverable Unit Failures 中「Unit 生命周期状态机」子项
查看任务卡与实施方案 →
4 个候选任务
vLLM 是目前最活跃的开源 LLM 推理与服务引擎之一,起源于 UC Berkeley Sky Computing Lab,由 2000+ 贡献者维护。它围绕 PagedAttention 这一核心内存管理技术构建,解决大语言模型推理中 KV cache 内存浪费与吞吐瓶颈问题,同时提供 continuous batching、chunked prefil…
csrc/cpu/ + benchmarks/kernels/cpu/ + tests/kernels/ 的 CPU 回归测试,长期负责 vLLM CPU 后端的 kernel 优
★ 93192 · 最近推送 2026-10-05
- [CPU] 为 csrc/cpu/ 添加 batch-invariant greedy/top-k/top-p 采样内核
- [CPU] 为 cpu_fused_moe 与 mamba_cpu 添加微基准
- [Tests] 添加 CPU vs CUDA int8 quant / layernorm 精度对照测试
查看任务卡与实施方案 →
5 个候选任务
FlashInfer 是一个面向 LLM serving 的高性能 GPU 内核库与内核生成器,核心卖点是在 attention、GEMM、MoE、采样、通信等推理热点路径上提供统一 API,并在 FlashAttention-2/3、cuDNN、CUTLASS、TensorRT-LLM 等多个后端之间按硬件与负载自动选择最优实现。项目采用 JIT 编译为默…
flashinfer/experimental/ 的 Python 层(含 experimental API 的契约测试、backend 选择逻辑、错误路径、docstring、t
★ 6546 · 最近推送 2026-10-05
- test(cli): 为 flashinfer collect-env / show-config / list-modules 补单元测试
- docs(diffusion_ops): 补全 docstring、类型标注与最小可运行示例
- docs(experimental): 新增 experimental backend 开发 tutorial
查看任务卡与实施方案 →
5 个候选任务
FlashAttention 是 Dao-AILab 维护的精确注意力(exact attention)加速库,核心卖点是 IO-aware 的 tiling 实现:在 HBM 与 SRAM 之间按 tile 搬运与计算,把标准 Attention 的 HBM 读写压到理论下界,从而在不牺牲数值精度的前提下显著提速并省显存。仓库目前同时承载多代产品:FA2 …
FA4 Python 层(flash_attn/cute/)的测试基础设施、调度器单元测试、以及 SM100/SM110 新特性的文档与 benchmark 基线
★ 25088 · 最近推送 2026-10-04
- 为 FlashPrepareScheduler / SchedulerState / tile_scheduler 添加 FakeTensorMode 单元测试
- 为 flash_attn.cute.interface 添加输入校验与错误提示测试
- 为 splitkv early-exit LSE 问题(#2842)添加回归测试与文档
查看任务卡与实施方案 →
6 个候选任务
TileLang (tile-lang) 是一个基于 Python 的领域特定语言(DSL),构建在 Apache TVM 编译器基础设施(TIRX)之上,专为简化高性能 GPU/CPU/加速器内核(如 GEMM、FlashAttention)的开发而设计。它的核心定位是让开发者能够使用 Pythonic 的语法进行 Tile 级别的编程,同时保留底层硬件优…
Metal 后端核心维护者 (Metal Backend Maintainer) & 布局推导架构师 (Layout Inference Architect)
★ 7446 · 最近推送 2026-09-21
- [BUG][Fuzzer][ice-on-valid-code]
T.import_source prelude with no trailing newline fuses with the next #include, so nvcc rejects the CUDA instead of compiling - [BUG][Fuzzer][wrong-code] CuTeDSL codegen emits Python floor
// for integer truncdiv (DivNode), giving wrong results for negative operands - [BUG][Fuzzer][accepts-invalid] Region ops (
T.fill/T.clear/T.copy) accept a sliced region whose min+extent exceeds the buffer, silently emitting an out-of-bounds write
查看任务卡与实施方案 →
6 个候选任务
🤗 Diffusers 是 Hugging Face 维护的 PyTorch 扩散模型推理与训练库,定位为 image / video / audio / 3D 分子生成的「模块化工具箱」。README 明确把哲学写在最前面:usability over performance、simple over easy、customizability over ab…
src/diffusers/schedulers/ + tests/schedulers/ + benchmarks/ + examples/profiling/ 构成的「调度与性
★ 34653 · 最近推送 2026-10-05
- 修复 UniPCMultistepScheduler 在 sigma=0 末步返回 NaN/inf 问题(solver_type=bh1、lower_order_final=False、predict_x0=False)
- 修复 UniPCMultistepScheduler 在 float64 默认 dtype 下 torch.linalg.solve 的 dtype 不匹配崩溃
- 修复 DPMSolver 与 UniPC 在 final_sigmas_type=sigma_min + 转换 sigma 时末步 h=0 返回 NaN
查看任务卡与实施方案 →
5 个候选任务
FastVideo 是一个面向视频生成大模型(如 Wan2.1/2.2, MiniMax-H3 等 DiT 架构)的端到端统一推理与后训练(Post-training)加速框架。它的核心价值在于打破了“训练”与“推理”的壁垒,通过算法层(DMD2 蒸馏、Video Sparse Attention 稀疏注意力、Self-Forcing 因果蒸馏)与系统层(定…
fastvideo/mlx_runtime (Apple Silicon 推理后端) 与 fastvideo/distributed (分布式调度逻辑)
★ 4486 · 最近推送 2026-09-21
- [perf] Reuse cached VAE offload for H3 reference and keyframe encoding
- [Bug] MPS generation fails when multiprocessing worker returns output tensors
- [Feature] Implement batching support for inference (Roadmap Q3)
查看任务卡与实施方案 →
5 个候选任务
TurboDiffusion 是清华大学机器学习组(THU-ML)开源的端到端视频扩散模型(DiT)推理加速框架。其核心目标是通过算法与系统协同设计,在单张消费级或数据中心 GPU 上实现 100-200 倍的生成加速,同时保持视频质量。项目目前处于早期快速迭代阶段(README 明确指出“checkpoints and paper are not fina…
分布式训练调度 (FSDP) 与硬件无关推理管线 (Hardware-Agnostic Inference)
★ 3762 · 最近推送 2026-08-27
- 修复 setup.py 编译参数,支持 Turing/Ampere 等旧架构
- 修复使用 original attention 时加载权重的 Unexpected key 错误
- 调查并修复 14B 480p 模型 local_attn 权重为 0 的问题
查看任务卡与实施方案 →
6 个候选任务
DiffSynth-Engine 是 ModelScope(阿里达摩院 MuseAI)团队维护的高性能扩散模型推理引擎,核心目标是为 DiT 类图像/视频生成模型(Flux、Wan、Qwen-Image、Z-Image 等)提供一套自研、可控、可裁剪的推理管线,减少对 diffusers/k-diffusion 等外部库的依赖。README 明确指出它“ca…
diffsynth_engine/algorithm/ + tests/test_algorithm/ + 跨平台(CPU/MPS/CUDA)attention 后端兼容性层
★ 433 · 最近推送 2026-09-03
- test: 为 flow_match/stable_diffusion scheduler 添加 CPU 回归测试
- test: 为 DPM-Solver++/DEIS sampler 添加 CPU 单元测试
- test: 添加 attention 后端 CPU/MPS/CUDA 兼容性矩阵脚本
查看任务卡与实施方案 →
2 个候选任务
FlexGEMM 是一个基于 Triton 的 3D 稀疏卷积 GEMM 后端,核心目标是在 Submanifold Convolution 与体素稀疏卷积的训练/推理路径上,用 Triton 重写高性能稀疏 GEMM kernel,从而在 A100 等 GPU 上稳定超越 spconv、torchsparse、fvdb 等现有方案。项目名字里的 'Flex…
ops/serialize + ops/utils + 全项目 CPU fallback 路径 + 测试/CI 基础设施
★ 154 · 最近推送 2026-06-25
- fix(autotune): 修复 @triton.heuristics 包裹 kernel 的 cache key 命名空间错误
- Roadmap #23 子任务:为 Triton autotune cache 设计版本化 schema 与校验
查看任务卡与实施方案 →
5 个候选任务
Molt 是 NVIDIA NeMo 实验室维护的一个 agentic-first 强化学习训练框架,定位是研究导向、PyTorch / HuggingFace 原生、面向 1T 级 MoE 规模的全异步 agentic RL。它把整个栈压到三个薄层:Ray 负责 placement 与 rollout↔trainer 之间的异步队列,**v…
molt/agents/ + molt/utils/vlm_utils.py + tests/unit/agent* 与 tests/unit/vlm* 测试簇,长期负责「agen
★ 1167 · 最近推送 2026-10-04
- test(agents): CPU-only conftest fixtures + mark GPU-only agent tests
- test(vlm): unit tests for vlm_utils image placeholder expansion
- test(agents): DistillationEnv / chat_minimal env 单元测试
查看任务卡与实施方案 →
4 个候选任务
AutoKernel 是一个受 Karpathy autoresearch 启发的 GPU 算子自动优化 AI 代理框架。它的核心理念是:给定任意 PyTorch 模型,AI Agent 会自动分析瓶颈、提取算子,并在一个无限循环中(修改代码 -> 编译运行 -> 验证正确性与性能 -> 保留或回滚)不断迭代优化 Triton 或 CUDA C++ 算子…
CUDA 模板架构师与 Agent 优化策略(Prompt)负责人
★ 1564 · 最近推送 2026-03-19
- 修复 fused_mlp.py 中 Triton math.tanh 编译报错
- 添加 DiT 模型所需的 Modulated LayerNorm (AdaLN) 算子模板
- 扩展 Profiler 以识别量化模型 (bitsandbytes) 算子
查看任务卡与实施方案 →
1 个候选任务
edge-dit.cpp 是清华大学 THU-MIG 团队发起的一个开源、DiT-first 的 C/C++ 原生推理引擎,专为在本地和资源受限设备上运行 Diffusion Transformer(DiT)而设计。它基于 ggml 张量/图运行时构建,目标是在没有 Python、没有 PyTorch 依赖的前提下,为 FLUX.1/FLUX.2、SD3/S…
CPU / Metal 验证与工具链质量(覆盖 src/core/runtime CPU 路径、src/core/parallel/backends/cpu、`src/ut
★ 51 · 最近推送 2026-09-01
- proposal: 为 LTX-2.3 补 CPU 路径回归测试与文档对齐(基于 #82 上线后)
查看任务卡与实施方案 →