Open Source

成为核心贡献者

从真实 Issue、提交和 Release 信号出发,规划 30 / 60 / 90 天贡献路线。目标是承担持续维护责任,而不是堆 PR 数量。

Codex for Open Source 官方申请说明 →

更新于 2026-10-08T07:37:23+00:00 · 实际模型:LongCat-2.0(4 个仓库的 24 个阶段降级到 gemini-3.1-pro-preview)

每个项目已经拆成独立页面。任务卡只绑定真实、仍开放的 GitHub Issue,标出是否已有人认领,并附一段可以直接贴的英文认领留言。

本周先做这三个

全部可在 MacBook / CPU 上完成(最多用 Colab 免费 T4 做最终确认);无人认领、没有关联 PR、优先级高且能用上 kernel / 性能专长的排在前面。

  1. tile-ai/tilelang · #2973 [BUG][Fuzzer][wrong-code] CuTeDSL codegen emits Python floor // for integer truncdiv (DivNode), giving wrong results for negative operands
    easy · CPU · 1个晚上 · 编译器 Codegen 与数值正确性分析。
  2. modelscope/DiffSynth-Engine · #224 test: 添加 LoRA merge/unload/scale 单元测试
    low · CPU · 1–2 个晚上 · LoRA 机制与算子正确性验证
  3. huggingface/diffusers · #14888 修复 UniPCMultistepScheduler 在 float64 默认 dtype 下 torch.linalg.solve 的 dtype 不匹配崩溃
    easy · CPU · 1 个晚上 · dtype 传播与算子边界是 GPU 性能工程师日常;本任务只需 CPU 验证。

6 个候选任务

sgl-project/sglang

SGLang(sgl-project/sglang,LMSYS 非营利组织托管)是高性能大模型与多模态模型推理服务框架,2024 年初以 RadixAttention 前缀缓存起家,README 自称支撑全球 40 万+ GPU、日产数万亿 token,被 xAI、NVIDIA、AMD、Cursor 及各大云厂采用,2025/03 加入 PyTorch 生态…

experimental/sgl-router 路由策略与可观察性方向

★ 36502 · 最近推送 2026-09-28

  • 补全 sgl-router cache_aware / load_based 策略单元测试与边界用例
  • 补全 SamplingParams 上界校验(top_k / logprobs / n)
  • 修复 DisallowedTokensLogitsProcessor 跨请求 batch 语义

查看任务卡与实施方案 →

3 个候选任务

sgl-project/sglang-omni

SGLang-Omni 是 sgl-project 下的多阶段(multi-stage)推理服务运行时,专门面向 omni 模型、语音 / TTS 模型以及统一多模态模型。它把一次生成拆成多个异构阶段——预处理、编码器、自回归引擎、talker、解码器、vocoder、聚合器——分别匹配不同的调度器与传输后端,对外暴露 OpenAI 兼容的 `/v1/aud…

Apple Silicon / MLX 后端负责人(sglang_omni_mlx/ + models/*/mlx/ + Apple Silicon 测试与基准)

★ 1323 · 最近推送 2026-10-08

  • [Apple Silicon] 为 Fun-ASR TorchMPS runner 补 request builder 单元测试
  • [Apple Silicon] 新增 Apple Silicon runtime_metrics 基准脚本(Qwen3-ASR MLX)
  • [RFC] Full-Duplex Recoverable Unit Failures 中「Unit 生命周期状态机」子项

查看任务卡与实施方案 →

4 个候选任务

vllm-project/vllm

vLLM 是目前最活跃的开源 LLM 推理与服务引擎之一,起源于 UC Berkeley Sky Computing Lab,由 2000+ 贡献者维护。它围绕 PagedAttention 这一核心内存管理技术构建,解决大语言模型推理中 KV cache 内存浪费与吞吐瓶颈问题,同时提供 continuous batching、chunked prefil…

csrc/cpu/ + benchmarks/kernels/cpu/ + tests/kernels/ 的 CPU 回归测试,长期负责 vLLM CPU 后端的 kernel 优

★ 93192 · 最近推送 2026-10-05

  • [CPU] 为 csrc/cpu/ 添加 batch-invariant greedy/top-k/top-p 采样内核
  • [CPU] 为 cpu_fused_moe 与 mamba_cpu 添加微基准
  • [Tests] 添加 CPU vs CUDA int8 quant / layernorm 精度对照测试

查看任务卡与实施方案 →

5 个候选任务

flashinfer-ai/flashinfer

FlashInfer 是一个面向 LLM serving 的高性能 GPU 内核库与内核生成器,核心卖点是在 attention、GEMM、MoE、采样、通信等推理热点路径上提供统一 API,并在 FlashAttention-2/3、cuDNN、CUTLASS、TensorRT-LLM 等多个后端之间按硬件与负载自动选择最优实现。项目采用 JIT 编译为默…

flashinfer/experimental/ 的 Python 层(含 experimental API 的契约测试、backend 选择逻辑、错误路径、docstring、t

★ 6546 · 最近推送 2026-10-05

  • test(cli): 为 flashinfer collect-env / show-config / list-modules 补单元测试
  • docs(diffusion_ops): 补全 docstring、类型标注与最小可运行示例
  • docs(experimental): 新增 experimental backend 开发 tutorial

查看任务卡与实施方案 →

5 个候选任务

Dao-AILab/flash-attention

FlashAttention 是 Dao-AILab 维护的精确注意力(exact attention)加速库,核心卖点是 IO-aware 的 tiling 实现:在 HBM 与 SRAM 之间按 tile 搬运与计算,把标准 Attention 的 HBM 读写压到理论下界,从而在不牺牲数值精度的前提下显著提速并省显存。仓库目前同时承载多代产品:FA2 …

FA4 Python 层(flash_attn/cute/)的测试基础设施、调度器单元测试、以及 SM100/SM110 新特性的文档与 benchmark 基线

★ 25088 · 最近推送 2026-10-04

  • 为 FlashPrepareScheduler / SchedulerState / tile_scheduler 添加 FakeTensorMode 单元测试
  • 为 flash_attn.cute.interface 添加输入校验与错误提示测试
  • 为 splitkv early-exit LSE 问题(#2842)添加回归测试与文档

查看任务卡与实施方案 →

6 个候选任务

tile-ai/tilelang

TileLang (tile-lang) 是一个基于 Python 的领域特定语言(DSL),构建在 Apache TVM 编译器基础设施(TIRX)之上,专为简化高性能 GPU/CPU/加速器内核(如 GEMM、FlashAttention)的开发而设计。它的核心定位是让开发者能够使用 Pythonic 的语法进行 Tile 级别的编程,同时保留底层硬件优…

Metal 后端核心维护者 (Metal Backend Maintainer) & 布局推导架构师 (Layout Inference Architect)

★ 7446 · 最近推送 2026-09-21

  • [BUG][Fuzzer][ice-on-valid-code] T.import_source prelude with no trailing newline fuses with the next #include, so nvcc rejects the CUDA instead of compiling
  • [BUG][Fuzzer][wrong-code] CuTeDSL codegen emits Python floor // for integer truncdiv (DivNode), giving wrong results for negative operands
  • [BUG][Fuzzer][accepts-invalid] Region ops (T.fill/T.clear/T.copy) accept a sliced region whose min+extent exceeds the buffer, silently emitting an out-of-bounds write

查看任务卡与实施方案 →

6 个候选任务

huggingface/diffusers

🤗 Diffusers 是 Hugging Face 维护的 PyTorch 扩散模型推理与训练库,定位为 image / video / audio / 3D 分子生成的「模块化工具箱」。README 明确把哲学写在最前面:usability over performance、simple over easy、customizability over ab…

src/diffusers/schedulers/ + tests/schedulers/ + benchmarks/ + examples/profiling/ 构成的「调度与性

★ 34653 · 最近推送 2026-10-05

  • 修复 UniPCMultistepScheduler 在 sigma=0 末步返回 NaN/inf 问题(solver_type=bh1、lower_order_final=False、predict_x0=False)
  • 修复 UniPCMultistepScheduler 在 float64 默认 dtype 下 torch.linalg.solve 的 dtype 不匹配崩溃
  • 修复 DPMSolver 与 UniPC 在 final_sigmas_type=sigma_min + 转换 sigma 时末步 h=0 返回 NaN

查看任务卡与实施方案 →

5 个候选任务

hao-ai-lab/FastVideo

FastVideo 是一个面向视频生成大模型(如 Wan2.1/2.2, MiniMax-H3 等 DiT 架构)的端到端统一推理与后训练(Post-training)加速框架。它的核心价值在于打破了“训练”与“推理”的壁垒,通过算法层(DMD2 蒸馏、Video Sparse Attention 稀疏注意力、Self-Forcing 因果蒸馏)与系统层(定…

fastvideo/mlx_runtime (Apple Silicon 推理后端) 与 fastvideo/distributed (分布式调度逻辑)

★ 4486 · 最近推送 2026-09-21

  • [perf] Reuse cached VAE offload for H3 reference and keyframe encoding
  • [Bug] MPS generation fails when multiprocessing worker returns output tensors
  • [Feature] Implement batching support for inference (Roadmap Q3)

查看任务卡与实施方案 →

5 个候选任务

thu-ml/TurboDiffusion

TurboDiffusion 是清华大学机器学习组(THU-ML)开源的端到端视频扩散模型(DiT)推理加速框架。其核心目标是通过算法与系统协同设计,在单张消费级或数据中心 GPU 上实现 100-200 倍的生成加速,同时保持视频质量。项目目前处于早期快速迭代阶段(README 明确指出“checkpoints and paper are not fina…

分布式训练调度 (FSDP) 与硬件无关推理管线 (Hardware-Agnostic Inference)

★ 3762 · 最近推送 2026-08-27

  • 修复 setup.py 编译参数,支持 Turing/Ampere 等旧架构
  • 修复使用 original attention 时加载权重的 Unexpected key 错误
  • 调查并修复 14B 480p 模型 local_attn 权重为 0 的问题

查看任务卡与实施方案 →

6 个候选任务

modelscope/DiffSynth-Engine

DiffSynth-Engine 是 ModelScope(阿里达摩院 MuseAI)团队维护的高性能扩散模型推理引擎,核心目标是为 DiT 类图像/视频生成模型(Flux、Wan、Qwen-Image、Z-Image 等)提供一套自研、可控、可裁剪的推理管线,减少对 diffusers/k-diffusion 等外部库的依赖。README 明确指出它“ca…

diffsynth_engine/algorithm/ + tests/test_algorithm/ + 跨平台(CPU/MPS/CUDA)attention 后端兼容性层

★ 433 · 最近推送 2026-09-03

  • test: 为 flow_match/stable_diffusion scheduler 添加 CPU 回归测试
  • test: 为 DPM-Solver++/DEIS sampler 添加 CPU 单元测试
  • test: 添加 attention 后端 CPU/MPS/CUDA 兼容性矩阵脚本

查看任务卡与实施方案 →

2 个候选任务

JeffreyXiang/FlexGEMM

FlexGEMM 是一个基于 Triton 的 3D 稀疏卷积 GEMM 后端,核心目标是在 Submanifold Convolution 与体素稀疏卷积的训练/推理路径上,用 Triton 重写高性能稀疏 GEMM kernel,从而在 A100 等 GPU 上稳定超越 spconv、torchsparse、fvdb 等现有方案。项目名字里的 'Flex…

ops/serialize + ops/utils + 全项目 CPU fallback 路径 + 测试/CI 基础设施

★ 154 · 最近推送 2026-06-25

  • fix(autotune): 修复 @triton.heuristics 包裹 kernel 的 cache key 命名空间错误
  • Roadmap #23 子任务:为 Triton autotune cache 设计版本化 schema 与校验

查看任务卡与实施方案 →

5 个候选任务

NVIDIA-NeMo/labs-molt

Molt 是 NVIDIA NeMo 实验室维护的一个 agentic-first 强化学习训练框架,定位是研究导向、PyTorch / HuggingFace 原生、面向 1T 级 MoE 规模的全异步 agentic RL。它把整个栈压到三个薄层:Ray 负责 placement 与 rollout↔trainer 之间的异步队列,**v…

molt/agents/ + molt/utils/vlm_utils.py + tests/unit/agent* 与 tests/unit/vlm* 测试簇,长期负责「agen

★ 1167 · 最近推送 2026-10-04

  • test(agents): CPU-only conftest fixtures + mark GPU-only agent tests
  • test(vlm): unit tests for vlm_utils image placeholder expansion
  • test(agents): DistillationEnv / chat_minimal env 单元测试

查看任务卡与实施方案 →

4 个候选任务

RightNow-AI/autokernel

AutoKernel 是一个受 Karpathy autoresearch 启发的 GPU 算子自动优化 AI 代理框架。它的核心理念是:给定任意 PyTorch 模型,AI Agent 会自动分析瓶颈、提取算子,并在一个无限循环中(修改代码 -> 编译运行 -> 验证正确性与性能 -> 保留或回滚)不断迭代优化 Triton 或 CUDA C++ 算子…

CUDA 模板架构师与 Agent 优化策略(Prompt)负责人

★ 1564 · 最近推送 2026-03-19

  • 修复 fused_mlp.py 中 Triton math.tanh 编译报错
  • 添加 DiT 模型所需的 Modulated LayerNorm (AdaLN) 算子模板
  • 扩展 Profiler 以识别量化模型 (bitsandbytes) 算子

查看任务卡与实施方案 →

1 个候选任务

THU-MIG/edge-dit.cpp

edge-dit.cpp 是清华大学 THU-MIG 团队发起的一个开源、DiT-first 的 C/C++ 原生推理引擎,专为在本地和资源受限设备上运行 Diffusion Transformer(DiT)而设计。它基于 ggml 张量/图运行时构建,目标是在没有 Python、没有 PyTorch 依赖的前提下,为 FLUX.1/FLUX.2、SD3/S…

CPU / Metal 验证与工具链质量(覆盖 src/core/runtime CPU 路径、src/core/parallel/backends/cpu、`src/ut

★ 51 · 最近推送 2026-09-01

  • proposal: 为 LTX-2.3 补 CPU 路径回归测试与文档对齐(基于 #82 上线后)

查看任务卡与实施方案 →