sgl-router
experimental/sgl-router 约 242 文件(experimental 整体) | Rust 实现的 KV 感知 OpenAI 兼容路由器,负责 worker 发现、路由策略、健康检查、断路器、session 亲和与 KV 前缀索引 入口:src/main.rs::main, src/server/app.rs::build_router, src/policies/mod.rs, src/state/kv_events/mod.rs, src/workers/manager.rs::run_with_config 依赖:sgl-kv-indexer, rust/sglang-server, python/sglang/srt/managers/scheduler_components/load_publisher.py 提交热点外最活跃的 Rust 组件;policies/ 含 cache_aware、session_aware、power_of_two、decode 等策略;policies_reorg/ 为重构中的新策略体系;sgl-kv-indexer 为独立 gRPC 前缀索引服务 |
sgl-kv-indexer
experimental/sgl-router/sgl-kv-indexer 约 30 文件 | 独立 KV 前缀索引服务,接收 worker 上报的 KV-cache 事件,维护 radix tree,对外提供 gRPC 前缀匹配查询 入口:src/bin/kv-indexer-server.rs::main, src/service.rs::KvIndexerService, src/client.rs::{PrefixMatch, PrefixIndexError}, src/memory_backend.rs::InMemoryKvIndexerBackend 依赖:tonic (gRPC), tokio Router 的外部索引后端;InMemoryKvIndexerBackend 为内存实现;支持远程 GrpcPrefixIndex 与本地索引两种模式 |
rust-sglang-server
rust/sglang-server 需验证(rust/ 下多个 crate) | 高性能 Rust 服务器,统一处理 HTTP/gRPC 请求、多模态数据面、生成请求转发,是提交热点第二位 入口:需验证(推测为 src/main.rs 或 lib.rs 中的 serve/run 入口) 依赖:axum/tokio-tonic(需验证), sgl-router(共享路由与策略) 近期提交「Rust server unify datapath for mm and generate requests (#39679)」表明正在统一多模态与生成数据路径 |
rust-sglang-mm
rust/sglang-mm 需验证 | 多模态数据面 Rust 组件,处理图像/视频/音频等非文本输入的预处理与传输 入口:需验证 依赖:rust/sglang-server 提交热点第 4 位(5 次提交),与 sgl-router 共同构成 Rust 数据面 |
python-srt-entrypoints
python/sglang/srt/entrypoints 需验证(python/ 整体约 3863 文件) | Python 侧 OpenAI 兼容服务器入口,提供 v1/chat/completions、v1/completions、tokenize 等 HTTP 接口,以及引擎启动入口 入口:需验证(推测含 openai_server、engine、tokenizer 等模块) 依赖:python/sglang/srt/managers, python/sglang/srt/model_executor examples/frontend_language/ 与 examples/runtime/ 中的 server 脚本通过该层启动 |
python-srt-scheduler
python/sglang/srt/managers 需验证 | 调度层核心,包含 Scheduler、SchedulerProfiler、scheduler_components/(radix_cache、chunked_prefill、load_publisher、disagg、speculative 等) 入口:Scheduler(推测), scheduler_components/radix_cache, scheduler_components/chunked_prefill, scheduler_components/load_publisher.py::LoadStat 依赖:python/sglang/srt/executor, python/sglang/srt/mem_cache README 强调「zero-overhead CPU scheduler」;radix_cache 实现 RadixAttention 前缀缓存;load_publisher 向 Rust router 发布负载 |
python-srt-executor
python/sglang/srt/executor 需验证 | 执行层,封装 GPUModelRunner、overlapping_scheduler,负责模型前向、batch 执行、与 kernel 层交互 入口:GPUModelRunner(推测), overlapping_scheduler(推测) 依赖:python/sglang/srt/layers, python/sglang/srt/model_executor, python/sgl-kernel 与调度层紧密协作,支持 continuous batching 与 overlapping |
python-srt-layers
python/sglang/srt/layers 需验证 | 算子包装层,包括 attention、moe、quantization、linear、norm、rope、sampling 等,调用 Triton/CuTe/FlashInfer 入口:需验证(推测含 fused_moe_triton、quantization、attention_backend 等子模块) 依赖:python/sgl-kernel, 3rdparty/amd, torch benchmark/kernels/ 下有大量对应 benchmark(fused_moe_triton、attention、all_reduce 等) |
python-srt-model-executor
python/sglang/srt/model_executor 需验证 | 模型执行层,负责模型加载、前向传播、采样、logits 处理、多模态融合 入口:需验证(推测含 model_runner、sampling、logits_processor 等) 依赖:python/sglang/srt/layers, python/sglang/srt/executor, python/sglang/srt/models python/sglang/srt/models/ 包含各模型实现(Llama、Qwen、DeepSeek、WAN 等) |
python-sgl-kernel
python/sgl-kernel 需验证 | 自定义算子包,提供 Triton/CuTe/CUTLASS/FlashInfer 封装的 fused kernel(fused_moe、rmsnorm、rope、quant、paged_attention 等) 入口:需验证 依赖:torch, triton, flashinfer, cutlass/cute(需验证) benchmark/kernels/ 下多数 benchmark 直接调用该包;3rdparty/amd/ 提供 ROCm 特化 |
python-srt-models
python/sglang/srt/models 需验证 | 模型实现层,覆盖主流 LLM(Llama、Qwen、DeepSeek、Kimi、GLM 等)、embedding/reward 模型与扩散模型(WAN、Qwen-Image) 入口:需验证(推测每个模型一个文件,如 llama.py、qwen.py、deepseek.py) 依赖:python/sglang/srt/layers, python/sglang/srt/model_executor README 强调「easy extensibility for adding new models」;扩散模型为近一年新增 |
python-srt-mem-cache
python/sglang/srt/mem_cache 需验证 | KV 缓存管理层,实现 paged attention、RadixAttention 树形缓存、hicache 层级缓存、unified_memory 入口:需验证(推测含 radix_cache、paged_cache、hicache 等) 依赖:python/sglang/srt/managers/scheduler_components/radix_cache benchmark/hicache/、benchmark/unified_memory/ 为对应 benchmark |
tools-claude-skills
.claude/skills 约 112 文件(.claude 整体) | AI 辅助工程工具集,含 LLM torch-profiler 分析、机械重构验证、生产事故分诊等 skill 入口:llm-torch-profiler-analysis/scripts/analyze_sglang_torch_profile.py, mechanical-refactor-verify/scripts/mechanical_refactor_reproduction_cli.py, sglang-prod-incident-triage/scripts/incident_artifact_tool.py 依赖:python/sglang(分析目标) 体现仓库工程化成熟度;profiler 分析脚本直接解析 SGLang 的 torch-profiler trace |
tools-benchmark
benchmark 约 146 文件 | 性能基准测试集,覆盖 kernels、scheduler、hicache、disaggregation、lora、diffusion、deepseek_v3 等场景 入口:kernels/fused_moe_triton/benchmark_sglang_fused_moe_triton.py, scheduler/bench_token_storage.py, hicache/bench_*.py, disaggregation/bench_cached_prefix.py 依赖:python/sglang, python/sgl-kernel benchmark/kernels/ 下有大量可独立运行的 kernel benchmark,适合无 GPU 读者在 CPU/Colab 上跑部分测试 |
tools-ci-docker-docs
docker, docs, scripts/ci, .github/workflows docker 约 25 文件,docs 约 553 文件 | 工程支撑层,含多硬件 Dockerfile(cuda、rocm、npu、xpu、xeon、arm64、musa)、Mintlify 文档站、CI 流程 入口:docker/Dockerfile, docker/rocm.Dockerfile, docs/docs.json, scripts/ci/, .github/workflows/ 依赖:python/sglang, rust/sglang-server pyproject_cpu.toml 为 CPU 安装路径;docker/ 覆盖 NVIDIA/AMD/Intel/TPU/昇腾/ARM 多硬件 |