Skip to content
@open-infra-ai

Open Infra AI

Open-source infrastructure, tools, and systems for building and running AI. | 面向 AI 构建与运行的开源基础设施、工具与系统

open-infra-ai

个人维护者:holtwood · C++ / CUDA / LLM inference systems

AI Infra 工程学习作品集组织:从 CUDA 内核到推理 serving 的完整能力链, 每个作品都有独立参考实现与差分验证。整体学习路径与方法论见 LEARNING_PATH.md

项目地图

仓库 定位 状态
L1 cuda-foundations 从 SGEMM 到推理组件的系统性 CUDA 算子工程学习路径 active
L1 triton-fused-ops 精简 Triton 算子(RMSNorm+RoPE / GatedMLP / FA 前向 / SGEMM)+ torch.library 注册 stable
L1 cuflash-attn 从零实现的 FlashAttention 前后向(FP16/BF16 WMMA + FlashDecoding) stable
L2 tiny-llm ⭐ CUDA C++ 推理引擎(W8A16 量化 / GGUF / 分页 KV),导出 C ABI active
L3 paged-infer Rust Serving 控制面(Paged KV + continuous batching),经 C ABI 接 tiny-llm active
L0 open-infra-ai meta 仓:landing、学习路径、跨仓契约、计划档案 active

阅读顺序:cuda-foundations → triton-fused-ops → cuflash-attn → tiny-llm → paged-infer

状态语义:active = 学习/演进中;stable = 作品完成,只修正确性 bug 与文档。 权威状态注册表在 meta 仓 README

工程原则

  • 诚实的性能声明:没有真实硬件测量的数字不写入文档
  • 差分测试:每个优化实现都有独立的参考实现做数值对比
  • 不变量验证:KV Cache 资源守恒、调度状态机等属性测试

Popular repositories Loading

  1. triton-fused-ops triton-fused-ops Public

    面向 Transformer 推理的可验证 Triton 融合算子与 torch.library 集成

    Python 4

  2. cuda-foundations cuda-foundations Public

    可验证的 CUDA 学习主线:SGEMM、通用 GPU 算子、性能优化与轻量推理组件

    C++ 3

  3. paged-infer paged-infer Public

    Rust LLM Serving 控制面:Paged KV、continuous batching、OpenAI SSE、C ABI 后端与可信压测

    Rust 1

  4. cuflash-attn cuflash-attn Public

    CUDA C++ FlashAttention/FlashDecoding 专项:FP32/FP16/BF16、WMMA、差分测试与基准

    Cuda

  5. tiny-llm tiny-llm Public

    CUDA/C++ LLM 推理运行时:GGUF、W8A16、tokenizer、Paged KV、CUDA Graph 与可复现基准

    C++

  6. .github .github Public

    open-infra-ai org profile: AI Infra 学习作品集导航

Repositories

Showing 7 of 7 repositories

Top languages

Loading…

Most used topics

Loading…