Porting NVIDIA's CUDA Megakernel (MPK) to China's T-Head PPU-ZW810E
一个”理论上不可能”的实验:把专为 NVIDIA Hopper/Blackwell 手写的 Mirage Persistent Kernel(MPK)megakernel,跑到阿里平头哥的真武 810E(PPU-ZW810E,非 NVIDIA 架构)上——结果不仅跑通,单卡 Qwen3-8B 推理还反超了 PPU 自家优化栈。 这篇记录了完整的踩坑、破案和调优过程。所有数据来自真机。 TL;DR ✅ MPK 从源码在 PPU 上构建成功(CUDA 兼容,__CUDA_ARCH__=800)。 ✅ Qwen3-8B megakernel 跑通且输出正确。 ✅ 修一个死锁后,16 worker 单核路径 = 35.5 ms/token,反超 native 的 39.4 ms(1.11×)。 🔬 用 PPU 全套调试工具(ppu-gdb / racecheck / synccheck / 占用探针 / 插桩)把一个高 worker 数的死锁逐层定性为 scheduler 规模化 livelock。 一、...
你好,我是星云猫 —— 一个相信「超级个体」的开发者
开篇如果你是第一次来到这里 —— 你好,我是 段尚易,网名 星云猫(Nebulamao),上海杉达学院信息科学与技术学院 2024 级软件工程专业的一名本科生。 这个博客的定位很简单:记录我在 AI 技术上的折腾、踩坑和思考。Agent、RAG、大模型、AI 游戏开发……凡是我真正动手做过、想清楚了的东西,都会写在这里。 与其写一篇模板化的「自我介绍」,我想先讲一个最近的故事 —— 因为它几乎能解释我在做的所有事,以及我为什么要开这个博客。 一个人,一支战队2025 年底,由 开放原子开源基金会 主办、阿里云魔搭社区(ModelScope) 承办的「AI+互动游戏挑战赛」收官。全国 480 支队伍报名,绝大多数是 3–5 人的团队。 我以「星云猫」的名义,一个人 报了名。 从需求调研、产品设计到技术落地,全程一个人包办。初赛阶段,靠扎实的技术文档和产品原型挤过了专家评审;决赛阶段,当别的队伍分工协作时,我自己在短时间里做了好几轮高强度迭代,硬啃下了两个最难的点 —— AI 生成 3D 资产 和 游戏引擎自动接入。 最终,这支「一人战队」拿下了赛道二「AI 游戏创造工具」的 全国二...
