00 - 专题索引
你把一个模型跑起来了,但它比预期慢。
慢在哪?是显卡算不过来,还是显卡在等 CPU 把数据喂过来?是单条请求本身就慢,还是并发一多就开始排队?这些问题看代码看不出来,只能在真机器上跑一遍、加压、把数字量出来。
这个专题收的就是这类实测报告。
有一条硬规矩:每条结论都得由这台机器上跑出来的数字支撑。 别人博客里写「这张卡上并发开到 32 最优」,那是别人的卡、别人的模型、别人的输入长度 —— 换个条件就不成立,搬过来只会误导人。
一、和隔壁专题怎么分工
| 专题 | 讲什么 |
|---|---|
| SGLang-Omni 多阶段运行时 | 框架本身怎么设计怎么实现,以及排查该按什么顺序做 |
| 本专题 | 那套顺序在一台具体的机器上真跑一遍,跑出来的具体数字和结论 |
方法论那篇开头就写了「不包含任何模型的具体测量结论」。本专题补的就是它缺的那一半。
二、篇目
| 篇 | 读完能回答 |
|---|---|
| 01 - 在租用 GPU 上执行实测 | 手上没有 N 卡,想租一台机器跑实测:机器按什么标准挑?活怎么派过去?哪些地方会「看起来没问题,其实已经错了」? |
| 02 - Whisper 在 24G 消费卡上的运行时画像 | 一张 24G 的 4090 上跑 Whisper,到底卡在哪一层?并发开到多 少之后就不再变快了? |
没有前置要求,从 01 开始按顺序读就行。