Episode cover
YouTube31 Jul 2026

“榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术与千亿美元市场

Podcast cover

硅谷101

AI 行业重心正从训练转向推理,算力效率成为制约发展的关键瓶颈。GPU 在实际运行中常因调度与软件瓶颈处于 “空转” 状态,导致大量算力浪费。通过优化 AI Infra 四层架构,特别是软件与服务编排层,能显著提升 GPU 利用率。以 SGLang 为代表的推理引擎,通过 KV Cache 复用、连续批处理及预填充与解码(PD)分离等技术,大幅降低了推理成本并提升了吞吐量。RadixArk 联合创始人朱邦华强调,推理引擎正成为 AI 时代的操作系统,通过与硬件深度协同,将硅片潜力发挥至极限,从而降低开发门槛,使更多团队能够构建前沿模型,加速 AGI 的实现进程。

Outlines

Sign in to continue reading, translating and more.

Open full episode in Podwise