Podcast cover
月球大叔 · Technology

月球大叔

🔥在硅谷采访100个有意思的人 🚀成长来自持续高质量的输出 🎉AI|Infra|创业|职场| 🇸🇬AI PhD-🇺🇸硅谷创业者-🌞大模型科学家 B站、抖音、视频号、小红书、同名“月球大叔”

Episodes

Episode cover

陈然:全职奶爸,清华,CMU,AI斩杀线,0人公司,百亿token,财务规划,职业选择,创业收购,主体性,硅谷

06 Oct 2026AI processed

AI 时代的职业发展与商业落地策略核心在于将复杂问题标准化,并以商业价值作为衡量贡献的唯一准绳。清华校友、资深 CTO 陈然通过自身从移动互联网开发到 AI 转型的经历,强调了在技术浪潮中保持主体性的重要性。他主张通过 “杠铃策略” 平衡保守资产与激进创新,并利用 AI 工具重构生产关系,实现以极低成本构建 “零人公司” 的商业闭环。面对 AI 带来的职业斩杀线,个人应通过寻找一手信息源、深挖行业痛点并利用 AI 提升生产力,在动荡中构建个人竞争壁垒。此外,育儿与家庭规划应作为人生战略的一部分,通过主动选择而非被动接受,在 AI 时代实现职业与生活的双重掌控。

Episode cover

肖志斌:AI芯片,英伟达,全球供应链,2纳米,中美日韩,Groq,Cerebras,SambaNova,创业,AI原生

07 Sep 2026AI processed

AI 性能竞争的主战场已从晶体管设计转向系统级软件优化与异构架构。随着摩尔定律放缓,单芯片算力提升遭遇瓶颈,系统级协同设计成为提升 AI 推理效率的关键。资深芯片架构师肖志斌指出,芯片设计周期漫长且风险极高,AI 辅助设计正逐步介入验证与物理实现环节,但核心架构定义仍需专家把控。此外,芯片制程迭代的核心价值在于功耗降低而非速度提升,这使得数据流架构在处理大模型推理时展现出显著优势。未来,AI 原生的芯片设计公司将通过仿真平台与自动优化工具,打破软硬件壁垒,实现 AI 基础设施的极致经济性,推动大模型推理成本持续下降。

Episode cover

江鋆晨: KV Cache,大模型记忆,清华姚班,CMU,教授,开源,视频流媒体

09 Jun 2026
2h 25m
AI processed

大模型推理效率的核心在于 KV Cache 管理,将其视为模型的 “记忆” 而非临时数据,是降低重复计算成本的关键。江鋆晨提出,AI 基础设施应借鉴互联网发展史,通过解耦推理引擎与存储,构建标准化的 KV Cache 层。从清华姚班到 CMU 再到创立 Tensormesh,这一路径强调了 “做最难的事” 以实现快速成长,并利用开源生态推动技术标准化。通过深入一线工程实践而非仅停留在理论研究,能更敏锐地捕捉行业痛点。这种将学术洞察转化为工业界基础设施的尝试,正试图解决大模型时代算力与存储供需失衡的挑战,为 AI 应用提供更经济高效的底层支撑。

Episode cover

朱邦华: SGLang,强化学习,英伟达收购,二次创业,清华,伯克利,LMSYS,Chatbot Arena,善于放弃

18 May 2026AI processed

AI 基础设施是当前大模型浪潮的核心,RadixArk 通过开源推理框架 SGLang 和强化学习框架 Max,致力于降低前沿 AI 技术的应用门槛。AI 发展的重心正从单纯的文本生成转向复杂的 Agentic 任务,这要求基础设施不仅要支持大规模训练,更需在推理和强化学习环节实现高效协同。AI 基础设施的竞争本质上是资源与工程品位的较量,高质量的数据清洗与精细化的系统优化是提升模型智能边界的关键。面对技术变革,开发者应保持对前沿方向的敏锐判断,通过跨领域学习与在资源密集型环境中的工程实践,在 AI Agent 时代构建核心竞争力。这种从理论研究向系统工程的转型,不仅是技术演进的必然,更是推动 AI 从实验走向广泛应用的关键路径。

Episode cover

从AI零基础到vLLM贡献者,他只用了1年

17 May 2026
31m
Episode cover

与vLLM团队畅聊多模态(上)

11 May 2026
1h 9m
Episode cover

与SGLang聊聊DeepSeek V4

01 May 2026
1h 5m
Episode cover

河南高考状元,在硅谷做什么

26 Apr 2026
4m
Episode cover

年轻人如何创造财富?

21 Apr 2026
22m
Episode cover

UCSD博士生养10个龙虾,但不焦虑

15 Apr 2026
4m
Episode cover

锐评大龙虾,硅谷创业,机器人

14 Apr 2026
5m
Episode cover

vLLM-Omni最新进展讲解

04 Apr 2026
1h 34m
Episode cover

斯坦佛博后如何打印器官

12 Mar 2026
4m
Episode cover

博士退学,硅谷创业,AI做我90%工作

06 Mar 2026
8m
Episode cover

一口气看懂Anthropic

22 Feb 2026
6m
Episode cover

6分钟速通大模型KV Cache

15 Feb 2026AI processed

KV Cache 是提升大模型推理效率的核心技术,其本质是通过空间换时间来解决解码阶段重复计算的问题。大模型推理分为预填充和解码两个阶段,由于解码阶段每次只能生成一个词且需调用全部模型权重,导致计算效率低下;KV Cache 通过存储注意力机制中的中间结果(Key 和 Value),使模型在生成新词时无需重读前文,显著提升了生成速度。该技术不仅能加速单次请求,还能通过前缀缓存实现跨请求的计算复用,在对话历史记录和长文本问答场景中表现优异。然而,KV Cache 的巨量显存占用也带来了新的挑战,促使推理工程师开发出 PagedAttention 分页管理、内存卸载以及量化压缩等技术,以在有限的硬件资源下榨干显存价值,突破物理极限。

Episode cover

7分钟速通开源MoE

07 Feb 2026AI processed

混合专家模型(MoE)旨在通过稀疏架构在不增加计算资源的前提下,显著提升大模型规模与智能水平。该架构通过将前馈网络模块稀疏化,利用选择器动态激活专家,实现计算效率的优化。DeepSeek MoE 进一步引入共享专家与细粒度专家技术,以兼顾通用能力与领域专精。然而,MoE 面临训练负载不均衡导致的性能退化,以及推理阶段因频繁读取权重导致的带宽瓶颈。为解决这些难题,业界通过负载均衡损失函数、双批次重叠通信计算并行,以及大规模专家并行技术,在有限的显卡资源下最大化算力利用率,从而实现模型性能与推理速度的平衡。

Episode cover

Optimizing Large-Scale LLM RL Training with SGLang

29 Jan 2026
35m
Episode cover

LLM RL Training with SkyRL

25 Jan 2026
28m
Episode cover

一口气评测3个AI产品工具

09 Jan 2026
4m
Page 1

Follow this podcast in Podwise

Sign in to get AI summaries, transcripts and mind maps for any episode, including new ones.

Open in Podwise