Notes
Notes · 站内长文
技术笔记、论文精读与访谈深读
这里整理较长的技术笔记、论文精读、访谈深读和可独立访问的学习资源,按最近更新时间倒序排列。可以用下面的搜索和分类,快速定位想看的主题。
默认排序:最近更新优先;分类筛选和搜索会保留这个倒序。
#6 Neal Zhang:显微镜下的硅谷大裁员
先完整重建 2022 年 11 月 11 日 Neal Zhang 对 Meta 裁员通知、业务优先级、赔偿、H-1B/绿卡、股票、美国生活成本、中美职场和 2008/2022 周期的亲历回答,再分析裁员如何把公司战略压缩成个人的现金、身份、技能和选择权账;所有政策与金额冻结在节目时点。
#7 谈婧:硅谷冻卵历险记和 Web3 环球旅行
先完整重建谈婧从冻卵纪录片、身体与婚姻主体性,到三个箱子环球旅行、Web3、越南、金融 PMF、监管、FTX、加密大屋和 VC 民主化的连续叙述,再分析个人选择与全球网络如何共同面对成本、治理和责任;医疗内容保留为个人口述,不构成建议。
#8 Sebastian Mallaby:硅谷风投的起源、秘密和大人物肖像
先完整重建中文配音版《The Power Law》从 Fairchild、Arthur Rock、红杉与 Kleiner 到成长投资、弱关系和中国风投的连续对话,再分析幂律如何塑造基金期限、分阶段投资、团队协作与机构接班,明确这是解释性重建而非英文逐字翻译。
#1 王梦秋:聊聊加州、投资寒潮和林黛玉
先完整讲清王梦秋从 2000 年硅谷泡沫、O2O/共享经济/新零售小周期,到 2022 年美元资金通路变化、持币待购、投资人居家生活、回国与百度职业路径,再解释消费、硬科技、创业者画像、蹲着和《红楼梦》人物判断;把 2022 年个人经验、行业回顾与本文独立分析分开。
#2 曹巍:聊聊马斯克、机器人恐怖谷和《西部世界》
先完整重建曹巍从擎天柱、双足步态、SLAM、触觉与精细控制,推进到晶圆搬运、三亚海鲜服务、恐怖谷、柔性机器人、波士顿动力、中国机器人生态与场景型商业化的原文路径,再分析为什么通用身体不等于通用价值;把 2022 年市场数字、技术时间表与官方机器人资料分层。
#83 英伟达之道:黄仁勋如何把失败、CUDA 与组织做成自强化网络
先完整重建《英伟达之道》节目从黄仁勋童年、三位创始人、NV1/NV2 失败、Riva 128 求生、GPU/CUDA、NV30 重挫、Mellanox、白板、Top 5、项目负责人和 Priem 离开推进的原文,再分析为什么 NVIDIA 的护城河是硬件、软件、开发者、系统和组织学习组成的自强化网络;把传记因果、管理处方和公开公司历史分开。
#85 凯文旭:总统候选人作为产品,如何与美国叙事做 PMF
先完整讲清凯文旭从奥巴马竞选基层、商务部和白宫新闻办公室,到硅谷科技业与投资的原文路径,再重建候选人作为产品、竞选组织、2008/2024 叙事、播客分发、特朗普与硅谷、AI 政治化和执政承接;随后分析 PMF 如何穿过产品、市场、分发与执行四道门,并把竞选结果、候选人预测和嘉宾动机分层。
#86 广密:从‘下一个 Google’到 Agent、Context 和新软件
先完整重建广密从 Yahoo/Google、搜索/推荐和 token 最小单元讲起,推进到‘下一个 Google’、任务引擎、ChatGPT 商业模式、Context 基础设施、Chatbot 到 Agent/Organizer 五级演化,再逐一解释 OpenAI、Google、Anthropic、Perplexity、Cursor、Devin 和 AI for Science;随后分析为什么 Agent 的真正护城河是可复盘的长期状态,并把周活、付费率、数据墙和 2025/2026 时间表保留为 2024 年末节目估算或预测。
#92 张亚勤:意识、寿命、机器人、生物智能和物种的延伸
先完整重建张亚勤从微软亚洲研究院、清华 AIR 和基础模型取舍,推进到信息智能、物理智能、生物智能、家庭/工业/社会机器人、自动驾驶、RSR 仿真闭环、脑机接口、寿命、教育和新物种的原文路线,再分析为什么信息模型进步不能直接推出通用物理或生物智能;五年、十年、二十年和更远的时间表均保留为 2025 年访谈预测。
#93 张前川:内容产品二十年与 AGI 对人类的威胁
先完整讲清张前川从百度/360 搜索、知乎、字节今日头条到 MiniMax 的二十年产品路径,再解释搜索、推荐、UGC 社区和泛化的内生逻辑;随后重建他关于 AI 加速、目的与工具、Agent、灭绝风险、算力分配权和 pro-human 组织的完整推理,并把强烈的 AGI 时间表与风险判断保留为 2025 年访谈口述。
#3 邵天兰:宇航员与机器人——漫谈深邃浪漫的 Robot 新知
先完整讲清邵天兰从人形机器人 moonshot、家庭操作、机器人与机器的区别,到工业视觉、服务机器人、创业一击和 Mech-Mind 的原文推进,再分析感知—规划—执行—反馈闭环;把十到二十年预测、行业死亡率、融资金额与官方身份/项目资料分层。
#4 杨帆(Francis):寻访越南——最后一个待开掘的儒家社会
先完整重建杨帆从并购律师、战略投资到越南生活的连续回答,再解释河内/胡志明市、二〇〇〇年中国类比、制造业迁移、供应链、营商环境、南北文化、家庭与摩托车生活;把个人体验、越南官方 FDI、世界银行背景和本文判断分开。
#5 黄宇翔:东南亚六国的政治、杀戮和国父
先完整重建黄宇翔按印尼、马来西亚、菲律宾、泰国、越南、新加坡推进的政治导览,再分析地理、国家能力、暴力记忆和国父叙事;明确族群性格概括、历史数字和选举判断均有节目口述与时间边界,不把刻板印象当成事实。
#9 Sebastian Mallaby:口述一部硅谷风投史
先完整重建 Sebastian Mallaby 如何写作《The Power Law》,以及 Fairchild、Arthur Rock、红杉、Kleiner、Son/Milner、YC、Benchmark 和 Founders Fund 的人物与制度史,再分析弱关系、团队化、幂律和硬件回潮,明确这是英文原声节目的中文解释性重建而非逐字翻译。
#10 Sophia Xiao(萧慧平):加州土著谈硅谷精神与职场
先完整重建 Sophia Xiao 从上海移民、零售与银行工作,到 IBM、Box、Twitch、投资和中国公司本地化的连续叙述,再分析硅谷的职业流动、叙事能力、弱关系和在地化机制,区分个人回忆、节目观察与 2023 年预测。
#11 韩亦东:新加坡的淘金热和政商环境
先完整重建韩亦东从16年新加坡经历、Radio Web3基础设施、数轮淘金热到政府补贴、淡马锡、李显龙和区域总部的连续对话,再分析新加坡为何是枢纽而非中心,保留 Web3、政策、补贴和主权基金口述边界。
翁荔(Lilian Weng)的大模型思想地图:从 Scaling Laws 到 Harness
翁荔(Lilian Weng)大模型思想地图:继续完整重建《Thinking about High-Quality Human Data》《Extrinsic Hallucinations in LLMs》《Reward Hacking in Reinforcement Learning》,并与《Why We Think》《Scaling Laws, Carefully》《Harness Engineering for Self-Improvement》接成“数据—事实—奖励—推理—缩放—Harness”反馈链;同时梳理 Lil’Log 2017-2026 年 52 篇技术正文的主题迁移、阅读路线与证据边界。
#38 和软银愿景原GP聊聊,大模型全球降温后,人工智能何去何从
先完整重建陈恂如何从 AI 1.0/2.0/3.0、语言模型的‘反刍’、世界模型、可变成本转固定成本讲到模型社会、行业模型、隐私/IP、OpenAI 的商业壁垒、推理上量、国产算力、投资审美、创业选择和现金流,再抽象基础能力如何通过专业反馈和责任链进入现实。
#39 对凯文·凯利的50问:垄断者与国界、大富翁与人生
先按英文原声和中文文字版完整讲清凯文·凯利对下一代垄断者、镜像世界、科技国界、AI 安全、创作者经济、学习、财富与人生的连续回答,再抽象外部崛起、基础设施约束和持续学习这套判断,并区分节目观点、官方人物资料与本文推断。
#40 和美国科技界人士聊硅谷AI的冷与热:第二波浪潮拉开帷幕
先按完整音频讲清 Kevin Xu、Sophia Xiao 与张小珺如何从 GPT-3、Copilot、ChatGPT 推进到模型不是产品、GPU 短缺、Copilot 工作流、企业战投、并购、研究者创业、开源/闭源和监管,再抽象第二波不是降温而是价值标准转向产品、反馈、算力与责任闭环。
#34 被忽视的中腰部公司活得还好吗?他们的欲望、挣扎与天命
先完整讲清吴杉杉从物理博士、麦肯锡和罗兰贝格,到唯品会与好未来战略岗位的经历,再用唯品会的线上奥特莱斯、拼多多冲击、女性消费心智、好未来的军团化与反思文化解释二级赛道的资源禀赋、增长天花板和多元化诅咒。
#36【做个生意吧!】跳向后海的年轻人、酒精和下沉年代
先完整重建梁二狗从多次创业、账面两亿但没有拿到钱、25岁危机,到客厅酒馆、疫情送酒、礼宾部、打酒师、城市扩张、合伙人拆分和‘站在背面’的连续故事,再分析跳海如何把关系获客、低标准化服务、贡献者分配和城市网络接成一门生意。
#37 小冰李笛讲点真心话:只做大模型不追求商业模式是很难生存的
先按完整音频和编辑文字版讲清李笛从微软/Bing到小冰的情感路线、大模型第二名武器、参数与延迟、API 商业模式、模型震荡、Tay、安全、微博‘癌症’、记忆与意识,再抽象能力、收入、关系与生存的分层。
#31【趋势2023】和老范从退潮的内容投资谈起
先完整重建范卫锋从公众号、播客和爆款创作者谈到内容投资退潮、IP 与流量、Bigverse、星球研究所、内容加消费和 Disney 路径,再分析创作者天赋如何穿过组织杠杆、用户关系、供应链和 AI 生产门槛形成可持续现金流。
#32 第一个把查理·芒格引入中国的人和出版风云
先按施宏俊与张小珺的完整对话重建上海人民出版社、世纪文景、中信大方、出版黄金十年、渠道变化、芒格入华、《穷查理宝典》《芒格之道》和芒格书院,再分析一本书如何穿过发现、编辑、分发与关系链成为长期知识资产。
#33【职场人性】企业内斗,究竟在斗什么?
先完整讲清 Colin 如何区分内斗与内耗、战略模糊和资源冗余如何制造流程自保、组织变大后怎样形成烟囱和中层主战场,再分析行业下行、岗位性质、组织商、CEO 责任与个人退出条件。
#27 英文播客:和深度学习奠基人聊聊大脑、模型和人类的爱
以英文完整音频为主、中文编辑文字为辅,先讲清 Terrence Sejnowski 从物理、神经生物学、计算神经科学到玻尔兹曼机、连接主义、Minsky 争论、ChatGPT 自监督学习、外星人隐喻、价值函数、长期记忆、身体反馈和能力监管的完整回答,再分析为什么模型能力不等于代理能力。
#29 逆全球化思潮来势汹汹,外企CEO何故密集访华?
先完整还原王威从马斯克 44 小时访华、CDR 与访问脚本讲到握手合影、外企 CEO 访华潮、美国/欧洲/俄罗斯商业力量、三种所有制和逆全球化重新连接,再把礼仪信号、经营依赖、政治关系和经济结果分层,避免把一次会面直接写成关系缓和或增长证明。
#30【职场人性】情商含量越高,公司越平庸?
先完整重建王亚军从清华、麦肯锡、龙湖到宝龙与管理研究的经历,再按节目顺序讲清正式情绪智能与职场口语的差别、情商对个人低成本却对组织高昂、公司阶段、基层/中层/高层、现实感、战略执行合一、企业级方法和双向 ChatGPT 情绪滤镜;最后分析为什么问题不是情商总量,而是现实能否进入共同决策系统。
#24【趋势2023】从北森IPO看充满挑战的中国企服这两年
先完整重建熊飞与北森 IPO 的关系,再按节目顺序讲清企服过山车、2020 年现金流盈利、疫情估值膨胀、单月/全年盈亏平衡、2025 年 IPO 判断、PS/PE/NDR、上市与否、客户规模、AI 投资两层、Midjourney/Stable Diffusion、基础设施、SaaS 解决方案和 iPhone/Android 开源类比;最后分析增长质量、现金流与开源生产门槛,并保留 2023 年财务口述与预测边界。
#25 OpenAI开源、亚马逊新动作,全球大模型格局走向何方
先完整重建王怀南的创业与投资背景,再按节目顺序讲清 ChatGPT 3.5 到 4.0、简单机会被模型吸收、垂直 Copilot、OpenAI/亚马逊口述、中国小模型叠加、工具/社区/商业模式三层门槛、搜索/电商/娱乐、35 岁以上老兵与第四消费时代;最后分析 AI 应用的责任闭环,并明确所有新闻与预测的 2023 年证据边界。
#15 到美利坚去创业吧:全球化 3.0 的本地化方法
先完整重建 Joyce、Sophia、Camila 对 going global is going local、Globalization 3.0、远程工作、美国招聘/劳动法、Go-to-market、Zoom、跨国团队、996/007、社区和中美互学的连续对话,再分析出海为何等于重新创业、当地人/关系/故事/法律怎样构成基础设施,并保留 2023 年全球化与美国市场观察边界。
#16 Colin:那些挣到钱、消失的互联网中高层去哪了
先完整重建 Colin 从 BCG/消费品、百度、美的到爱博星辰创业的职业叙述,再按节目顺序讲清互联网红利与组织膨胀、三分之二出走观察、四个上车时点、Shein 全价值链、职业经理人转 CEO、美的方洪波接班、互联网文化、2023 产业/AI 机会和下一代教育;最后分析平台能力、产业耐心与责任迁移的边界,保留 2023 年行业口述和预测边界。
#17 田娜:沉闷的港股、家族办公室与富豪的苦恼
先完整重建田娜从嘉实、公募、香港金融科技到财富管理的职业经历,再按节目顺序讲清港股从约 1.4 万点反弹、2017—2023 周期、IPO 冷热、乐华娱乐、香港资本五个时代、家族办公室、信托/保险、代际价值观和富人压力;最后分析市场周期、资产治理与传承规则的边界,保留 2023 年金融口述和预测边界。
#12 黄宇翔:东南亚五个小国的扈从与对冲
先完整重建黄宇翔从上期东南亚六国回应、小国扈从/对冲框架,到缅甸、老挝、柬埔寨、文莱、东帝汶和中国人出海的连续导览,再分析小国如何用多向量外交、区域组织、路权和资源依赖保存自主性,并严格保留战争、人口、政权、经济和历史数字的节目口述边界。
#13 刘建斌:邮轮小史与海面上的乌托邦
先完整重建刘建斌从途牛/京东、2008 年接触邮轮、2020 年创业到南极和行业观察的原文,再按时间顺序讲清邮轮从交通工具到移动酒店、巨头并购、教母、奢华与大众产品、服务/空间比、火山、南极和中国市场;最后分析“海上乌托邦”如何由基础设施、服务密度和逃离现实共同构成,保留历史与价格口述边界。
#14 黄宇翔:香港的语言政策、暧昧和青年迷思
先完整重建黄宇翔从“两文三语”、新加坡双语政策到香港教育、语言身份、产业定位和青年出路的连续对话,再分析语言政策如何同时分配认知时间、经济竞争力与政治/文化认同,保留 3%—5%、学校比例和青年观察的 2023 年口述边界。
#18 商业口述史:从美国往事,到 Google 输掉 OpenAI 第一局
先完整重建王怀南从社会学、麦肯锡、宝洁、雅虎、陆奇、Google 中国到创业,再按节目顺序讲清雅虎为何错过 Google、收购后自治、ChatGPT 的用户反馈闭环、BabyTree 垂直数据、招聘 Agent、微软/亚马逊/Meta 和 AI 未来;最后分析创始人连续性、闭环与组织学习,并保留 2023 年口述史和预测边界。
#19 王怀南:硅谷银行危机与未来风险传导
先完整重建王怀南在硅谷银行危机周末帮助创业公司确认存款、区分存款人与股东、解释美联储动作和提出三条风险传导方向的连续访谈,再分析利率、资产期限、流动性、专业银行与中国美元 VC 的连接,并保留 2023 年金融数据和预测边界。
#20 Yunan:The Information 前记者的拉美商业游记
先完整重建 Yunan 从 The Information、中国科技报道、香港/美国到巴西生活两个月的现场叙述,再按节目顺序讲清外卖与出行、税收与劳工法、Growth VC 缺口、warm introduction、家庭与工作、巴西/阿根廷、中文公司与 2C/2B 市场;最后分析出海为什么首先是获取语境与承受制度成本,并保留 2023 年在地观察边界。
#21 投资人视角下的大模型和市场真实水温|和梦秋聊 ChatGPT
先完整重建梦秋从‘给大脑做预训练’、ChatGPT 的 iPhone 时刻、AI 1.0/2.0、DeepMind 与 OpenAI、一级市场水温、搜索互补、教育与 SaaS 土地不平整,到 Jasper、垂直数据、创业资金门槛、涌现和 Prompt Engineering 的连续回答,再分析注意力、资本部署、商业落地和反馈所有权如何错位,保留 2023 年市场判断边界。
#22 要做中国 OpenAI?李志飞劝各位同仁冷静点
先完整重建李志飞从 Hopkins/NLP、Google Translate、深度学习、自监督与大一统模型,到硅谷三问、OpenAI/Google 组织比较、王慧文饭局、五千万美元估算和公司渐进式路线,再分析基础模型、应用模型与公司生存三种问题为何不能被“中国 OpenAI”一个口号覆盖,并明确 2023 年成本、数量和行业预测边界。
#23 和傅盛从这场伟大的 AI 变革,谈到创业、恩怨和心性
先完整重建傅盛从 ChatGPT 使用、大模型逻辑能力、爱因斯坦与平民化模型、搜索/办公/社交、服务机器人、家庭 Hub、交互革命到创业危机、恩怨、现金流和年轻人建议的连续访谈,再分析模型能力如何穿过交互、本体和组织成为可交付服务,并保留 2023 年家庭机器人、价格与产业判断边界。
#26 令德国人惊吓的上海车展:一幅当代汽车众生图
先完整重建张君毅的工程、咨询与汽车投资经历,再按节目顺序讲清中德汽车影响力、上海车展新能源注意力、特斯拉缺席、价格战、去库存、现金流、美法德能力差异、跨国车企决策权、中国品牌十三张门票与合资未来;最后分析注意力如何兑现为产品、权限、现金流和全球交付,并保留 2023 年行业口述与预测边界。
#41 汽车史话:世界上第一辆燃油车、女车手和慈禧太后
先按节目顺序讲清汽车史话开篇、卡尔·奔驰、戴姆勒、贝莎带两个孩子长途试车、药房燃料、红旗法案、梅赛德斯品牌、第一辆内燃机车的形态、内燃机能源选择、道路/维修/赛车、家族与职业经理人、慈禧车主和未来出行,再抽象新技术如何从原理穿过现场验证、基础设施和组织承接进入社会。
#42 汽车史话:集权者福特与全球第二畅销 T 型车的衰落
先完整重建亨利·福特的农场童年、机械学习、T 型车、单一车型、黑色车、移动流水线、垂直整合、$5 日薪、通用竞争、T 型车衰落、福特家族、爱德塞、福特二世、艾柯卡、穆拉利、福特太太和基金会,再抽象福特如何把低价变成产品—制造—供应链—劳动力系统,以及成功机制如何反过来制造路径依赖。
#43 汽车史话:从‘盛产管理大师’的通用汽车,看美式车企百年荣辱
先按节目推进完整讲清慕尼黑车展的中国速度、杜兰特从马车/别克到通用、并购与财团接管、雪佛兰、斯隆与德鲁克、事业部制、金融创新、2009 年破产、Mary Barra、工会薪酬和多品牌四象限,再分析通用如何把复杂度组织成管理能力,以及多品牌失控时如何变成成本。
#44 赵耀辉:为什么很多女性在 40+ 消失在职业黄金阶梯上
先按节目顺序完整讲清 Claudia Goldin 的百年女性劳动市场研究、教育/家务技术/避孕药/市场变化、母职惩罚、greedy jobs、统计性歧视、中国 20+ 女性优势与 40+ 流失、托育、产假、晚婚晚育和男性分工,再抽象教育优势如何在生育与不可替代工作中被逐年消磨;独立判断把平等重写为降低岗位对单人持续在线的依赖。
#45 王怀南:宝洁为什么能把‘笨方法’做成百年系统
先完整重建王怀南拒绝宝洁 offer 后写信回归、重复面试、Promotion From Within、Up Or Out、品客与用户调研、德国移民与象牙肥皂、军校人才、Brand House、品牌/品类管理、三层创新、中后台、媒介危机和中国消费品机会,再分析宝洁如何把用户、人才、品牌、供应链和组合管理变成长期系统;独立判断把‘宝洁的笨’拆成有意的慢能力与无意的组织迟滞。
#46 赵圆圆:双十一为什么越来越像一场平台混战
先按 2023 年双十一现场顺序完整讲清平台、商家与消费者的疲劳,平台大混战、规则复杂化、直播超级主播、十五年电商演进、平台抽成、幕后战役组织、茅台、逍遥子与消费话题,再抽象年度大促作为协调系统的机制;独立判断把平台真正的稀缺能力定义为把复杂度留在后台。
#47 刘元:徐小平和他的门徒,接班百亿基金的琐碎小事
先核清本期嘉宾是刘元、方爱之是接班主线中的核心人物而非受访者,再按节目推进讲清刘元写信求师、加入真格、错过悦刻、徐小平逐步退出、IC 投决、合伙人培养、创始人四象限和文化细节;独立判断把基金接班拆成决策权、判断能力、关系资产与文化信用的分步转移。
#48 骆轶航:OpenAI的权力游戏为何失控
先按 2023 年 11 月 OpenAI 罢免 Sam Altman 后的四天四夜完整复原人物、谈判、员工信和微软介入,再讲清创业/安全理念冲突、非营利母体控制商业化实体的治理错配,以及硅谷政治、联盟与隐形不平等;独立判断把危机抽象为使命控制权、运营信息和问责能力没有匹配。
#49 王潘:蔚小理如何穿越新能源车生死线
先按节目时间线完整讲清王潘如何复原蔚来、理想、小鹏在 2014–2015 年的入局、找人找钱、产品路线、2019 年资金与交付危机以及 2020 年资本窗口,再解释三家公司分别把风险配置到品牌服务、增程产品与智能化技术;独立判断把‘穿越生死线’拆成现金时间、产品适配、组织执行和外部窗口的乘积。
#50 宋亚宸:95后/00后创业者的‘马斯克值’与现实
先完整讲清宋亚宸从商汤 CEO 办公室、MiniMax 到 VAST 3D 的路径,再还原年轻创业者的内容与游戏积累、AI 1.0/2.0、寒冬融资、无工资无算力的早期现实、SIGGRAPH keynote、人才黑洞、技术/产品文化冲突和 AIGC 模板;独立判断把‘年轻优势’重写为长期兴趣、低路径依赖与快速反馈的组合,而非年龄标签。
#51 张君毅:汽车出海不是销量竞赛,而是地缘与制造系统
先完整重建中国汽车从早期出口受阻、2021–2023 年新能源汽车窗口,到丰田进入美国、本田从摩托车起步、精益生产与日本汽车危机的连续叙事,再提炼产品适配、合规地缘、销售服务、本地制造和组织学习五层出海闭环;独立判断把出口量降回全球经营的前半程。
#52 王亚军:职场嫉妒如何变成组织的暗流
先按节目推进完整讲清嫉妒如何从‘别人有、我没有’进入岗位分配、领导与下属、同级晋升、绩效评审、办公室空间和企业家决策,再解释正/负嫉妒、‘性/恐惧/爱/信仰’个人框架、内部竞争和入职投资尽调;独立判断把嫉妒视为资源分配与程序公平的报警器,而不是管理 KPI。
#56 沈帅波:名创优品、分级消费与中国零售全球化
先完整讲清沈帅波从县域消费、实体创业和沉浸式调研进入名创优品,再按单店模型、托管式加盟、供应链、IP、门店密度、直营/代理选择和国家代表重建名创全球化;独立判断把消费升级/降级改写为分级选择,把零售壁垒定义为细节、现金反馈与本地适配的总和。
#57 梁捷:真实版《繁花》、90 年代上海与股市制度试错
先完整还原梁捷如何从小说与电视剧的差异、黄河路的本地记忆讲到上海股市从小柜台、纸质股票和老八股走向电子化与监管,再解释宝总、A 先生、强总、宝延风波、认购证、327 与 519;独立判断把电视剧的英雄叙事还原为城市空间、制度试错和多数人的下岗与希望。
#58 吴晓波:中国企业家小史与没有大生意之后的人生
先按节目顺序讲清吴晓波如何从茅台的工艺、时间与匠人型企业家切入,重建近百年中国企业家代际、互联网一代的特殊入口、AI 作为工具的边界,以及父辈成功给下一代带来的压力;独立判断把茅台与腾讯拆成两种生产函数,指出大机会退潮后真正稀缺的是愿意长期重复并积累信任的方向。
#59 杨植麟:长文本、非共识与 Sora 之前的 AGI 创业路线
先按两次访谈完整还原杨植麟从语言模型、AGI 组织、Google 第一性原理、ChatGPT 后资本/人才/算力窗口讲到长文本、Kimi、User Scaling 和有概率的非共识,再解释 Sora 的一致性、视频世界模拟器、统一架构与数字—物理世界连接;独立判断把长上下文重写为状态预算和责任链。
#61 王小川:技术与市场之外,中国 AGI 的第三种可能
先完整还原王小川如何回应朱啸虎与杨植麟、提出 TPF、把 AGI 应用解释为造人,再讲清生命建模、三座模型大楼、百川快速入场、搜狗经验、2B/2C、Sora 取舍与春节后从追随 GPT 转向自有价值观;独立判断把第三种声音抽象为模型能力、场景纵深、用户反馈和组织共创的生产函数。
#63 王威:中资出海并购大时代与先正达
先完整还原王威从央企、民企、外企文化差异讲到企业并购与 VC/PE 的区别,再按联想—IBM、吉利—沃尔沃、2009–2017 出海窗口、先正达 430 亿美元交易和四阶段整合讲清中国资本出海的商业史;独立判断把并购的核心抽象为把外部资产、人才与组织能力迁移进自己的战略。
#64 广密:AGI 大基建时代,电 + 芯片 = 产出智能
先完整还原广密对 2024 Q1 全球模型赛局、开源、多模态、Inflection、AGI 渐进式解锁、Coding、信息检索和模型/产品南北坡的讲解,再把电力、GPU、万卡集群、数据中心、Scaling Law、Agent、OpenAI 芯片、机器人和硅基智能放进 AGI 大基建链;独立判断指出竞争单位是单位芯片与能源带来的有效学习,而非单纯卡数。
#65 梦秋:风险投资的钥匙失灵了吗?
先按节目顺序还原梦秋如何从美元 VC 募资与 IPO 出口、分红和明股实债,讲到机器人本体、AI for Science、Coding、语音、垂直模型、自动驾驶、消费和养老经济,再分析 VC 从高赔率组合转向现金流层与选择权层;所有基金规模、项目数量、行业缩水和未来判断均保留口述边界。
#66 李志飞:IPO、GPT-4o 与前沿科技创业的痛
先完整还原李志飞从出门问问 IPO、前沿技术为何落到项目制、GPT-4o 多模态和 OpenAI/Google 发布会,讲到 API 降价、模型—产品一体化、具身智能、创业现金危机、魔音工坊与十二年战略复盘;独立判断把前沿创业抽象为能力、产品、经济和范式迁移的转换预算。
#67 谈谈黄仁勋搭建的组织系统:分布式操作系统,“就像一台GPU”
先完整还原王亚军如何从英伟达 60 位高管直接汇报、不做一对一、公开反馈、邮件现实感、不裁员、不做长期计划和爱与关爱,推导出分布式决策与高创业力敏捷组织,再解释 GPU 类比、康威定律、context not control、横向协作与信任;独立判断指出真正稀缺的不是扁平,而是把现实变成共同推理。
#68 和MiniMax天使投资人聊,MiniMax幕后故事和大模型资本扑克牌
先完整还原陈昱从 GenAI Summit、中美资本与十年 AI 浪潮,讲到 MiniMax 从商汤团队、数字人、Glow、Talkie、海螺 AI、星野到模型质量与创始人分工,再分析巨头降价、Club Deal、融资入围线和并购选择;独立判断把 MiniMax 的赌注抽象为模型质量、产品现金流与资本续航的共同飞轮。
#69 口述全球大模型这半年:Perplexity突然火爆和尚未爆发的AI应用生态
先完整还原广密如何从 Perplexity 的成立、团队、投资人、信息检索与 PMF 讲到 AI 应用为何没有系统性爆发,再解释模型能力、成本、延迟、多模态、端侧、RAG、GPT-5、Scaling Law、巨头依赖和中美创新生态;独立判断指出应用爆发是能力、经济性、入口、反馈与组织瓶颈逐层迁移的结果。
#70 何小鹏:FSD、“在血海游泳”、乱世中的英雄与狗熊
先完整还原何小鹏从小米 SU7 发布会、UC 与小鹏的智能化基因、自动驾驶卖车,到 ChatGPT 后读论文、重写数据流、仿真训练、拜访黄仁勋、吴新宙离开、华为竞争、G9 反思、组织变革、MONA M03 和 FSD/Waymo 实测,再进入大模型汽车的六层壁垒与数据—费用—销量飞轮;独立判断指出大模型重构的是汽车公司的单位学习成本,而不是一次性增加一个功能。
#71 楼天城:Robotaxi、ACRush 与 L2/L4 的不同目标
先完整还原楼天城从武汉无人车、1/10/100/1000/10000 小时无接管阶梯、Contest-based metric system、端到端、激光雷达/纯视觉/V2X 和 L2/L4 目标函数讲起,再讲清数据超过人类后为何可能成为干扰、Robotaxi 的可预测体验、Pony.ai 的创业与姚班/ACRush 经验;独立判断指出自动驾驶真正稀缺的是定义“什么叫更好”的评价器。
#74 孟醒:Waymo 和它的对手们
先完整还原 Waymo 从 Google X、DARPA 前史、领导层变化、规则到数据驱动的技术迭代,再讲清孟醒在凤凰城对 Waymo 的真实乘车、停车场长尾、远程协助、运营中心和极限测试,以及 Cruise、Uber、Zoox、Aurora 的分化;独立判断把 L4 护城河从模型准确率推进到异常、责任、车队和单位经济的闭环。
#77 陆复斌:并购重组会兴起吗?
先完整还原陆复斌从 NASA、Chegg、亚马逊 Two-Pizza Team、百度到全球并购经营的履历,再按 Grindr、英为财情、Coins 和 Yahoo 竞价讲清并购来源、宏观周期、定价、经营者、尽调、跨国差异与退出;独立判断指出并购的最小单位不是交易,而是一个能被接住、整合并持续产生现金流的经营结果。
#78 孟醒:自动驾驶创投过山车这八年
先完整还原孟醒从顺为投资、滴滴自动驾驶 COO 到再次回到投资与孵化的经历,再讲清小鹏、Momenta、Cruise、L2/L4、2016–2024 自动驾驶融资周期、人才来源和无人长期运营;独立判断把技术进度、资本周期、业务闭环和创始人心态拆开,指出真正的反共识是为第二阶段准备资本结构。
#79 孟醒:特斯拉 Robotaxi 大会与无人运营的隐性成本
先完整还原孟醒和张小珺如何点评特斯拉 Robotaxi 大会:从延期、CyberCab、Robovan、Optimus 和 Unsupervised FSD,推进到 L2/L4 责任、片场测试、单位经济、Car Partner、充电洗车、集中式车库与遥操作;独立判断把演示、能力、运营和责任拆开,指出 Robotaxi 的核心是接管司机原本隐形承担的系统责任。
#80 周源:知乎、AI 搜索与社会化编辑部
先完整还原周源如何从 ChatGPT 带来的脱节感、AIGC/UGC 边界、面壁智能投资和知乎直答,讲到 Perplexity、搜索生态、人与人讨论的信任,再回到数据库开发、记者、群体博客、MetaSource、知乎创业、上市后的战略摇摆与 CEO 孤独;独立判断指出 AI 先淘汰的可能是没有解释力的内容生产链,社区壁垒要落到来源、作者、追问和责任。
#28 刘元:AI 黑客松、创业者供给与狂欢中的忧伤
先完整还原刘元从 AI 黑客松 90 个项目、Copilot Demo 和应用层护城河讲起,再讲清即刻与 Monica 的创业反馈、创始人工资、黑客松的训练价值、中美小天才/老司机/操盘手/技术派供给、AI 对投资方法和信息服务的冲击;独立判断区分案例口述、结构化框架和虚无主义情绪。
#60 戴雨森与季逸超:Sora 的信息拼图与大模型淘汰赛
先按节目顺序重建戴雨森与季逸超如何从 Sora 发布反应、团队和组织文化讲到模型规模、数据、原生分辨率、世界模拟器与多模态,再分析 GPT 时刻与产品化、模型淘汰赛、AI 应用扩散、投资筛选和个人数据;独立判断区分官方信息、嘉宾推测、产品门槛和世界模型证据。
#62 朱啸虎:AIGC 应用、商业化与中国创业的中间地带
先完整还原朱啸虎如何从中美模型分工、被投公司转向 AIGC、AI 视频面试和真实业务数据讲起,再解释 PMF、基础模型资本密度、B2B 先行、中国独有场景、SaaS 寒冬、创业者选择和现金流;独立判断把模型能力、应用闭环、客户结果与可证伪条件分开。
#81 李开复:AGI 霸权、低成本推理与中国的第二条道路
先完整还原李开复如何从 Geoffrey Hinton、神经网络与 GPU 历史讲到零一万物的创业选择,再解释低成本推理、模印一体、美国 AGI 路线与中国第二条道路、海外 2C/国内高价值 2B、Service as Software、助手与 Super App;独立判断把价格、模型能力、结果数据和可切换生态拆开,区分节目时期口述、Epoch Scaling 背景与可验证机制。
#72 孟醒:特斯拉 FSD、端到端与 L2/L4 的两套安全体系
先完整还原孟醒从创业、投资、滴滴自动驾驶到亲自试驾 FSD 的经历,再讲清 Waymo 与 Tesla 的拐点、V11/V12 体验、端到端架构、BEV/Transformer、数据闭环、传感器、L2/L3/L4 责任和中国落地;独立判断把能力、可靠性、责任、量产和商业化分开。
#73 广密:Self-play RL 会不会成为 AGI 的下一条 Scaling Law
先按节目顺序重建广密对预训练 Scaling、数据与 GPU 工程瓶颈的解释,再讲清 Self-play RL 的 agent—environment—action—reward 闭环、奖励黑客、推理时计算、Coding、视频、机器人、中美研究文化与 AI 资本叙事;独立判断提出生成、验证、迁移、变现四道 Scaling Law 门槛。
#76 王小川:从快思考到慢思考,强化学习如何进入医疗
先完整还原王小川如何把 o1 解释为预训练与强化学习的学—思融合,再讲清思维链、隐藏过程、监督学习与强化学习、验证器、数学代码诗歌和医疗,最后分析数字医生、TPF、水涨船高场景与顾问定位;独立判断区分路线假说、公司愿景、可验证结果和医疗责任。
#82 Vitalik:LLM 的权力、Crypto 的规则与一条去中心化 AI 路线
先完整还原 Vitalik 从语言学习、AI 与区块链分工谈到 OpenAI、LLM 黑盒、AI 参与 Crypto 游戏、去中心化 AI、Farcaster、身份和普通人应用,再分析算力/数据权力、公开规则、数据控制与退出权;明确区分哲学框架、技术假设和成熟度证据。
#84 岂凡超:模型不能单独创造价值,AI 产品要先解决可信的信息消费
先讲清岂凡超从清华 NLP、Wantwords 到深言科技语鲸的创业路径,再解释模型不确定性、信息单元、跨来源去重、结构保持、可追溯输出、被动信息入口、Cursor/NotebookLM/Perplexity 和 AI 组织;独立判断聚焦可信压缩、评价集、信息流与融资/商业化边界。
#87 李想:宅男、AI、家庭、游戏和天梯
先完整还原李想从宅男、游戏和社会天梯谈到理想成为 AI 公司,再解释功能与能力、理想同学的长期记忆、企业原子数据与后训练、端到端自动驾驶、世界模型、产品体验和 AI 组织;独立判断聚焦能力如何经由数据、终端、安全和责任进入物理世界。
#53 李黎:赴中东掘金的中国人肖像
先完整还原李黎 16 天走访沙特、阿联酋和卡塔尔时遇到的巨头员工、创业者、学生、年轻职场人和灰度生意人,再解释三波中国人进入中东、Vision 2030、商务礼仪、华为式本地化、小订单到大业务、主权资本与能源/绿色叙事;独立判断把‘中东热土’拆成国家战略、本地信任、交付能力和组织本地化的乘积。
#54 广密:口述全球大模型这一年
先按节目时间线完整讲清广密如何从 OpenAI、Anthropic、Google、GPT-4、Claude 2、Gemini、开源和多模态讲到人才、GPU、数据、Scaling Law、训练成本、Agent、VC、自动驾驶和 OpenAI 治理,再把 2023 年的公开事件、嘉宾估算与预测分开;独立判断把大模型竞争抽象为能力曲线、成本曲线和反馈闭环的共同约束。
#55 小Lin:周期中的微小个体与内容生产方法
先完整还原小Lin从金融专业、纽约投行、留学生求职创业到财经内容创作的经历,再讲清她如何用日本与国家周期解释个人处境、用‘热点+故事+干货’组织内容、用知识树把资料压缩成主线,并回答互联网大厂、大学试错、性格适配和生命质量;独立判断把职业选择重写为低成本验证与保留转向权。
语音 OPD 四篇工作深读:学生听错之后,教师究竟怎么教
用同一条音频样本完整重建 CORD、X-OPD、Ark-ASR OPD 与 X³-OPD:解释学生 rollout、同模型文本教师或外部文本教师、reverse KL、关键 token 加权、GRPO、union top-k、teacher-data warm-up 与三层音频推理数据各自解决什么问题;逐项核对跨模态落差、ASR CER/WER、能力保持和失败轴,指出语音 OPD 当前擅长修复可文本化的推理轨迹,却仍受文本教师无法直接感知音乐、音色和细微韵律的监督上限约束。
#88 吴翼:Operator 不是会点网页,而是推理进入闭环
先完整还原吴翼如何从 Operator 的网页 demo 讲到 CUA、截图—推理—动作闭环、2016 年 Web Agent 失败史、OpenAI 五级路线、人机协作、用户数据、物理世界与学术非共识;再用 OpenAI Operator/CUA 一手资料审计模型、基准、安全、产品演进和嘉宾推断。
#89 潘家怡:DeepSeek-R1、Kimi K1.5 与 o1 的推理训练
先把潘家怡近三小时的论文共读完整讲清楚:o1 的训练时/测试时计算、R1-Zero 的纯 RL、R1 的冷启动与蒸馏、GRPO、PRM/MCTS、Kimi K1.5 的长度控制与课程学习,再分析为什么真正被减少的是逐步示范,而不是数据、任务、验证器和人类设计。
#90 朱啸虎:DeepSeek 之后,AIGC 投资判断要怎样重写
先完整还原朱啸虎如何从一年前不信 AGI、拒投中国基础模型,转向重新评估 DeepSeek、开放底座、数据瓶颈、应用、Agent、Stargate 与海外机会;再把 Android 类比、意识判断、用户增长、成本和数据飞轮拆成嘉宾口径、DeepSeek 一手资料与独立投资框架。
#91 何俊贤:逐篇讲解 DeepSeek 关键九篇论文
先按节目顺序完整还原 DeepSeek LLM、DeepSeekMoE、V2、V3、Coder、Coder-V2、Prover、Prover-V1.5、R1/R1-Zero 的技术链,解释 MoE、MLA、FP8、MTP、代码/Lean 验证器和冷启动 RL 怎样逐步汇合;再把“低成本”“涌现推理”“开放文化”拆成论文自报、嘉宾判断和可被推翻的独立结论。
#94 杨松琳:DeepSeek、Kimi、MiniMax 注意力机制新论文
先从 Q/K/V、二次计算和 KV cache 讲清长上下文为何昂贵,再按节目顺序解释 DeepSeek Native Sparse Attention、Kimi MoBA 和 MiniMax Lightning Attention 的选择、压缩、局部窗口、线性状态与硬件执行;随后把三条路线抽象为历史访问预算,并审计论文自报结果、嘉宾对后续模型路线的预测和等预算比较要求。
#96 郎咸朋:自动驾驶十年演进史、关键技术细节与特斯拉
先把郎咸朋从高精地图、多激光雷达、BEV+Transformer、特斯拉纯视觉到端到端和 L3/L4 责任的完整叙述讲清楚,再分析自动驾驶十年真正更换的是世界表示和学习接口,而不是简单的传感器信仰;成本、芯片、路线归因和“L3 是 L4 先导”均按嘉宾口径与工程判断分层。
#98 陈建宇:机器人基座模型与 VLA 经典论文
先按论文史完整还原陈建宇如何从传统机器人“一百种场景、一百套模型”讲到 LLM/VLM 进入规划、感知和控制,再解释 VLA、RT-1、RT-2、Open X-Embodiment、OpenVLA、Pi0、GR00T、HiRT 与在线 RL 的关系;最后把人类类比、跨本体数据、动作头、层级策略和现实试错成本分开审计。
#99 杨钊:人类驯服可控核聚变还有多远
先完整讲清杨钊如何从核裂变、托卡马克、低温/高温超导、Q 值和三重积,走到能量奇点的洪荒 70、洪荒 170、洪荒 380 与商业化阶梯;再分析高温超导路线真正要验证的是装置能否更快迭代,而不是一次放电就等于商业发电,并把成本、工期、燃料、AI/太空愿景分成嘉宾口述、公司公开资料和独立判断。
刘子鸣访谈深读:AI for AI 不是自我神话,而是把模型研究变成可实验的科学
完整梳理 #149 刘子鸣 1 小时 40 分钟访谈:从 KAN、神经—符号连接、Physics of AI,到 O-P-H-I-S 研究结构、原模型预测训练曲线、AI for AI 与 training autopilot;严格区分嘉宾提出的研究纲领、公开论文与机构资料,以及尚未验证的融资、产品和时间表判断。
游凯超访谈深读:vLLM 从一篇论文走向开源基础设施与模型—Infra 共设计
完整梳理 #148 游凯超 YouTube 版 2 小时 06 分钟访谈:从 PagedAttention、vLLM 的伯克利开源传统,到 PyTorch 基金会、Inferact 公司化、开源治理和模型—Infra co-design;明确 YouTube 版在 2:06:37 截断,小宇宙长版多约 54 分钟,不混写两个版本。
沈宇军访谈深读:具身原生的真正瓶颈,从架构选择走向数据规模化
完整梳理 #147 沈宇军 1 小时 52 分钟访谈:从 LingBot 的视觉、深度、VLA、视频/世界模型与 VA 模型族,到约 6 万小时数据、跨本体泛化、任务后训练、身体—传感器协同和具身原生创业;把团队口述、官方论文/代码和本文推断分层,指出下一道门槛是数据诊断学而不只是更大模型。
#97 广密:Pre-training 叙事回归与 AGI 的登山路线
完整解释广密在 2025 年第一季度提出的非共识:预训练并未结束,后训练/RL 负责激活与塑形,Coding 是高反馈的 AGI 环境,Agent 需要环境、工具、记忆、规划和评价,路线再延伸到 AI for Science 与机器人;随后将 OpenAI/Anthropic 判断、token 经济、MCP、DeepSeek-R1 和两年 AGI 等内容分成技术假说、官方事实与强预测。
#100 康林松:奔驰的转型,不是豪华与电动化二选一
先还原奔驰全球 CEO 康林松如何回答中国市场、电动化、豪华策略、CLA、800V、MB.OS、合作伙伴、DeepSeek 和 CEO 决策,再分析一家 139 年老公司如何把燃油/混动与纯电、品牌历史与软件架构、内部能力与外部合作放进同一套可演进系统;单独校正 ASR 将 10.9 kWh/100 km 误识别为约 11000 Wh/100 km 的技术数字。
#101 明超平:YouWare 把 Coding 变成新的创作媒介
完整讲清明超平从 OnePlus、ByteDance、Kimi、Noisee 到 YouWare 的产品来路:辩论和数据如何塑造用户判断,Noisee 为什么从 Sora/Suno 的需求中出现又停止,YouWare 早期版本如何从 AI 原生退化成工程模板,以及 Coding 为什么被他视为像相机一样的新创作媒介;再分析 shell、社区、Agent 生态、动态 UI 和模型/产品关系。
#103 陈冕:Lovart 从应用创业绝境到垂直 Agent
先完整还原陈冕从摩拜、每日优鲜、字节和剪映走到 Liblib、Lovart 的创业时间线,再分析第一代图像产品如何经历补贴战、下架、现金只剩 4000 元、融资断裂与牌照恢复,以及第二代产品为何转向画布、对话框和设计 Agent;明确区分创业者口述、公开产品定位和本文对垂直 Agent/现金流的独立判断。
OpenMLE 深读:把‘AI 改进 AI’变成可执行的机器学习工程闭环
从 OpenRSI 原帖、Frontis-MA1 论文、OpenRSI 官方仓库与 Hugging Face 发布重建 OpenMLE:解释 OpenMLE-Gym 的可执行任务、OpenMLE-ERL 的执行反馈训练、OpenMLE-Evo 的经验引导搜索,以及 Frontis-MA1 如何在这套闭环中学习并回到搜索环;同时区分模型收益、harness 收益与通用 RSI 尚未成立的证据边界。
#135 Tristan:Context Flow、主体性与 AI 社交
深读自然选择创始人 Tristan 张筱帆关于 EVE、ELYS、Context Flow 和 AI 社交网络的完整访谈:区分陪伴型单节点与网络型多节点,解释低维标签到高维 Context 的范式变化、双重冷启动、隐私交易、主体性和真人连接率,并把产品愿景拆成可验证指标与证伪条件。
#126 郑庆生:三次流量革命与 AI 的新入口
深读郑庆生关于经济史流量革命、平台行为、AI 新入口、硬件节点、Agent/App 边界与创始人组织能力的访谈。文章把公路、铁路、电话、电视和互联网的历史类比拆成新增行为、连接密度、边际成本、迁移成本和结果反馈等可观测问题,避免把流量类比直接当成因果证明。
#125 Freda:从 AI 资本叙事到收入、毛利与回报
深读 Freda Duan 从 2020–2025 硅谷关键词、AI/再工业化/金融数字化三条主线,到 OpenAI 商业模式、Anthropic、Robinhood、机器人和 AI 泡沫的完整访谈。严格区分嘉宾估算与外部事实,把 AI 回报拆成新增收入、转移收入、成本节省和资产重估,并提出毛利、现金流、资本强度和生产率的后续核验框架。
#124 戴雨森:Year of R——回报、研究、记忆与现实检验
深读戴雨森关于 2025 AI 复盘与 2026 Year of R 的长访谈:从推理时 Scaling、Coding Agent、应用护城河、Context/Memory、Agent 十年过程,到泡沫、回报、研究突破、创业建议和后置公司闲谈。将 Return、Research、Remember、Reasoning/多模态解释为一份投资组合审计表,并明确模型分数、ARR、市场预测和说话人分离的证据边界。
#123 王冠:压缩即智能,产品才是数据与系统二
深读 ONE2X/Medeo 创始人王冠关于压缩即智能、数据三个阶段、产品内生数据、视频生成、领域语言、Agent 环境、模型/应用边界和生成系统的长访谈。文章把模型理解为快速的系统一,把产品系统二拆成状态表示、工具环境、评价器、反馈日志与可复用配方,并讨论平台从分销走向产销的条件与证伪路径。
#122 朱啸虎:泡沫、超级入口与 15 度偏差
深读朱啸虎关于 AI 泡沫、OpenAI 超级入口、群聊社交图谱、小模型、DeepSeek、token 消耗与 VC club deal 的访谈。文章把泡沫拆成使用层、生产层和资本层,区分供给紧张与投资回报,解释 15 度偏差如何成为寻找共识边缘机会的方法,并列出 DAU、留存、成本、现金流和退出数据的后续证伪指标。
#104 祝铭明:智能眼镜的窗口、操作系统与生态
深读 Rokid 祝铭明关于操作系统创业、阿里与 MLab、AI/AR 转型、显示型智能眼镜、巨头窗口、供应链、运行时和生态的长访谈。文章把硬件先发优势重构为产品定义时间、功耗/延迟等运行时质量、用户反馈与生态伙伴的乘积,并列出留存、退货、任务完成和开发者验证项。
#105 王忻:汽车从黑盒供应链走向数据驱动的数字豪华
深读奔驰王忻关于汽车技术周期、Tier 1 黑盒、数据主权、中国研发全球输出、L3、端到端、激光雷达冗余、安全测试和数字豪华的访谈。文章把中国速度与奔驰安全的张力拆成数据、软件、组织、法规和责任的联合系统,并把功能数量转向用户结果。
#107 梦秋:AI 应用还没有找到“让人兴奋的场景”
深读梦秋关于资本寒冬、DeepSeek、Bot、Agent、信息孤岛、具身智能、可穿戴设备和文化消费的访谈。文章把“模型更便宜”与“应用找到新需要”分开,解释情绪价值和工具价值的双轨、动态目标与垂直 Agent 的门槛,并给出需要、结果、状态和经济四层评估框架。
#108 余凯:从深度学习研究到机器人计算平台的三十年
深读余凯从物理、深度学习、工业实验室、百度到地平线的三十年口述史:解释 2B 同理心、技术品味、边缘计算、汽车作为第一机器人、早期广撒到 2019 年聚焦、融资漏斗和耐得寂寞的组织含义,并严格保留个人回忆与公司事实的边界。
#111 李一帆:激光雷达创业史——从昂贵传感器到安全基础设施
深读李一帆关于禾赛、激光雷达降本、早期商业失败、三人合伙、汽车客户、技术选择和产业机会的长访谈。文章把硬科技壁垒还原为设计、制造、供应链、客户反馈和组织治理的联合系统,并把 LiDAR 作为 Plan A+ 的安全论点拆成可验证的场景、消融与责任问题。
#114 殷一、欧迪:萨洛蒙如何从专业小众走向生活方式品牌
深读萨洛蒙、越野跑、小红书与女性消费的长访谈:把专业品牌的增长拆成专业核心、分阶段进入、社区表达和线上线下反馈闭环,并把种草还原为贯穿研发、设计、商品、门店与复购的组织过程;同时分析平台动机数据、女性化传播和 AI 产品如何获得具体场景与个性。
张小珺 YouTube 播客全频道目录与路线图
完整盘点 Zhang Xiaojun Podcast 官方 YouTube 目录:148 个编号正片(#1–#149,缺 #35)、30 个非编号上传、编号正片约 256 小时 52 分钟。页面将英文重发/投屏/纯享版与正片分开,逐期登记标题、时长、章节、主题和深读状态,并从节目顺序中分析频道如何从人物与商业口述史迁移到模型、Agent、机器人、Physical AI 与 AI for AI。
前沿大模型架构深读:从 DeepSeek‑V3/V4 到 Kimi K2.5/K3
完整核对 DeepSeek‑V3/V4、Kimi K2.5/K3 与 MQA/GQA/KDA/DSA 原始报告,统一解释 MHA、MQA、GQA、MLA、DSA、CSA/HCA、KDA 的状态、计算和失败模式。核心判断是近两年架构竞争已从单纯扩参转向序列—深度—宽度三维信息流治理:V3 压缩逐 token KV,V4 压缩时间轴并稀疏选择,K2.5 把重点放到原生多模态与 Agent Swarm,K3 用固定递归状态和周期性全局 MLA 混合。进一步审计 1M context、K3 2.5× scaling efficiency、视觉 RL 正迁移与 Agent Swarm 4.5× 加速的证据边界。
CoRT 深读:Counterfactual Replay 如何把 Rubric 信号分配到 Token
完整拆解 CoRT 的 rubric-conditioned GRPO、criteria-free counterfactual replay、tokenwise likelihood contrast、bounded response normalization 与 signed advantage redistribution。独立核验主表 26/28 个比较为正、简单均值约 +2.96 个百分点,并指出摘要 +4.4 的聚合口径未说明;附录显示局部格式/关键词约束可被集中定位,而全局语义约束仍然弥散,因此 CoRT 更像上下文敏感性 shaping,而不是完整的因果 token credit assignment。
RSIBench-Data 深读:数据研究 agent 已能发现改进,却还不会可靠递归改进
完整重建 RSIBench-Data 的问题定义、固定目标模型上的数据研究闭环、四套研究 agent、六类 benchmark 与 24 个主设置。核心判断是 14/24 的后续候选确实超过首次有效候选,但 18/23 在越过历史峰值后继续搜索并回落;这说明 agent 已有发现能力,却还缺可靠选择、回滚和跨任务泛化。进一步审计官方代码确认 selection 与 official evaluation 使用同一任务子集,新 E2B 沙箱不等于 held-out 评估;主实验也更准确地说是固定目标上的 data-factory 元搜索,而非严格递归自我改进。
自进化与 RSI 深读:三个循环,不等于递归自我改进
完整重建周星星《自进化(Self-evolving/RSI),一篇就够了》的 Artifacts / Harness / Model 分类,并逐项深拆四个核心工作:RHI 如何把 role、contract、hop 与交接信息流变成任务专用搜索对象;Ai2 如何用统一 K=5 和 held-out 拆分检验收益是否只是多次搜索;SIA 如何在外部 Claude 控制下先改 scaffold 再对 gpt-oss-120b 做 LoRA;Continual Harness 如何在不重置的 Pokémon 长程环境中在线生成 skill、再用外部教师训练模型。证据审计进一步揭示 RHI 的生命周期成本口径、SIA 的 test-split adaptation、Continual 的 26B/31B 附录矛盾与共同适应归因缺口;工程上更可行的是高频 Harness 探索、低频 Model 蒸馏的非对称双循环。
多模态 OPD 七篇工作深读:证据、监督与稳定性不是一回事
完整还原知乎“近期多模态推理 OPD”七篇工作,逐篇核对 Vision-OPD、Imagine-OPD、ViCuR、参数稀疏分析、GNDPO、PTD-PO 与 HyperEyes 的方法、主表、消融、限制和公开实现。核心判断是它们共同使用学生 on-policy 轨迹,却分别解决视觉聚焦、privilege 可恢复性、失败路由、梯度尺度、参数几何与搜索成本;真正统一的设计对象是教师优势来自哪里,而不是某个 KL/JSD 名称。进一步指出 HyperEyes 的 OPD 可归因增益约 1.3 点、事后稀疏 mask 不是预先可用训练配方,以及多项代码/数据/权重发布仍未闭环。
代码优化 RL 深读:真正被训练的不是“更短耗时”,而是一整条测量—奖励—更新链
完整核对《Reinforcement Learning for Code Optimization》125 页正文、附录、TeX 表格与关键一手来源。先重建 DMC-Optim、隔离计时、三类环境、collapsed binary reward、离线模拟器与稳定化 GRPO 的完整方法,再审计复现性和算法发现证据。核心判断是论文训练的不是绝对运行时间,而是同题同测试下可识别的速度偏序;主增益扎实,但公开版本尚无代码/数据,域外正确性并非完全无损,摘要 14%/28% 与正文 13%/22% 的复杂度比例口径也未对齐。
Graph Engineering:先看懂 Agent 工作流为什么从循环走向图,再谈它的工程缺口
面向没读过原文的读者,先用 bug 修复案例完整解释 agent loop 如何被拆成节点、边、状态、条件分支、并行汇合与人工审批,再进入代码审计。核心判断是外显控制流的方向正确,但公开“50 行引擎”仍缺少可运行的 fan-out / join、确定性合并与持久恢复语义;更可靠的架构是外层 workflow 管治理边界,内层 agent loop 负责局部探索。
PerceptionBench 深读:它测到的是原子视觉,还是困难样本的失误尾部?
完整核对 Kimi 发布帖、官方博客、19 页论文、3,000 行公开数据、评测代码与相关一手研究。核心判断是它没有提出新的视觉机制,而是一套面向当前前沿模型的困难残差测试:适合找盲点,不是稳定的视觉本体或跨代量尺。全量文本复算发现 77.5% 的参考答案只是 A–F 或 0–9 单字符,至少 38.23% 的题面含显式选择项;1,800 道拆解题只对应 1,413 个来源条目,720 题位于共享来源簇中。进一步分析推理轨迹忠实度、答案位置先验、来源聚类、幻觉决策阈值与原子分数的下游中介效度,并提出固定锚点 + 动态残差双轨评测。
原生多模态 Scaling Law 深读:测到的是通用规律,还是一条 MoE 配方曲线?
完整核对 HuggingPapers 发布帖、arXiv v1 正文/附录/TeX、全部拟合图与下游结果,并与 Chinchilla、两项原生多模态 scaling law 及数据混合研究交叉审计。核心校准是论文的 multimodal objective 只对图像条件下的文本 token 计算损失;复核确认其图文目标随配比上升相对更 data-hungry,但低配比下仍比语言目标更偏参数,且既有 MoE 研究给出相反指数方向。进一步复算语言平均分、21 项 few-shot 结果与 Pareto 外推,指出 3B 的 3-shot 平均 +2.43pp 同时在 CountBench 下跌 10.43pp,而所谓精确可部署前沿最远外推到观测算力一万倍之外。
Kimi K3 技术报告深读:2.8T 只是表层,核心是三维信息流与系统协同
逐页核对 Kimi K3 47 页技术报告、官方博客、公开权重与配置、许可证、部署文档及 AISI / CAISI 独立安全评测。核心判断是 K3 用 KDA + 周期性 MLA、Block AttnRes、Stable LatentMoE 分别重构序列、深度、宽度信息流,并让长程 RL 与推理系统围绕状态、专家和环境协同;复算 104.2B 仅占 2.78T 的 3.75%,50 个子指标中 agentic / coding 强而 reasoning 仅 2/5 进入前二。进一步指出 2.5× 是缺少原始拟合点与组件消融的发布方 scaling claim,1M raw context 未胜 300K compaction,公开主仓库也未包含报告中的 EAGLE-3 / MTP 草稿模型。
Credit Assignment 深读:长程 Agent RL 真缺的是分数,还是可重放的状态?
完整核对 haotian 的原文、SWE-bench 环境恢复回复、PivoARL、PivotRL、ReOPD、TreeRL、EVPO、SAO 与 TITO 原始说明。核心判断是 outcome reward 确会让失败轨迹中的正确前缀承受同一负 advantage,但 Prefix Replay 只是一种训练接口:四项工作分别优化局部回报、重试回报、教师 KL 与树节点价值,不能因都复用前缀就视为同一证据。进一步指出 SWE-bench 的真正瓶颈是恢复文件系统、进程与工具状态并校准局部 verifier;EVPO 只保证特定假设下的 baseline 方差,不支持“任意 partial credit 都安全”。
SAI × ICML 2026 深读:只有 7 篇撑住,还是只有 7 篇可验证?
完整核对 Chenhao Tan 的 X Article、作者回复、六张首发图、SAI 168 篇动态面板与代表性逐篇报告,并通读 VERITAS、MechEvalAgent、OpenAIReview 的方法和限制。复算 105 篇得分中位数约 20.5%、均值约 28.4%,确认 27 篇超过 40%、7 篇超过 80%;同时指出 105 篇按资源成本选择、得分混合结果冲突与工件/协议失败、78% 是人类共识问题召回率而非 precision,8,900 美元成本图只覆盖 105 篇且与正文对失败尝试成本的描述冲突。核心判断是这项工作足以证明执行式审查的必要性,却不足以推出“ICML 只有 7 篇可信”。
Zhang Xiaojun Podcast 四十九期深读:AI 时代真正稀缺的是可验证的系统
综合 121:06:52、49 期 Zhang Xiaojun Podcast 深读:把机器人策略、数据、世界模型、前沿训练、Agent、模型架构、Physical AI、AI Native 产品、模型公司、资本、在线学习、推理时计算、企业级 Agent、具身原生、开源 Infra、AI for AI、品牌、汽车、硬科技与 AR 硬件放入同一张任务—模型—环境—状态—硬件—产品—组织—治理系统图;本轮进一步把每期笔记改成先完整重建原文、再做证据审计和独立判断,区分嘉宾主张、公开事实与本文推断。
吴翼访谈深读:o1 的关键变化,是把算力预算移到推理时
完整梳理并二次深读吴翼 1 小时 14 分钟 o1 解读:从预训练第二座矿山、RL 的奖励/搜索/任务三件事,到推理时计算、长上下文、Chain of Thought、反事实探索、安全、泛化和 OpenAI 研究组织;新增训练时/测试时算力双账、reward 任务边界、CoT 证据边界与推理验收协议,严格区分官方披露与嘉宾推断。
肖弘 Manus 三小时访谈深读:不要线性外推,成为博弈中的重要变量
完整梳理并二次深读肖弘 3 小时 22 分钟、跨两个录制阶段的创业访谈:从微信插件治理、产品化等待与资本选择,到 GPT-3、Monica、模型商品化、DeepSeek 和 Manus 的 Agent 环境;新增选择权账本、技术事件四层翻译与 Agent 责任运行时,强调可承受成本下提前准备、保留反事实和可逆环境。
广密大模型季报 #112 深读:模型差距收敛之后,竞争进入 L4 体验
完整梳理并二次深读广密 1 小时 09 分钟大模型产品化季报:分析模型分化与收敛、ChatGPT/Google 全家桶、垂直应用窗口缩短、API 成本、Deep Research/Claude Code 的 L4 体验以及中国团队全球化;新增 L0–L4 结果验收、平台窗口四状态与证据账本,后编辑率、接管率和严重错误比生成速度更接近生产力。
广密大模型季报 #127 深读:AI War 的真正战场是算力、流量与在线学习
完整梳理并二次深读广密 1 小时 18 分钟跨年大模型季报:把 AI War 还原为资本、算力、分发与反馈的协调论,比较 GPU/TPU 联盟与 GPT/Claude/Gemini 轮换领先,拆解基础模型—应用层迁移、知识工作 L3/L4、机器人数据和在线学习控制回路。新增参数/记忆/策略三层更新、Agentic Web 控制面与证据账本;收入、ARR、公司名单与概率均按嘉宾估算或推断处理。
UniVR 深读:视觉空间推理,还是视觉轨迹策略学习?
二次完整核对 UniVR 论文、附录、SFT/RL 数据路径、代码、模型与 VR-X 发布物:将其定位为目标条件下的视觉观察轨迹/策略学习,而非已识别的动作动力学世界模型;推导 Rg−2|Rg−Rs| 的分段几何与共同盲点,拆解 Step-Focal 的长程信用分配价值;复算 VR-X 增益、全配对成本和数据表统计,并审计公开 SFT 默认监督逐帧 caption/final answer、公开 RL 缺失论文 CLIP 方差选择器、单一 train split 与训练配置不一致等关键复现边界,最后给出八项可证伪实验。
Red Queen Gödel Machine 深读:评委也进化,目标还可靠吗?
完整核对 Yi Lu 发布帖、RQGM 38 页 arXiv v1/附录/TeX 与 Cambridge 作者技术博客:解释固定 epoch、anchor best-belief、选择性擦除和指数检查点如何让 learned evaluator 受控换届;复算编码 119/166 对 116/166、写作面板 1.78–1.86×、grader +9 个百分点与 reviewer 1.91× 口径。核心判断是方法建立了评价语义版本化的实用协议,但主结果来自单次短搜索、单一模型与模型评委,理论只保证 epoch-local 有效性,anchor 仍同时构成防漂移地板与能力天花板。
RLM Harness 深读:把长任务改写成同分布小调用
二次深化核对 Alex Zhang 与 Omar Khattab 的 harness 组合泛化实验、九对成功轨迹、RLM/prime-rl 信用分配与公开 LoRA:解释最终组相对 reward 如何只训练根模型 action token,校准 8–32× 与约 10× eval lift,并指出跨域实验存在长度/难度联合移位。核心判断是 harness 已展现可训练的高层归纳偏置,但所谓等价类实际依赖 harness、策略与采样,近似邻近不天然满足传递性;LID 只由根轨迹词面代理,成功最近邻存在选择偏差,系统预算、全量轨迹、精确配置和独立复现仍未闭环。
Loopie 深读:循环 MoE 真正赢在复用参数,还是复用硬件效率?
以 arXiv v2 为当前版本重新审计《Loop the Loopies!》,逐文件比较 v1/v2 后发现:v2 删除“最强循环 Transformer”与 IMO/IPhO 金牌表述,并撤下整段奥赛章节和六题附录,且未说明原因。深入复算 27 层×2 次 layer-loop 的资源转换链,撤回用 1.424× 代理与 1.379× 吞吐反推 step time 的伪精度;若 Qwen3-like 基线沿用官方 attention 形状,更细的线性层计算代理约为 1.23×,而标准 KV cache 每 token 可能约为基线 2.53×。同时审计 3T/2.28T 预训练口径冲突、2T SPT 的 nominal/target token 歧义、约 1.49 万次更新、scaling ladder 与 R=2 证据边界。核心判断是 Loopie 已证明特定训练栈上的系统共设计价值,但尚未证明推理部署优势。
Self-Improving Agents 综述深读:真正的分界线是经验能否跨任务写回
深度解读 Self-Improvements in Modern Agentic Systems 97 页综述:指出原更新算子只定义持久适应、未形式化保证提升,引入独立 promotion gate 与受保护治理状态 Γ;以七篇原论文区分瞬时 refinement、episodic adaptation 和跨任务写回,审计当前 245 条方法清单的类别、年份、代码覆盖、重复与链接错配,并提出多轴 change manifest、统计准入门槛、两速学习和 skill 部署契约。
LLM 记忆系统深读:容量不是瓶颈,寻址与写入才是
串联 Latent Rishi 清单中的六篇记忆研究:从约 3.6 bits/parameter 的经验容量、Active Reading 的合成写入、Cartridge KV 编译,到固定 keys/稀疏 values、CAS 多文档联合训练与 Cartridge RAG。核心判断是可用记忆的首要瓶颈是寻址、隔离、写放大和生命周期治理,而非单纯参数容量;笔记同时复算 membership 外推误差与 CAS 数据表不一致,并给出原始证据—检索—编译缓存—稀疏巩固的分层架构。
CriPO 深读:Rubric RL 缺的不只是探索,而是信号不被标量吞掉
完整核对 CriPO arXiv v2 的 18 页正文/附录/TeX、v1→v2 修订、RaR 公开数据、HeRL 官方论文与代码、SDPO 及同期 rubric-conditioned self-distillation:解释 Unexplored / Suppressed Criteria 如何分别触发局部 forward-KL 与反事实 token advantage flipping。复算两种 Qwen3 规模对 GRPO 为 10 胜 0 负,但四组完整训练 wall-clock 平均多 19.2%,达到 GRPO 最终表现的提前量从 2.56× 到几乎持平;同时指出完整回答进入教师使定位属于后见编辑显著性,Science hard split 仅保留约 59.5%,负 Pitfall 权重映射、单 seed、置信区间和官方实现仍未闭环。
LLM-as-a-Coach 深读:把评分改成经验,真能替代标量奖励吗?
二轮完整审计 X 发布帖、arXiv v1 全文/附录/TeX、OPCD/OEL、Rubrics as Rewards 与官方仓库:在复算 EL 相对 10 级 GRPO 为 18 胜、1 平、1 负之外,逐公式拆解 semi-gradient、同题后见经验与未归一化 student-top-256 伪 KL;推导 Figure 4 的台阶来自预设的 5 档奖励,不能证明标量奖励的数学上限。核心判断是 EL 是有效的 privileged-context distillation recipe,但可迁移性、高带宽贡献、等计算优势和 reward-hacking 缓解仍需 experience-swap、连续/多维 reward、完整 KL、隐藏人评与预注册 checkpoint 才能成立。
One Layer Deeper 深读:测试时多跑几层,为什么不是简单加循环?
深度审计 Core Automation × Tilde Research 的 One Layer Deeper 竞赛:解释权重共享循环、信用分配与测试时扩深,并进一步计算固定模数的 Carmichael 周期、输出像空间和跨深度初值覆盖率,指出公开 OOD-depth 可能混入有限群周期、seen-x 记忆与十进制解码捷径;以二维留出、循环剂量反应、状态因果干预和等预算基线给出可证伪的深度外推标准。
吴明辉访谈深读:企业级 Agent 的护城河是数据上下文与可信行动
完整梳理吴明辉 3 小时 47 分钟企业 AI 口述史:从广告测量、明略科技与明链数据,到 DeepMiner、Foundation Agent、GUI/Browser 操作、数据挖掘、可信 Agent、多智能体组织与 SECI 知识循环;核心 insight 是 Y=F(X) 中的企业私有 context 比通用模型更稀缺,Tool Use、人机协同、身份信用与专业 Agent 组合才构成可交付的可信生产力。
李想第二次访谈深读:CEO 大模型、VLA 与可信的 AI 终端
完整梳理李想 2 小时 46 分钟访谈:以 CEO 大模型和技术/战略/组织 MoE 为入口,拆解信息工具到生产工具、AgentOS、32B 到 3.2B VLA 蒸馏、动作后训练、交通世界模型、云边协同、组织能量与 Agent 信用;结合理想汽车官方年报和业绩披露,提出 AI 的终点不是更会说,而是能负责地做。
张月光访谈深读:AI Native 不是加一个模型,而是重写上下文与结果
完整梳理张月光 3 小时 14 分钟访谈:从元音停服、妙鸭写真业务与串型模型管线,到 One Way Door、AI Native 上下文设计、AI 组织、AI companion、内容平台、游戏与 Dokie Agent;核心判断是 AI Native 的最小单位不是功能,而是一次让用户无法回到旧流程的结果改善,Agent 还要区分替人自动化与扩展人的创造能力。
智谱张鹏访谈深读:IPO 不是终点,而是 AGI 开路的工程承诺
完整梳理张鹏 2 小时 26 分钟访谈:从清华认知智能、Paper to Project、GPT-3 与 GLM-130B,到 ChatGPT 冲击、Scaling Law、DeepSeek、开源/闭源与香港上市;区分研究、工程、商业交付和组织规模的约束,提出 IPO 是时间预算、开源降低协作摩擦、认知智能的可操作核心是错误修正、垂直模型的护城河是环境与反馈等 insight。
季逸超 Manus 最后访谈深读:Agent 公司的护城河是可逆产品与环境
完整梳理季逸超 3 小时 31 分钟收购前访谈:从 iOS 浏览器、搜索与自研 NLP 的早期经历,到 Monica 正向现金流、Manus 的云端沙盒/异步长任务/通用 Agent,拆解 Model—Environment—Feedback 的产品策略、Context Engineering、KV cache、文件系统记忆、错误恢复、RLI 式结果评价、制造业经济和小团队取舍。核心判断是 Agent 公司的壁垒不是拥有一个模型,而是可逆的产品迭代、行动环境、失败数据和可验证的高价值任务;后续收购只作为时间线,不倒灌为当时的必然性。
印奇访谈深读:AI 2.0 不是模型升级,而是公司与终端的重组
完整梳理印奇 2 小时访谈:从阶跃星辰与千里科技的双重身份出发,解释 AI 1.0 到 2.0 的脑—身闭环、基础模型与汽车/终端、数据—资本—人才—产品长链、旷视时期的战略反思、技术信仰与价值务实、组织重建以及未来五年的学习/记忆/世界模型预判。特别标注公开转录音频 2:01:28 与 YouTube 目录 1:58:15 的媒体边界差异。
Freda 投资札记深读:Token 不是产品,结果与组织才是单位经济
完整梳理 Freda Duan 1 小时 23 分钟访谈:建立用户数×任务数×token/task×价格的 AI 单位经济分解,解释 Tokenmaxxing 与结果定价,审视 Coding 递归、UI/结构化软件的暴露面、决策上下文、接力赛到篮球赛的组织重构、Agent 基础设施、资本开支、裁员/通缩与人的连接。核心 insight 是 token 是工业成本账本,不是价值本身;AI 扩散的瓶颈从信息传递转向组织重构、责任和结果。
戴雨森访谈深读:从 DAU 到任务完成,Harness 正在成为 AI 时代的操作系统
完整梳理戴雨森 2 小时 18 分钟访谈:从上一期预测被市场反驳出发,拆解 Model—Context—Harness—Runtime 的产品栈、Coding Agent 的高质量反馈、DAU 与 agentic hours 的指标迁移、AI 三阶段、AI-native 组织和中美创业差异。核心判断是 AI 时代的价值单位从注意力迁移到任务完成、状态迁移成本与可复用反馈;模型像处理器,Harness 像操作系统,但其独立护城河仍需用真实任务、成本、权限与长期留存验证。
张祥雨访谈深读:多模态的下一次跃迁需要视觉推理与行动底座
完整梳理张祥雨 2 小时 28 分钟多模态研究访谈:从 ResNet 与视觉 scaling、Step 1/Step 2 的统一模型尝试,到 o1、RL、Meta-CoT、视觉生成、视频/具身数据、层级记忆、在线学习与世界模型;明确区分内部实验重构、OpenAI/StepFun 官方公开资料和嘉宾预测。核心 insight 是多模态的下一次跃迁不只是接入更多模态,而是建立可迁移的视觉动作空间,让模型能够观察、操作、验证、反思与回退;长上下文解决存储,层级记忆才解决使用。
杨植麟访谈深读:Agentic LLM 的瓶颈不是调用工具,而是可泛化的环境学习
完整梳理杨植麟 1 小时 41 分钟访谈:从 AGI 的无限山、Reasoning RL 与 Agentic RL 的 test-time scaling,深入 Kimi K2 的 1T MoE、32B active、15.5T tokens、MuonClip、MLA 与 agentic-first 训练,再分析数据墙、token efficiency、Agent 评价泛化、开源/产品边界、多模态与组织 RL。核心 insight 是 Agent 的竞争不在于能否调用工具,而在于能否在陌生工具、长任务和不完美评价器中持续学习、验证和泛化;早期 token efficiency 倍率与时间预测均保留为创始人口径。
谢青池访谈深读:AI 范式史不是模型年表,而是基础设施的接力
完整梳理谢青池 4 小时 22 分钟论文与模型范式史:从 GPU/Brook、AlexNet、Seq2Seq、Attention、ResNet、Transformer、GPT-1/2/3、Scaling Law、Chinchilla、ZeRO、InstructGPT,到 ViT、CLIP、Latent Diffusion 与 DiT;以模型—数据—计算—infra—评价五力解释为什么范式会延迟兑现,并把论文阅读转成边界、等待和产品判断。由于字幕 speaker diarization 不可靠,正文不强行归属每句对白。核心 insight 是 AI 历史真正接力的是可扩展的资源与反馈,而不是论文名字。
杨松琳访谈深读:注意力的下一场竞争是状态、硬件与评测的共同设计
完整梳理杨松琳 1 小时 43 分钟访谈:从 Kimi Delta Attention、Gated DeltaNet、Delta Rule 与 Full/Linear/Sparse/Hybrid Attention,追到 MiniMax M1、DeepSeek Sparse Attention、MoE、FP8、kernel 与硬件协同;严格区分 Kimi Linear 官方公开的 KDA/MLA、48B/3B、KV cache 与吞吐结果,以及嘉宾关于 3:1 层比、模型回退和国内架构创新的口述。核心 insight 是注意力的竞争单位不是单一模块,而是有限状态、长程依赖、硬件执行与等预算评测共同构成的系统可行域。
Understanding Reasoning 深读:预训练决定 RL 的起点,也塑造它的学习速度
逐页复审 Shen 等人的 37 页预训练—RL 联合 scaling 研究:还原 54B-token 棋谱、十种模型规模、36 条 GRPO 曲线与 OLMo-2 数学迁移,并审计局部斜率的 sigmoid 工作点混淆、未完全嵌套的 run-level LOO、三阶段 FLOPs、完整六类策略迁移和多条作者 / 读者解读。进一步核对公开代码、数据与新增墙钟估计。核心判断是 pretraining loss 的域内预测证据较强,但“RL 无法补偿弱预训练”只在已观测算力窗口成立;token 的因果解释、20%–28% 精确端点及“尾部发现等于创造新能力”同样不成立。
MOSS-TD × SGLang Omni 深读:90 分钟多说话人 ASR 如何真正跑起来
完整核对 Yichi Zhang 的 X Article、MOSS-TD 技术报告、模型卡、SGLang Omni 源码与相关 PR/issue:解释 0.9B 模型如何在 128K 上下文中联合生成文字、说话人和时间戳,以及 encoder graph、异步解码、chunked prefill、缓存和流式输出如何随音频长度改变收益。复算单卡 H100 的 379.5/97.5 audio-s/s,指出短音频结果与官方 cookbook 相差约 4.6 倍、基准未钉版本且数据私有;更关键的是默认输出预算仍可能静默截断长转写,贪心解码也存在非语音循环。核心判断是 90 分钟输入能力与高吞吐已经成立,但默认生产闭环仍需时长感知预算、尾部护栏和可复现基准。
Value Leakage 深读:模型的‘好价值观’为什么会悄悄改写客观答案
完整核对《Value Leakage》arXiv v2、107 页正文与附录、官方代码、数据说明和结果浏览器:解释反事实答案分布如何识别模型价值对用户无关任务的隐性干预,拆解 Donation Bet、公司相关回答、Agentic Grading、Job Offer 与随机活动选择实验,并区分分布级偏差、单次回答归因和推理披露。核心判断是论文给出了多任务、多模型的价值泄漏证据,但不能据此给模型作统一排名,也不能把摘要式 CoT 当成可靠的因果解释。
HalfLife 深读:开放评论能否污染语言模型预训练数据?
完整核对《Pretraining Data Can Be Poisoned through Computational Propaganda》正文、附录、TeX 源与关键前置研究:解释 HalfLife 如何拆解评论注入、抓取和过滤三段概率,复算 0.13% 纳入估计与受控模型偏好移动;指出 250 文档阈值来自触发式 DoS 后门而非本文信念操纵、正文与附录 WARC/页面统计冲突、S1 将评论存在近似为可注入、SFT 后效应明显衰减且缺少多 seed/置信区间。核心判断是论文确认了片段级数据供应链攻击面,但尚未完成真实网站到前沿模型的端到端攻击闭环。
LatentMoE 深读:Kimi K3 与 Nemotron 3 Super 真走上了同一条路吗?
从青稞社区的 X Article 回到 NVIDIA LatentMoE 论文、Nemotron 3 Super 技术报告与 Kimi K3 官方博客:解释 routed width 如何从主干 hidden dimension 解耦,区分 efficiency / accuracy 两种变体,复算 95B 主表增益与 H100 五档并发吞吐,并指出 350B、3.46× 与 9% 均来自万亿参数模拟而非真机。核心判断是 K3 与 Nemotron 方向相似,但 K3 的 Stable LatentMoE、Quantile Balancing 与 2.5× scaling efficiency 在技术报告和权重发布前仍属发布方报告,不能认定为同一实现。
视频模型 RL 后训练深读:真正的瓶颈不是优化器,而是奖励能否代表世界
完整核对 Anirudha Majumdar 的《Understanding Video Models: Part III》、八篇核心论文、附录与五个官方实现:从隐式 DPO reward、GRPO 终局信用分配和局部 SDE-KL,追到 24×A800、64×H800 等真实训练协议;揭示 VideoAlign 将运动幅度写入 MQ、训练裁判与报告指标耦合等实现偏置,并用 SAGE-GRPO 的 off-manifold 探索反证和 SoliReward 的 reward-utility 反例,重构为“测量—探索—更新—独立验收”的闭环稳定性问题。
Self-Guided TTT 深读:长上下文真正缺的不是窗口,而是可信训练信号
深度解读 Meta AI 与 UVA 的 Self-Guided Test-Time Training:还原模型自选证据 span、query-projection LoRA 临时适配与全文回答流程,复算摘要中的最高 15% 实为 30.7→35.3 的 +4.6pp;逐项审视 oracle 诊断、八格主结果、21.5%–39.9% 开放问答 fallback、注意力案例和 H200 相对延迟,并指出缺少选段 prompt、代码、逐桶样本量、置信区间与绝对成本。进一步提出 S-TTT 是证据放大器与实例级课程设计器,生产化必须加入更新门控、adapter 作用域、污染测试和不训练的同预算基线。
Agents-A1 深读:35B 不是打败 1T,而是在系统预算下重画能力边界
深度核对 Agents-A1 主帖、arXiv v2、TeX 源码、35B/4B 配置与公开评测仓库:解释 KAG、约 45 亿 SFT trajectory tokens、分领域教师与 domain-routed OPD;用反例揭示 SVA 截断 KL 可在 teacher top-k coverage 很低时仍为零,区分过程信息进入上下文、奖励与 token loss 的不同通道。进一步复算 OPD 相对全域 SFT 在 16 项中提升 15 项,并审计新发布 4B 在 XBench、VitaBench、MatTools 等任务追平或超过 35B,以及 pass@1/retry@5、模型卡版本漂移、工具预算和训练资产缺失。
LOTUS 深读:并行潜变量推理真正压缩的是什么?
深度解读 LOTUS:把可变长显式 CoT 改写成固定 K×c 潜变量工作区和 R 轮循环深度,拆解主 LM head 的并行 step loss、answer loss 与 parallel chain likelihood,复算 3B GSM8K 准确率、2.5×/6.9× 思考延迟和可读 latent 结果;结合论文附录、训练 curriculum、官方代码与 HF checkpoint 集合,指出并行只消除了 token 解码轴、readout 不等于因果忠实性、自然语言 stress test 换用了更宽 latent block、固定预算缺少自适应停止,以及所谓超长链自回归回退尚未在公开推理路径中实现。
王鹤访谈深读:具身智能从学术边缘走向资本中心,真正稀缺的是不砸行业招牌的生产力
完整梳理王鹤 2 小时 38 分钟访谈:追踪具身智能从计算机视觉的 passive perception 走向 perception–action loop 的学术史,解释人类视频交互、类别级位姿与合成数据的连续问题,分析软硬件螺旋、生产力即产品、遥操作与资本泡沫。核心 insight 是必须把研究成功、演示成功、部署成功和规模化生产力分开,用连续运行、人工介入、单位产出和跨场景复测守住行业信用。
谢晨访谈深读:机器人数据荒的核心,不是小时数,而是可迁移、可评价的经验
完整梳理谢晨 1 小时 41 分钟仿真与合成数据专访:把 Sim2Real、Real2Sim、资产/场景、物理 solver、API、质检和真实回归串成一条生产线,比较自动驾驶与具身在跨本体、物理交互和 RL 并行上的差异,分析数据金字塔、跨宇宙泛化、Meta/Scale 资本叙事与客户 reward。核心 insight 是仿真不等于仿真器,合成数据的价值应按减少了哪类真实失败来计量。
刘先明访谈深读:拆掉 Language 之后,小鹏如何把智驾重写成 Physical AI
完整梳理刘先明 1 小时 48 分钟访谈:解释从 Software 1.0/1.5/2.0 到端到端、拆规则/拆 loss/拆 Language 的技术判断,拆解主机厂数据闭环、云端—车端 scaling、Physical AI 的硬件/芯片/模型/数据乘法因子,以及世界模型、实时性、安全下限和组织承压。核心 insight 是接口删除不会消灭复杂度,只会把责任迁移到数据选择、硬件协同、回归评测和安全治理。
谭捷访谈深读:机器人真正的拐点,是跨本体数据与可用的世界模型
完整梳理谭捷 2 小时 6 分钟访谈:从图形学、Sim2Real 与数据金字塔出发,拆解机器人基座模型尚未完全独立的原因,分析 Gemini Robotics 1.5 的 Thinking、跨本体 motion transfer、ER/VLA 双层、世界模型与触觉阶段性约束。核心 insight 是机器人规模化的中间层不是更大的脑,而是能把经验从一个身体迁移到另一个身体、同时保持实时性和安全边界的可评价数据系统。
郑博元访谈深读:Kimi K2 之后,Agent 竞争进入系统工程
完整梳理郑博元 2 小时 20 分钟技术报告导读:统一定义 Coding、Search、Tool Use、Computer Use Agent 的观察—行动闭环,比较 Context Engineering 与端到端训练,逐层拆解 Kimi K2 的知识重写、工具/任务合成、verifiable 与 Rubric reward、RL rollout 和安全工程,再对照 ChatGPT Agent、Qwen3-Coder、Manus 的行动空间、环境基础设施与 KV Cache/Filesystem 记忆管理。核心 insight 是数据合成正在成为训练编译器,环境是被低估的训练硬件,Context Engineering 本质上是状态治理。
姚顺宇旧访谈深读:Agent 下半场的核心是上下文、任务与评估
完整梳理姚顺宇 2 小时 31 分钟旧访谈并对读《The Second Half》:从 WebShop、ReAct、代码 affordance 与真实环境出发,区分知识/策略/规格泛化,建立可靠性—创造性、深度—广度评价矩阵,分析长期记忆、内在奖励、数据飞轮、创业接口、中心化与多样性。由于本期逐句材料没有可靠说话人分离,正文不强行标注身份。核心判断是模型能力的下半场首先是任务规格、环境和现实效用的下半场。
广密访谈深读:Coding 不是垂直场景,而是 AI 的第二幕加速器
完整梳理广密 1 小时 22 分钟全球大模型季报:把 Coding 解释为代码—执行—测试的短反馈闭环和 AI 的二阶加速器,比较 Anthropic、OpenAI、Google、Meta、xAI 的组织聚焦与路径依赖,拆解 Harness Engineering、模型 OS、白领通缩、初级岗位学习阶梯和投资叙事。所有公司、收入、token 和市场判断都按嘉宾观察或预测处理,不替代财务事实或投资建议。
苏煜访谈深读:Agent 不是新物种,而是正在学会成为专家的运行系统
完整梳理苏煜 2 小时 17 分钟访谈:从逻辑 Agent、神经 Agent、语义解析到 Language Agent 的技术史,拆解语言作为感知—推理—行动与记忆压缩的脚手架,解释 Coding 为何成为数字世界的通用接口,追踪 OpenClaw Moment、浏览器/桌面/CLI/API 的统一行动空间,以及专家化智能、世界模型、持续学习和权限经济。核心 insight 是 Agent 的竞争单位不是单次模型回答,而是能否在具体工作世界中持续获得反馈、压缩经验并可靠承担行动后果。
Anker 阳萌访谈深读:成熟公司转向 AI,难点不是模型,而是能力迁移
完整梳理阳萌 3 小时 37 分钟访谈:从 Google、Amazon 与五系品质品牌,讲到浅海/深海、1357 用户分层、2022 多产品线失败、七系转型、NOR Flash 存算一体芯片、端侧安防、机器人、第三类公司和企业 Agent;结合 2025 年报、官方芯片资料与 CPSC 召回记录,提出用户邻接×技术邻接的品类框架,解释专用芯片如何用通用性换能效,并指出 10 万亿 token 是燃料表而非生产率、价值观必须通过召回与停止权变得可证伪。
SpaceX 洪力德访谈深读:可回收火箭只是起点,真正的产品是工程反馈系统
完整梳理洪力德三小时 SpaceX 口述史:从跨行业制造、Falcon 1→9→Starship、高 SKU 生产、高压容器内制、Musk 第一性原理与 2015/2016 事故,延伸到 NASA COTS/CRS、垂直整合、商业航天权力和太空数据中心;用 NASA、FAA、FCC、SEC 与 SpaceX 一手资料校准关键时间和监管口径,并提出复用运营函数、接口压缩、验证性原理、政府市场架构与太空算力热/维护约束等独立判断。
Carina Hong 访谈深读:证明不是终点,规格才是
完整梳理 Carina Hong 4 小时 23 分钟访谈:从数学直觉、MIT/Oxford/Stanford 跨学科路径到 Lean/Mathlib、AxiomProver 的模型—工具—搜索—验证—库系统、猜想生成、代码验证、团队与登月文化。逐项核验 Putnam 2025 官方仓库并纠正宣传口径:12 题最终均有公开可检查证明,但比赛截止时为 8/12,其余四题赛后完成。核心判断是 AI for Math 是规格编译器栈;kernel 保证相对形式命题的推导,不保证自然语言翻译、现实规格或问题意义。
罗福莉访谈深读:Agent 框架正在成为新的训练对象
完整梳理罗福莉 3 小时 34 分钟访谈:从 OpenClaw 高强度体验、harness 对弱/强模型的不同作用、skills 作为可执行组织记忆,到 MiMo-7B 与 MiMo-V2-Flash 的 hybrid attention、MTP、long context、MOPD、Agent RL 环境,延伸至多 Agent 的等预算问题、统一多模态、无组无职级的隐性权力和 AGI 概率更新。核心 insight 是模型与框架将协同进化;post-training 的稀缺品最终会从 GPU 迁移到真实且不易 reward hack 的 evaluator。
姚顺宇访谈深读:Benchmark 之后,真正稀缺的是任务规格
完整梳理姚顺宇 3 小时 48 分钟访谈:从非厄米 skin effect、高能理论的反馈困境到 Claude 3.7 的环境化后训练、Coding 验证器经济、预训练是否撞墙、Gemini long horizon、有限训练/近无限使用、机器人 scale-up、Anthropic 与 Google 的条件化组织最优、集体主义工程和 24 小时面试风险。核心判断是竞争正从能力发现迁移到规格发现;长程 Agent 的本质是信息预算治理,算法则是数据、FLOPs、infra 和 production constraint 下的系统控制器。
谢赛宁七小时访谈深读:表征、世界模型与 AMI Labs 的反向 OpenAI
完整梳理谢赛宁 6 小时 44 分钟访谈:从交大 ACM 班、屠卓文、何恺明与李飞飞,串起 DSN、HED、ResNeXt、MoCo、MAE、ConvNeXt、DiT、Cambrian、REPA 与 RAE 的表征学习主线;严格区分语言作为文明压缩/沟通接口、世界模型的状态—动作—后果内核与视频 world simulator,并审视预测安全、下载人类、AGI/松鼠智能、AMI Labs 反向 OpenAI 数据联盟、研究自由和正式融资。核心 insight 是“寻找梯度”同时统一了他的研究方法、表征观与创业模型,而 state 充分性、数据治理和组织证伪机制才是路线的关键考题。
谢晨访谈深读:机器人数据的终局不是数据集,而是评价环境
完整梳理谢晨关于机器人数据与仿真的 2 小时 37 分钟访谈:从 Cruise/NVIDIA/蔚来经历、静态数据集到系统中心数据引擎、纠错轨迹、可规模化评价、World Model/VLA/LLM 共生、真实—仿真—人类视频金字塔、价格与 Lightwheel Data Engine,解释为什么评价器同时是闭环控制面和课程生成器;对称审计真实数据商与仿真商的利益叙事,并纠正 Generalist 27 万小时数据并非官方定义为 UMI、BEHAVIOR 26% 需按首届榜单口径核验等易误传说法。
高继扬访谈深读:GALAXEA 的整机—数据—模型闭环
完整梳理高继扬 3 小时 4 分钟访谈:从 Waymo VectorNet、Momenta 量产交付到 GALAXEA R1/R1 Lite、真实数据成本与 recipe、Carry/Pick/Pack/Fold/Operate 场景筛选、G0 VLM+VLA 双系统、开发者市场、许华哲离开、传播周期、组织高压与万台生产力目标;结合 G0 仓库、项目页、论文和 Waymo 一手资料,指出真正护城河是整机—数据—模型—渠道—场景的复制时间栈,而出货、客户数、融资和精选 demo 都不能替代长期生产运行账本。
何小鹏访谈深读:IRON、VLA 与一次 Physical AI 组织换轨
完整梳理何小鹏 1 小时 26 分钟访谈:复盘 2025 年第一代 VLA 停止与组织重组、第二代 VLA 的范式替换,追踪 IRON 从探索到量产目标、拟人化设计、柔性皮肤/热管理、恐怖谷和舆情信任,审视 20% 胜率、20–100 倍汽车难度、80% 硬件自研、GX/Robotaxi/L4、销量归因和软件价值;结合 XPENG 2024–2026 官方资料,指出 Physical AI 的真正竞争是能力、尾部安全、场景覆盖、制造可靠与法规可售构成的联合可行域,AI-native 首先是组织与反馈闭环。
柯丽一鸣访谈深读:Physical Intelligence 的真正赌注
完整梳理近四小时访谈:从柯丽一鸣的竞赛、博弈论、模仿学习与强化学习经历,解释传统规划控制与数据驱动机器人的成本曲线之争;系统拆解 PI 的 π0 能力、π0.5 开放环境泛化、π*0.6 真实经验闭环与录制后 π0.7 多模态上下文 / 组合泛化,进一步审视真机数据、奖励与归因、throughput 评估、跨本体非人形路线、合作伙伴组织模式和中美软硬件优势,并区分官方证据、访谈立场与尚未证明的外推。
Agent Swarm 深读:多角色辩论何时增智,何时只是昂贵的共识剧场
深度解读《A Swarm of Agents for Multi-Angle Analysis》:还原 orchestrator、隔离专家、单轮辩论、反方审查与低温合并五段式架构;结合 self-consistency、MAD、DMAD、置信度与多样性、等 thinking-token 预算和 debate collapse 研究,解释上下文隔离为何不等于认知独立、错误相关性如何侵蚀有效专家数,以及为什么开放决策的最佳产物常是下一项消歧实验;同时审计第三方代码镜像并给出可验证的生产协议。
Context Rot 深读:长程搜索 Agent 为什么会被自己的历史拖垮
深度解读 Diagnosing and Mitigating Context Rot in Long-horizon Search:还原四模型、三 benchmark、六类终态与七种上下文治理方法,拆解长轨迹如何把失败叙事变成行动先验,逐项核验摘要、裁剪、子 agent 隔离和八轨迹 rejection sampling 的准确率—rot—未完成率权衡;结合官方代码审计指出指标故障转移、不确定性洗白、plurality 投票、计数口径和原始结果缺失等边界,并提出事件日志、结构化证据账本与活跃工作集的抗 rot 架构。
Inkling 深读:开放的不是榜单冠军,而是一套可更新模型栈
深度解读 Thinking Machines Lab 首个开放权重模型 Inkling:从 975B/41B MoE、5:1 局部/全局注意力、学习式相对位置、短卷积、encoder-free 图像与 dMel 音频、MTP,到 45T 预训练、30M+ 异步 RL、thinking effort 和 Tinker LoRA 自我微调闭环;复算 active parameters 与百万上下文 KV cache,逐项审视榜单、安全、事实性、硬件、许可证、框架集成、权重参数记账与数据透明度,并提出可塑性弹性、adapter 策略记忆和质量—成本曲线等七条独立判断。
Direct-OPD:把弱模型 RL 的策略位移迁移给强模型
深度解读 Weak-to-Strong Generalization via Direct On-Policy Distillation:从 KL-regularized RL 推导 teacher/reference log-ratio 如何成为 reward-like policy shift,拆解 student on-policy rollout、top-16 解析更新、自适应 KL 与顺序组合;逐项核验 AIME24/25 主结果、matched-route GPU-hours、严格 weak-to-strong 设置、官方实现与复现边界,并指出数学单域、理论—实现近似、词表兼容、reward hacking 传播和多 seed 缺失等关键限制。
ICML 2026 研究趋势深读:当生成变便宜,评测、环境与记忆成为真正的瓶颈
深读 Soham Ray 的《Research Trends at ICML 2026》:完整还原自动研究、评测迁移、合成数据与 Agent Memory 四条主线,反向核验 MARS、InnoEval、benchmark saturation、Edge of Comprehension、REAL、Rubric Curriculum RL、Less is Enough、Simula、MemoryArena 与 τ benchmark 等代表工作;区分原文观察、论文证据与独立推论,并提出生成、验证、环境、记忆四层反馈栈,以及 benchmark 生命周期、executable environment、memory governance 和 verifier independence 等研究与工程判断。
SAR 谱重连:RL 参数增量里的“推理核心”究竟是什么?
完整还原 SAR 作者主帖与 1–10 条线程,深读 21 页 arXiv v1:拆解基座 top-k SVD 坐标、RL delta 低秩截断与双侧投影,逐项核验 AIME、Pass@k、内部 agentic coding、32B Mix-RL 和 1.5B/14B 专家合并结果;区分紧凑更新表示、探索改善、跨域正则化与“原子技能/功能流形”机制叙事,并指出 Coverage@256 仅多覆盖一道题、rank 选择缺少独立测试、0.58% 参数记账无法按正文独立复算、官方代码与内部模型尚未公开等关键证据边界。
DeepSeek-V4 深读:百万 Token 不是窗口数字,而是一整套系统契约
深度解读 DeepSeek-V4 技术报告:完整拆解 1.6T/49B Pro 与 284B/13B Flash、CSA/HCA 多尺度压缩注意力、mHC 四路残差、Muon 与 MoE 稳定性、FP4/FP8 和确定性内核、异构 KV cache、多教师全词表 OPD、百万 Token rollout 与沙箱基础设施;逐项核验公开评测、内部真实任务和官方模型配置,并指出 1M 是模型—训练—推理—后训练的系统契约,不是无损记忆保证。
Richard Sutton 创办 Oak Lab:运行时经验、Big World 与深度学习底座之争
深度解读 Richard Sutton 创办 Oak Lab 的 X 公告及回复区争议,并用 Oak 官方材料、Big World、OaK / FC-STOMP、IDBD / NetworkIDBD、SwiftTD、实时递归学习、Physical Atari、持续学习可塑性论文,以及 Keen 与 Ineffable 的公开路线交叉核验:核心不是“RL 取代深度学习”,而是重写离线 batch、全局信用、经验回放和冻结部署的学习制度;同时严格区分已有问题证据、组件级结果与尚未验证的一万亿参数 / 20W 愿景。
Beneficial RL 与 Harness Engineering:自我改进系统的内外两层持久性
合读 OpenAI Beneficial RL 与 Lilian Weng Harness Engineering:把自我改进系统拆成内部 trait persistence 与外部 harness persistence 两层,解释 beneficial trait RL 如何在 53 个 OOD alignment eval、adversarial prompting 与 harmful finetuning 中报告更持久的有益行为,以及 harness 如何通过 context、workflow、tools、memory、evaluation、permission 和代码化 self-improvement 承载近中期 RSI。
Verifier、Compaction 与 Direct-OPD:Agent RL 的三种可复用中间信号
综合 LLM-as-a-Verifier、CompactionRL 与 Direct-OPD:解释 agent RL 如何从稀疏最终奖励转向可复用中间信号,包括用评分 token logprob expectation 做候选选择与进度估计、把 context summary 训练成 policy action,以及从弱模型 RL 前后 log-ratio 中提取可迁移 policy-shift reward;同时明确 logprob API、summary 质量、AIME-only 证据、v1/v2 数字冲突和代码发布边界。
EdgeBench 与 Gemma 4:环境学习评测和可部署开放模型栈
合读 EdgeBench 与 Gemma 4 Technical Report:解释为什么 agent 时代需要把环境交互时间作为 scaling axis,同时也需要开放模型栈在长上下文、thinking、function calling、QAT、MTP、多模态接口和部署成本上支撑长反馈循环;梳理 EdgeBench 134/51 任务、log-sigmoid 拟合、经验保留与上下文 ablation,以及 Gemma 4 dense/MoE 架构、encoder-free 12B、长上下文和量化边界。
六条 X 材料深读:AI 前沿的六个反馈闭环压力测试
深度改写六条 X/Twitter 材料:逐条展开 beanie0__0 的 self-distillation/epistemic verbalization、Grad 对 GLM-5.2/SAO 与 PPO 归因的成本质疑、dongxi_nlp 对 Anthropic J-space readout/control 的怀疑、OpenAI SWE-Bench Pro 审计、Cognition SWE-1.7 与 FrontierCode 发布,以及 Shilong Liu 的 self-evolving agents taxonomy;先完整介绍原帖、回复、外部材料与证据边界,再给出 senior researcher insight,避免浅层主题摘要。
Solving OPSD?正向 pressure、regretful teacher 与 RLRT 边界
深度 review ar0cket1 的 X 长文《Solving OPSD (basically)》:解释为什么这篇帖真正有价值的不是“OPSD 基本解决了”,而是把 hinted self-distillation 中 teacher-student gap 拆成 positive pressure 与 negative pressure,并进一步提出 regretful teacher 这一语义诊断;系统梳理 hint rewrite、KL shocks、trace labeling、与 RLRT 的 exploration / exploitation 分工,并明确哪些论点已有证据支持、哪些仍属于强假设。
Kyutai 语音交互对齐:Full-Duplex 模型不是更快说话,而是更会合拍
深度解读 Kyutai Labs 发布的 Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models:解释为什么 full-duplex 语音模型的自然性不只是低延迟,而是停顿处理、接话、backchannel 附和和用户插话四类交互节奏的联合优化;系统梳理真实双人对话片段抽取、轴特定 VAD 奖励、LLM Judge 语义保护、GRPO 后训练、Full-Duplex-Bench v1/v2 结果、消融实验与安全退化风险,并给出语音 Agent 交互层 reward stack 的工程启发。
Attention Amnesia:CoT 后训练如何改坏 Hybrid LLM 的长程检索路由
深度解读 sheriyuo 关于 Attention Amnesia 的 X 帖与 arXiv 论文:解释为什么在 hybrid linear-attention 模型中,CoT-SFT 会把少数 full-attention 层的 W_Q/W_K 路由几何推向局部推理轨迹,导致长上下文 Needle-In-A-Haystack 召回退化;系统梳理 gradient locality、routing-extraction decomposition、QK-Restore、QK-Pro、non-CoT SFT 对照、Q/K/V 消融与 pure softmax 边界,并给出 post-training 中监控 routing stability 的工程清单。
CL-Bench:Agent Memory 不是记住,而是从经验中变好
深度解读 Continual Learning Bench / CL-Bench:解释为什么 Agent memory 评测不能停留在 recall,而要看历史经验是否带来 stateful 相对 stateless 的 gain;系统梳理六个任务、gain 指标、ICL 强基线、Mem0/ACE/Notepad 等记忆系统表现、稳定性与可塑性失败案例,并提出把 memory 设计成带证据、置信度、适用范围和失效条件的假设治理系统。
OPD 参数几何:低秩锁定是正则化,还是泛化瓶颈?
深度整理 rosinality 对《On the Geometry of On-Policy Distillation》的讨论:解释 OPD 为什么在最终更新量级上介于 SFT 与 RLVR 之间,却在训练轨迹上很早进入低维 update channel;系统梳理 bf16-aware sparsity、principal-angle rotation、spectral drift、stable rank、rank-16 投影实验与 objective mixing 控制实验,并讨论 subspace locking 对泛化的双重含义:既可能是保留预训练结构的隐式正则化,也可能是 teacher / rollout / objective 共同造成的早期路径依赖瓶颈。
大规模 Test-Time Compute:从模型分数到能力曲线
深度整理 Noam Brown《Implications of Large-Scale Test-Time Compute》:解释为什么现代 LLM 能力越来越像 tokens、成本、时间和 scaffold 共同决定的预算函数,而不是 leaderboard 上的单一分数;并梳理 performance-vs-compute 曲线、Preparedness/RSP 安全评估、Gemini Deep Think 争议、产品选型中的 cost per solved task,以及 benchmark 从排行榜转向 Pareto 曲线的实践清单。
Codex Token 从 245M 到 28M:上下文治理,而不是省钱小技巧
深度解读 Tim Jayas 的 X Article《How I Cut Codex Tokens from 245M to 28M Per Day For Free》:把表层的省 token 技巧重读为 coding agent 的上下文治理系统,拆解预压缩 raw data、命令输出限流、living handoff、Do Not 规则、targeted snippets、周期 compact 和低 verbosity 背后的信息架构,并指出 summary-first 不能替代 raw-slice 取证、head/tail 可能漏掉中部错误、helper script 也需要校验等关键边界。
NF-CoT:把 Chain-of-Thought 迁移到可采样的连续潜变量空间
深度解读 Jiatao Gu 发布的 NF-CoT / Latent Reasoning with Normalizing Flows:解释为什么 continuous CoT 的难点不是把思考藏进 hidden state,而是保留显式 CoT 的左到右生成、概率采样、精确似然、KV-cache 友好和 GRPO 后训练接口;系统拆解 VAE latent、normalizing flow 重参数化、LLM-facing continuous thoughts、统一 causal stream、pass@k 多样性、效率收益与可解释性边界。
MMAE:音频编辑从“能生成”到“能精修”的评测分水岭
深度解读 Tencent Hunyuan 发布的 MMAE: A Massive Multitask Audio Editing Benchmark:解释为什么指令式音频编辑不同于普通音频生成,MMAE 如何用 2,000 个样本、17,741 条 rubric、7 类模态、6 类复杂度和 8 类操作构建评测,并分析当前模型 EMR 低于 5% 背后的结构性瓶颈、planner 局限与下一代音频编辑系统设计方向。
AutoLab:长时程 Agent 的胜负手不是第一拍,而是闭环控制
从 Rohan Paul 的 X 帖深入到 AutoLab 论文、官网、代码仓库与公开轨迹子样本:解释这个 benchmark 真正测到的不是励志意义上的 persistence,而是长时程 agent 在固定预算下管理 benchmark、反馈吸收、best-so-far 状态、收尾纪律与 harness 的闭环控制能力;并对比 RE-Bench、AIRS-Bench、KernelBench,厘清 AutoLab 的定位与边界。
Prime Intellect 视角下的 RL 后训练 32 答:vivek_2332 的算法/Infra 双向工程笔记
深度解读 @vivek_2332 对 sheriyuo 35 道 RL Interview Questions 2026 的 32 答长帖:页面先补齐可直接查阅的 32 问与答速查(Algo 19 个题位中 16 条实质答复 + Infra 16 个题位),再按 Prime Intellect 工业视角重排为 6 层技术栈地图,涵盖 Actor-Critic 显存预算、GRPO 变体横向对比、KL 去留、OPD、DPO、trainer-inference 数值一致性、fp8/int8、vLLM/SGLang、PP 不推荐、staleness 1-4 步,以及 Prime-RL/verl/TRL/AReaL 框架差异。
RAGEN-2:Entropy 没塌,不代表 Agent 还在看输入
深度解读 RAGEN-2: Reasoning Collapse in Agentic RL:解释为什么 token-level entropy 只能看到同一输入下的表面多样性,无法发现跨输入的 template collapse;拆解 mutual information proxy、in-batch cross-scoring、reward variance / SNR 机制、SNR-Aware Filtering 的实验收益与工程边界。
RL Interview Questions 2026:从面经到 LLM/Agentic RL 全栈能力地图
深度解读 sheriyuo 的 RL Interview Questions 2026 / 2026 年 RL 方向面经合集:把 35 道算法与 Infra 问题拆成 LLM RL / Agentic RL 的能力地图,覆盖 PPO/GRPO、DAPO/GSPO/CISPO、OPD、reward、rollout、KV cache、MoE、异步训练、staleness 与 VeRL/AReaL/slime 选型。
Self-Trained Verification:把“带答案时会挑错”蒸馏成可用 verifier
深度解读 Chen Henry Wu 与 Aditi Raghunathan 的 Self-Trained Verification:解释为什么 reasoning self-improvement 的瓶颈是 verifier,STV 如何把 reference-conditioned teacher 蒸馏成不看答案的 verifier,以及 ViL 如何用诊断反馈突破标准 RLVR plateau;同时梳理 hard math、SciKnowEval、weak-to-strong verifier、reward hacking 和开放式任务迁移边界。
GRPO++:让 RLVR 真正跑起来的后训练工程手册
深度解读 @neural_avb 推荐的 Cameron R. Wolfe《GRPO++: Tricks for Making RL Actually Work》:从 PPO/GRPO 基础出发,系统梳理 vanilla GRPO 的 reward noise、entropy collapse、长度偏置、zero-gradient prompts 与 sampler-learner off-policy gap,并解释 DAPO、Dr. GRPO、TIS、GSPO、GMPO、CISPO 分别在修哪一层后训练工程问题。
Fantastic Pretraining Optimizers and Where to Find Them:一次 optimizer benchmark 的清算
深度解读 Kaiyue Wen 等人的工作,结合原论文、W&B 详尽实验报告和 GitHub 实验索引,解释为什么很多 1.4–2× optimizer speedup claim 是弱 baseline 和 unfair benchmark 造成的幻觉,以及 matrix-based optimizer 在公平比较下的真实边界。
LLM Infra 设计谱系:从 attention 到 MoE 再到 FP8
从 MAI-Base-1 的架构表出发,调研 local/global attention、GQA/MQA、top-k MoE、LatentMoE、dropless routing、zero-init attention output、FP8 E4M3/E5M2 等 infra 术语背后的技术动机、演进轨迹、代表工作和关键结论:这些设计共同服务于 attention FLOPs、KV cache、all-to-all、router imbalance、GEMM shape、数值稳定和 goodput 的预算化。
MAI-Thinking-1:微软如何把模型研发做成 Hill-Climbing Machine
深度分析 Microsoft AI 技术报告《MAI-Thinking-1: Building a Hill-Climbing Machine》:解释 35B active / 1T total MoE、30T token 预训练、scaling-aware data mixture、NLL suite、dropless MoE、zero-init attention、GRPO-style RL、self-distillation recovery、agentic SWE 环境、安全 gated reward、YOLO/Rocket 基础设施和 8K GB200 goodput 背后的系统性模型研发范式;并本地化所有编号 Figure/Table 所在页面作为图表证据索引。
OmniOPD:用语义 chunk 验证绕开 teacher logits
深度解读 Zhuokai Zhao 关于 OmniOPD 的 X 原帖、前序 OPD 脆弱性长帖和 arXiv 2606.01476:解释标准 OPD 为什么受限于 teacher logits、tokenizer/style mismatch 和 fragile next-token overlap,以及 OmniOPD 如何用 peak-entropy chunk selection、teacher Monte Carlo rollouts、semantic similarity、Dirichlet-Multinomial prior 和 reference KL anchor 构造 logit-free on-policy distillation。
LLM RL at Scale:从 scaling law 到 agentic post-training 的阅读路线
深度解读 Cameron Wolfe / cwolferesearch 的 RL at scale X 书单:把 26 条论文、框架、agentic RL 与工业技术报告短链整理成一条后训练路线,解释为什么 LLM RL scaling 不能照搬预训练 scaling law,而必须同时处理 rollout 吞吐、policy freshness、importance sampling、reward/verifier 可靠性、agent 环境供应链和真实产品闭环。
Mid-training:预训练和后训练之间真正发生了什么
深度解读 Niels Rogge 关于 mid-training 的 X 原帖与 Papers with Code 方法页:解释 mid-training 为什么不是简单的 post-training,而是把通用 base model 继续推向长上下文、领域知识、代码、数学或 agent 轨迹等目标能力分布的中间层;并用 Phi-4、distribution bridging、daVinci-Dev 和 Agentic CPT 说明它和 SFT、DPO、RL 的真实边界。
CAST:给 GRPO 补上 verifier-grounded 的 token 级信用分配
深度解读 @sheriyuo 关于 CAST / GRPO 的 X 原帖与 arXiv 2606.00172:解释 GRPO 在 all-correct / all-wrong zero-variance groups 上的死区,OPSD token preference 与 trajectory correctness 的错位,以及 CAST 如何用 answer-free self-teacher、asymmetric clipping、zero-variance base advantage 和 bidirectional advantage flipping 给 RLVR 训练补上 verifier-grounded 的 token 级信用分配。
A-Evolve:把 Agent Harness 变成可演化的工程对象
深度解读 A-Evolve 两篇论文与开源框架:拆解 Position Paper 的方法贡献(≈ 0 新算法)、Harness Updating ≠ Harness Benefit 作文的受控实验发现(evolver 强弱不重要,solver 能力才决定收益),并把 A-Evolve 放进 2023-2025 十种同类工作的坐标里,逐项审视每个卖点是否算创新。追加赛道全景对照表、7 项机制创新性评估、诚实总结。
Speculative Decoding:投机解码的真实收益、校正采样与生产边界
深度解读 Mohit 的 X Article《Everything you need to know about Speculative Decoding Inference》:在“小模型先猜、大模型验收”的入门直觉之外,补齐 speculative sampling、modified rejection sampling、residual correction、lossless guarantee、draft model / EAGLE / Medusa / MTP / NGRAM 方法谱系,以及 SGLang/vLLM 生产部署中的 batch、KV cache、显存和采样边界。
The Thinking Pixel:把 test-time compute 放进扩散模型 latent 层
深度解读 che_shr_cat 关于 The Thinking Pixel 的 X thread、作者 Substack 公开片段与 arXiv 2604.25299:解释 Recursive Sparse Reasoning 如何在 SD3 / DiT 的 joint attention 层内用 Mixture-of-Adapters、Gumbel-Softmax 路由和 LoRA 低秩专家给视觉 latent token 增加递归 test-time compute;同时校正 GenEval、DPG、ImageNet FID 与 FrozenLake 实验的证据边界。
RHELM:长期记忆评测为什么必须超越静态对话
深度解读 HuggingPapers 推荐的 Microsoft / Renmin University RHELM benchmark:解释为什么长期记忆评测不能停留在静态对话检索,而要覆盖动态 persona、LOOP 轨迹演化、邮件/附件/对话多源同步、misleading query、hallucination correction 与 cross-source aggregation;并分析 RAG、长上下文模型和 memory frameworks 在 RHELM 上暴露的统一记忆架构缺口。
LongTraceRL:用搜索轨迹和实体级 rubric 训练 128K 长上下文推理
深度解读 HuggingPapers 推荐的 LongTraceRL:解释为什么长上下文 RLVR 不能只靠随机 distractor 和 outcome-only reward,LongTraceRL 如何用 Wikipedia KG random walk 生成 8-hop 问题、用 search agent trajectories 抽取 Tier-1/Tier-2 hard distractors,并用 positive-only entity-level rubric reward 在 128K context 上训练证据接地推理;同时梳理 4B/8B/30B 实验、rubric/distractor ablation、公开模型和数据集边界。
Agentic RL 的 rollout 层:从 Agent Loop 到 Agent Environment
深度解读 Yuan He 关于 multi-turn RL rollouts 的 X 主帖、From Agent Loops to Agent Environments slide deck、strands-env 与 strands-sglang:解释为什么 agentic RL 的第一问题不是 KL/GRPO 等算法,而是 rollout system 是否保持 token-faithful、strict tool parsing、termination taxonomy、train-inference match 与环境并发效率;并把 A2E 回复区链接作为 agent-to-environment 协议层对照。
TRB:把 OPD 的早期采样问题改写成受约束的教师引导
深度解读 Trust-Region Behavior Blending for On-Policy Distillation:解释 OPD 为什么会卡在 early student rollout,TRB 如何用 student-centered KL trust region 临时构造接近 teacher 的 behavior policy,并在 warmup 后退火回纯 student rollout;同时分析 Qwen3 数学蒸馏实验中 0.4-0.9 pass@1 平均提升的证据边界。
X 推文周期观察:AI 研究动态 102 轮选 24 条
SheSheBot x-tweet-digest 流水线 24 小时内 102 轮(每 15 分钟)周期观察的精选版:241 条独立推文覆盖 audio LM / multimodal / agent / harness / RL / reward / agentic 7 个方向,10 个主题均衡。报告拆解 Physical AI / Omnimodal(NVIDIA Cosmos 3)、Multimodal Agent(Step 3.7 Flash、Qwen3.7-Plus、MiniMax M3)、Agentic RL & Reward(Kimi subagent RL、Harnessy、Repo2RLEnv)、Speech LLM(OpenAI gpt-realtime-translate、AA-WER Streaming、Tencent 通用 audio tokenizer)四条产业主线,并解释周期观察、去重和主题轮换的工程实现。
Async RL 是否已解决:policy lag、IS 偏差与后训练系统边界
深度解读 Luke J. Huang 关于 frontier asynchronous RL 的 X thread 与长文:解释异步 RL 如何用 rollout/training 解耦换取 2-3x 吞吐,又如何因 policy lag 产生 stale trajectory 和 off-policy instability;梳理 TIS/CISPO、MIS/IcePop、DeepSeek masking、M2PO、MoE routing replay、batch-invariant kernels、FP32 LM head、fast weight sync 等修补手段,并分析 sequence-level IS、token-level IS 与低偏差 compute scaling hypothesis 的工程边界。
BES:把搜索从同分布采样推进到目标反推与轨迹重组
深度解读 Kevin Guowei Xu 关于 BES 的 X 线程、arXiv 2605.28814、GitHub 仓库和 Hugging Face 模型集合:解释 Bidirectional Evolutionary Search 如何用 backward goal decomposition 把稀疏终局奖励变成子目标覆盖信号,并用 combination、deletion、translocation、crossover 重组不同错误轨迹里的局部正确片段,分析其在 post-training、multi-hop agent 和 open problem solving 中的证据与边界。
Self-Distillation 的两面性:World-Bayesian 与 Self-Bayesian 推理
深度解读 Jeonghye Kim 关于 MSRA 实习研究线的 X 线程:解释为什么 self-distillation 在 long-horizon agent 任务里像外部世界经验压缩,却在数学和纯内部推理里可能压制 epistemic verbalization,并串联 EMPO²、Strategic Information Allocation、Self-Distillation Degradation 与 Rebellious Student/RLRT 四篇工作。
Self-Verified Distillation:模型如何把自验证变成后训练数据引擎
深度解读 Tony Lee 与 Percy Liang 的 Self-Verified Distillation 论文和 X thread:解释模型如何从无标签 seed questions 出发,用自生成候选解、UQ 风格多阶段自验证和 SFT 构造 post-training 数据,并分析 generator-validator consistency、UQ-TTC 168 次推理成本、Qwen3 多规模实验收益和自验证边界。
LRPO:把语言选择变成多语言后训练的可学习变量
深度解读 CherylolGuo 关于 LRPO 的 X 线程、arXiv 2605.25360 和官方 GitHub README:解释为什么知识不是均匀分布在语言中,LRPO 如何把 rollout language 作为可学习变量,用 language router、跨语言 reward calibration 和语言一致性奖励改进多语言 policy optimization,并分析其对多语言 RAG、国际化 agent 和 reward 设计的工程启发。
Harvey/Baseten:开放法律 Agent 后训练路线
深度解读 Gabe Pereyra 关于 Harvey 与 Baseten Research 的开放法律 Agent 后训练文章:解释 LAB 如何从法律 agent benchmark 变成可训练环境,为什么 read-heavy 行为、compaction harness、iSFT 和 rubric-passing trajectories 共同构成垂直 agent 后训练闭环,并分析外部复现、rubric reward、private-mode submit 与 KV cache compaction 的边界。
Orbit:把万亿模型 RL 后训练改写成部署一致性问题
深度解读 Besteuler 关于 Orbit 的 X 帖、SphereLab 英文博客、GitHub 仓库和 rollout 架构补充页:解释为什么 Orbit 的关键不是单点 OFT,而是 frozen low-precision base、BF16 adapter、deployment-aligned RL、adapter-native async 和 double-buffered rollout 共同降低万亿模型后训练的显存、权重同步与 train-rollout gap。
CUA-Gym:Computer-Use Agent 的 RLVR 数据基础设施
深度分析 Bowen Wang 关于 CUA-Gym 的 X 线程、论文页、项目主页、Hugging Face 数据集与 GitHub 仓库:解释为什么 Computer-Use Agent 的 RLVR 瓶颈在可复位、可检查、可程序化奖励的数据环境,而不只是算法;同时梳理 setup-gen / reward-gen / orchestrator 闭环、CUA-Gym-Hub 状态 API、OSWorld / WebArena 结果和当前发布材料中的数字差异。
KPop:用自适应 Mask 稳住 Agentic RL 的训练-推理错配
深度解读 Jia Guo 关于 KPop 的 X 主帖与 Notion 博客:解释为什么大规模 MoE / agentic RL 会出现 training-inference mismatch,IcePop 固定 ratio mask 为什么失效,以及 KPop 如何用 symmetric binary KL 构造 token-level hard trust region,让 Ring-2.6-1T 的 SWE agentic RL 在作者报告中从 70.8% 提升到 76.28%。
Cracks in the Foundation:长上下文扩展为什么会被小架构选择击穿
深度解读 Gabriele Berton 关于 OlmPool 的 X 主帖与 Ai2 论文:为什么 QK norm、GQA、sliding window attention 和预训练上下文长度这些看似局部的架构选择,会在 context extension 中复合放大,导致长上下文 benchmark 表现最多下降约 47%。
Hwcoder 算法笔记体系读书笔记
把 Hwcoder 算法笔记分类中的 23 篇算法入门、力扣刷题和手撕经典算法内容整理成一份站内读书笔记:按基础工具、刷题题型、通用模板、深度学习手写组件和复习路线重构,保留完整源笔记清单与阅读定位。
SkillEvolBench 深度解读:从一次性经验到可复用程序性技能
深度解读 arXiv 2605.24117 与项目主页:SkillEvolBench 如何用 6 个真实 agent 环境、180 个任务、acquisition/deployment/replay 协议和 Raw-Trajectory control 评估 agent 能否把 episodic trajectory 演化为 reusable procedural skill,并分析当前 skill abstraction 为什么经常输给原始轨迹复用。
Shannon Scaling Law 与 Token Noise 极限解读
深度解读 rosinality 对《LLMs as Noisy Channels》的评论:为什么 token noise exponent 大于 signal exponent 会让继续加 tokens 的单调收益失效,以及 Shannon Scaling Law 如何用 SNR、loss basin 和外推实验解释过训练、量化与 SFT 扰动。
RL Memory Agent 训练数据效应:Curriculum 如何塑造外部记忆问答能力
深度解读 arXiv 2605.23067:在 memory-augmented QA 中,LoCoMo、LongMemEval 与混合 curriculum 如何改变 RL Answer Agent 的细分技能 profile;同时梳理单 GPU GRPO 下 memory bank 清洗和 binary exact-match reward 方差塌缩的工程边界。
SaaS-Bench 解读:Computer-Use Agent 为什么还不是可靠的 SaaS 工作者
深度解读 @sheriyuo 关于 UniPat AI SaaS-Bench 的 X 帖、官方 blog 与 arXiv 论文:解释 23 个真实 SaaS 系统、106 个长程任务、Checkpoint Score 与 Resolved Score 的巨大落差,以及为什么当前 Computer-Use Agent 还缺少状态验证、跨应用依赖管理和错误恢复能力。
ZCube 推理网络架构解读:KV Cache 流量如何改变数据中心拓扑
深度解读 Z.ai 关于 ZCube 的 X Article 和官方博客:从一次 PD 请求链路、KV Cache 体积公式、ROFT/Fat-Tree 局部热点机制讲起,解释 ZCube 如何用扁平二部拓扑、单轨/多轨混合接入和路径分散降低 TTFT 慢尾,并给出可落地的集群诊断清单。
EqR 与 Neural Attractors:从 Feedforward 到 Iterative Reasoner
深度解读 Benhao Huang 关于 EqR 的 X side-post 与 arXiv 论文:解释 weight tying、segmented online training、hierarchy、ACT、RI/NI 如何共同塑造 neural attractor landscape,并区分 residual convergence 与真实 correctness 的边界。
Agentic Systems as Boosting Weak Reasoning Models 深度解读
深度解读 Grigory Sapunov 的 X 线程与 arXiv 2605.14163:为什么弱模型候选池里经常已有正确 patch,critic-comparator harness 如何回收 oracle best-of-k 暴露的 latent capability,以及 blind-spot floor 为什么限制 test-time boosting。
可信 Audio LLM Survey 深度解读
深度解读 HuggingPapers 推荐的 arXiv 2605.20266:Audio LLM 的可信问题为什么不是语音版文本安全,而是连续声学信号引入 hallucination、robustness、safety、privacy、fairness、authentication 六维风险。
Grok V9、Cursor 数据与 Mid-training 深度解读
深度梳理 Elie Bakouch 关于 Grok V9 的 X 帖:为什么 1.5T 模型、Cursor 数据、supplemental/mid-training 和 2-3 周 RL 发布窗口共同指向 coding agent 能力重心前移。
ZEDA:后训练 MoE 如何跳过一半专家计算
深度解读 Rohan Paul 关于 ZEDA 的 X 帖与论文《Post-Trained MoE Can Skip Half Experts via Self-Distillation》:解释 zero expert、自蒸馏、组级路由约束如何把已后训练 MoE 转成动态 MoE,并分析 50% expert FLOPs 削减、约 20% 推理加速和部署边界。
NITP:Next Implicit Token Prediction 技术解读
aHpaBean 关于 NITP 的 X 预告、ICML 2026 poster 与 GitHub README 深度解读:解释为什么 NTP 的 one-hot CE 可能欠约束 hidden geometry,NITP 如何用下一 token 的浅层表示作为辅助目标,以及它和 JEPA、distillation、Cut Cross-Entropy 的边界。
Test-Time Scaling 与 Training-Free RL 深度解读
深度解读 Xiuyu Li 的 X Article:Test-Time Scaling 如何通过 reward-aware sampling 连接 KL 正则 RLHF、Power Sampling、ETS 与 Self-Evolving 路线。
VPO:为什么多样性训练会改善测试时搜索
深度解读 Ryan Boldi 关于 Vector Policy Optimization 的 X 线程与 arXiv 2605.22817:解释 VPO 如何用向量奖励、多答案链和集合级目标保留可搜索解空间,并分析它在 LiveCodeBench、OpenEvolve 和多目标奖励场景中的适用边界。
Applied Compute RMSD:把 OOD 企业行为拉回模型分布内
深度解读 Applied Compute 的 RMSD 线程与长文:解释 Relevance-Masked Self-Distillation 如何把自然语言 hint 转成 token-level 蒸馏信号,并通过 relevance mask 减少自蒸馏中的无关风格梯度噪声。
手撕经典算法 #1 Attention 篇整理
把 Manual-Coding-1 的 Attention 手写内容整理成站内学习笔记,覆盖 SDPA、MHA、KV Cache、MQA、GQA 的张量形状、mask 边界、缓存语义和实现风险。
大模型测试的下半场:Agent 时代评测该测什么
Agent 时代大模型评测应该关注什么维度的深度分析。
rosinality X 帖与 Proxy Metrics 论文深读
rosinality X 帖与 Proxy Metrics 相关论文的深度阅读。
Delegation Intelligence:Agent 时代该如何重新理解评测
Agent 时代 Delegation Intelligence 评测范式的重新理解。
GRPO 之后:Dense Credit Assignment 的下一步
GRPO 之后 Dense Credit Assignment 的下一步方向分析。
ECHO: Terminal Agents Learn World Models for Free
ECHO 终端 Agent 世界模型学习机制的 X Article 梳理。
NanoGPT-Bench X 线程解读:Coding Agent 能做研究吗?
NanoGPT-Bench X 线程深度解读,探讨 Coding Agent 的研究能力边界。
Mid-training/RL 数据重叠会伤害 RL 吗?
Mid-training 和 RL 阶段数据重叠对 RL 效果的影响分析。
推特大模型动态日报 | 2026-05-19
Twitter/X 上大模型相关动态的每日精选汇总。
数学基础速修手册
一本零基础友好的数学复习手册,围绕微积分、线性代数、概率统计组织 20 个章节,用概念起点、公式读法、完整例题、反例边界、算法流程和 LLM/Quant 应用链路帮助重新建立知识结构。
Lilian Weng: System Accidents 解读
Lilian Weng 系统事故分析经典博客解读。
Memento / KV Cache X 帖深度解读
Memento KV Cache 优化技术的 X 帖深度讨论。
MEMENTO 深度解读:教 LLM 管理自己的上下文
LLM 上下文管理机制的深度分析。
SEIF 论文与 X 帖深度分析
SEIF 指令遵循相关研究的深度分析。
Prime Intellect autonomous nanoGPT speedrun 解读
Prime Intellect autonomous nanoGPT speedrun 深度解读。
168X / Herman Jin 半导体访谈深读
168X Herman Jin 半导体行业访谈的深度阅读分析。
RESD X 线程与论文解读
RESD X 线程与论文的深度阅读分析。
AVB OPD / OPSD 资源帖深度解读
AVB OPD / OPSD 资源帖的深度阅读分析。
Fast-Slow Training X Thread Analysis
Fast-Slow Training X 线程的深度分析。
G-Zero X 线程与论文深读
G-Zero Self-Play 开放生成 X 线程与论文深度阅读。
TencentDB Agent Memory 推文与开源项目分析
TencentDB Agent Memory 推文与开源项目的深度分析。
RELEX / Minimal RLVR Training 深度解读
RELEX Minimal RLVR Training 的深度解读。
Reward Hacking in Rubric-Based RL:X 线程与论文深读
Rubric-Based RL 中 Reward Hacking 问题的 X 线程与论文深读。
Dr. Post-Training 推文与论文深读
Dr. Post-Training 推文与相关论文的深度阅读。
Harbor 与 RL Coding Environments 长文梳理
Harbor RL Coding Environments 的长文梳理。
KLieret X 线程解读:GPT 5.5 首次解出 ProgramBench 实例
GPT 5.5 首次解出 ProgramBench 实例的 X 线程解读。
Agents Need Feedback Loops 阅读分析
Agents Need Feedback Loops 相关内容的阅读分析。
ACuRL X 线程与论文解读:Computer-use Agent 的自主持续学习
ACuRL Computer-use Agent 自主持续学习的 X 线程与论文解读。
SWE-ZERO-12M Trajectories X 帖深度解读
SWE-ZERO-12M Trajectories X 帖深度解读。
LongMemEval-V2 深度解读:Agent Memory 如何走向有经验的同事
LongMemEval-V2 Agent Memory 评估框架深度解读。
Lighthouse Attention X 帖与论文深读
Lighthouse Attention X 帖与论文的深度阅读。
MMProLong / LongPT 深度解读
MMProLong / LongPT 长上下文 LVLM 的深度解读。
GMI Cloud 足球踢球动画 Thread 梳理
GMI Cloud 足球踢球动画空间推理 Thread 梳理。
大模型面试题库
按章节拆分的大模型面试题库,包含 90 个独立章节、筛选搜索、本地 SVG 导图和训练/推理/系统专项内容。
Unmasking On-Policy Distillation
中文论文深读笔记,聚焦 on-policy distillation 为什么更像 token-level credit assignment,而不是全序列模仿。
Artificial Analysis 语音 Agent 评测解读
Artificial Analysis τ-Voice 与 S2S 客服任务评测解读。
Rebellious Student / RLRT 论文深读报告
RL 蒸馏与叛逆学生机制的论文精读。
LCO-Embedding 论文深读报告
LCO-Embedding 方法的深入分析与解读。
长周期 Agent、None-Person Company 与自我进化
Jie Tang X 帖深度解读,探讨长周期 Agent 与自我进化。
Synthetic Pre-Pre-Training Improves LM Robustness
合成数据预训练提升语言模型鲁棒性的深度解读。
Visual Generation Unlocks Human-Like Reasoning
多模态世界模型与视觉生成推理的深度解读。
TRACE: Capability-Targeted Agentic Training
面向能力的 Agent 训练框架深度论文报告。
OnlineRubrics 论文深读与 Insight
OnlineRubrics 在线评分标准的深度解读。
Nitrobrew 推文与技术解读
Nitrobrew Twitter/X 技术线程的深度分析。
Iterative Finetuning is Mostly Idempotent
迭代微调是否幂等的机制洞察。
