Notes

Notes · 站内长文

技术笔记、论文精读与访谈深读

这里整理较长的技术笔记、论文精读、访谈深读和可独立访问的学习资源,按最近更新时间倒序排列。可以用下面的搜索和分类,快速定位想看的主题。

295 · 每页 10 条

默认排序:最近更新优先;分类筛选和搜索会保留这个倒序。

2026-08-10 · Podcast Interview · {"duration"=>"0:33:12", "episode"=>"#6", "source"=>"Zhang Xiaojun Podcast"}

#6 Neal Zhang:显微镜下的硅谷大裁员

先完整重建 2022 年 11 月 11 日 Neal Zhang 对 Meta 裁员通知、业务优先级、赔偿、H-1B/绿卡、股票、美国生活成本、中美职场和 2008/2022 周期的亲历回答,再分析裁员如何把公司战略压缩成个人的现金、身份、技能和选择权账;所有政策与金额冻结在节目时点。

Zhang Xiaojun Podcast 张小珺 Neal Zhang Meta Layoffs Silicon Valley H1B
2026-08-10 · Podcast Interview · {"duration"=>"1:06:15", "episode"=>"#7", "source"=>"Zhang Xiaojun Podcast"}

#7 谈婧:硅谷冻卵历险记和 Web3 环球旅行

先完整重建谈婧从冻卵纪录片、身体与婚姻主体性,到三个箱子环球旅行、Web3、越南、金融 PMF、监管、FTX、加密大屋和 VC 民主化的连续叙述,再分析个人选择与全球网络如何共同面对成本、治理和责任;医疗内容保留为个人口述,不构成建议。

Zhang Xiaojun Podcast 张小珺 谈婧 Egg Freezing Web3 Globalization Venture Capital
2026-08-10 · Podcast Interview · {"duration"=>"1:09:55", "episode"=>"#8", "source"=>"Zhang Xiaojun Podcast"}

#8 Sebastian Mallaby:硅谷风投的起源、秘密和大人物肖像

先完整重建中文配音版《The Power Law》从 Fairchild、Arthur Rock、红杉与 Kleiner 到成长投资、弱关系和中国风投的连续对话,再分析幂律如何塑造基金期限、分阶段投资、团队协作与机构接班,明确这是解释性重建而非英文逐字翻译。

Zhang Xiaojun Podcast 张小珺 Sebastian Mallaby Venture Capital The Power Law 硅谷
2026-08-10 · Podcast Interview · {"duration"=>"0:54:45", "episode"=>"#1", "source"=>"Zhang Xiaojun Podcast"}

#1 王梦秋:聊聊加州、投资寒潮和林黛玉

先完整讲清王梦秋从 2000 年硅谷泡沫、O2O/共享经济/新零售小周期,到 2022 年美元资金通路变化、持币待购、投资人居家生活、回国与百度职业路径,再解释消费、硬科技、创业者画像、蹲着和《红楼梦》人物判断;把 2022 年个人经验、行业回顾与本文独立分析分开。

Zhang Xiaojun Podcast 张小珺 王梦秋 Venture Capital Career Startup Strategy 红楼梦
2026-08-10 · Podcast Interview · {"duration"=>"0:55:54", "episode"=>"#2", "source"=>"Zhang Xiaojun Podcast"}

#2 曹巍:聊聊马斯克、机器人恐怖谷和《西部世界》

先完整重建曹巍从擎天柱、双足步态、SLAM、触觉与精细控制,推进到晶圆搬运、三亚海鲜服务、恐怖谷、柔性机器人、波士顿动力、中国机器人生态与场景型商业化的原文路径,再分析为什么通用身体不等于通用价值;把 2022 年市场数字、技术时间表与官方机器人资料分层。

Zhang Xiaojun Podcast 张小珺 曹巍 Robotics Humanoid Robot Physical AI Venture Capital
2026-08-10 · Podcast Interview · {"duration"=>"1:44:06", "episode"=>"#83", "source"=>"Zhang Xiaojun Podcast"}

#83 英伟达之道:黄仁勋如何把失败、CUDA 与组织做成自强化网络

先完整重建《英伟达之道》节目从黄仁勋童年、三位创始人、NV1/NV2 失败、Riva 128 求生、GPU/CUDA、NV30 重挫、Mellanox、白板、Top 5、项目负责人和 Priem 离开推进的原文,再分析为什么 NVIDIA 的护城河是硬件、软件、开发者、系统和组织学习组成的自强化网络;把传记因果、管理处方和公开公司历史分开。

Zhang Xiaojun Podcast 张小珺 Jensen Huang NVIDIA CUDA Strategy Organization
2026-08-10 · Podcast Interview · {"duration"=>"0:52:11", "episode"=>"#85", "source"=>"Zhang Xiaojun Podcast"}

#85 凯文旭:总统候选人作为产品,如何与美国叙事做 PMF

先完整讲清凯文旭从奥巴马竞选基层、商务部和白宫新闻办公室,到硅谷科技业与投资的原文路径,再重建候选人作为产品、竞选组织、2008/2024 叙事、播客分发、特朗普与硅谷、AI 政治化和执政承接;随后分析 PMF 如何穿过产品、市场、分发与执行四道门,并把竞选结果、候选人预测和嘉宾动机分层。

Zhang Xiaojun Podcast 张小珺 凯文旭 Politics Product Market Fit US Election Technology Policy
2026-08-10 · Podcast Interview · {"duration"=>"1:32:14", "episode"=>"#86", "source"=>"Zhang Xiaojun Podcast"}

#86 广密:从‘下一个 Google’到 Agent、Context 和新软件

先完整重建广密从 Yahoo/Google、搜索/推荐和 token 最小单元讲起,推进到‘下一个 Google’、任务引擎、ChatGPT 商业模式、Context 基础设施、Chatbot 到 Agent/Organizer 五级演化,再逐一解释 OpenAI、Google、Anthropic、Perplexity、Cursor、Devin 和 AI for Science;随后分析为什么 Agent 的真正护城河是可复盘的长期状态,并把周活、付费率、数据墙和 2025/2026 时间表保留为 2024 年末节目估算或预测。

Zhang Xiaojun Podcast 张小珺 广密 LLM Product Agent Context AI for Science
2026-08-10 · Podcast Interview · {"duration"=>"0:53:07", "episode"=>"#92", "source"=>"Zhang Xiaojun Podcast"}

#92 张亚勤:意识、寿命、机器人、生物智能和物种的延伸

先完整重建张亚勤从微软亚洲研究院、清华 AIR 和基础模型取舍,推进到信息智能、物理智能、生物智能、家庭/工业/社会机器人、自动驾驶、RSR 仿真闭环、脑机接口、寿命、教育和新物种的原文路线,再分析为什么信息模型进步不能直接推出通用物理或生物智能;五年、十年、二十年和更远的时间表均保留为 2025 年访谈预测。

Zhang Xiaojun Podcast 张小珺 张亚勤 AGI Physical AI Biological Intelligence Robotics
2026-08-10 · Podcast Interview · {"duration"=>"2:07:22", "episode"=>"#93", "source"=>"Zhang Xiaojun Podcast"}

#93 张前川:内容产品二十年与 AGI 对人类的威胁

先完整讲清张前川从百度/360 搜索、知乎、字节今日头条到 MiniMax 的二十年产品路径,再解释搜索、推荐、UGC 社区和泛化的内生逻辑;随后重建他关于 AI 加速、目的与工具、Agent、灭绝风险、算力分配权和 pro-human 组织的完整推理,并把强烈的 AGI 时间表与风险判断保留为 2025 年访谈口述。

Zhang Xiaojun Podcast 张小珺 张前川 Product Management Content Platform AI Safety AGI
2026-08-10 · Podcast Interview · {"duration"=>"0:58:27", "episode"=>"#3", "source"=>"Zhang Xiaojun Podcast"}

#3 邵天兰:宇航员与机器人——漫谈深邃浪漫的 Robot 新知

先完整讲清邵天兰从人形机器人 moonshot、家庭操作、机器人与机器的区别,到工业视觉、服务机器人、创业一击和 Mech-Mind 的原文推进,再分析感知—规划—执行—反馈闭环;把十到二十年预测、行业死亡率、融资金额与官方身份/项目资料分层。

Zhang Xiaojun Podcast 张小珺 邵天兰 Mech-Mind Robotics Robotics Physical AI Entrepreneurship
2026-08-10 · Podcast Interview · {"duration"=>"1:37:27", "episode"=>"#4", "source"=>"Zhang Xiaojun Podcast"}

#4 杨帆(Francis):寻访越南——最后一个待开掘的儒家社会

先完整重建杨帆从并购律师、战略投资到越南生活的连续回答,再解释河内/胡志明市、二〇〇〇年中国类比、制造业迁移、供应链、营商环境、南北文化、家庭与摩托车生活;把个人体验、越南官方 FDI、世界银行背景和本文判断分开。

Zhang Xiaojun Podcast 张小珺 杨帆 Vietnam Globalization Manufacturing Entrepreneurship
2026-08-10 · Podcast Interview · {"duration"=>"1:59:15", "episode"=>"#5", "source"=>"Zhang Xiaojun Podcast"}

#5 黄宇翔:东南亚六国的政治、杀戮和国父

先完整重建黄宇翔按印尼、马来西亚、菲律宾、泰国、越南、新加坡推进的政治导览,再分析地理、国家能力、暴力记忆和国父叙事;明确族群性格概括、历史数字和选举判断均有节目口述与时间边界,不把刻板印象当成事实。

Zhang Xiaojun Podcast 张小珺 黄宇翔 Southeast Asia Geopolitics Political History
2026-08-10 · Podcast Interview · {"duration"=>"1:19:57", "episode"=>"#9", "source"=>"Zhang Xiaojun Podcast"}

#9 Sebastian Mallaby:口述一部硅谷风投史

先完整重建 Sebastian Mallaby 如何写作《The Power Law》,以及 Fairchild、Arthur Rock、红杉、Kleiner、Son/Milner、YC、Benchmark 和 Founders Fund 的人物与制度史,再分析弱关系、团队化、幂律和硬件回潮,明确这是英文原声节目的中文解释性重建而非逐字翻译。

Zhang Xiaojun Podcast 张小珺 Sebastian Mallaby Venture Capital 硅谷 风险投资
2026-08-10 · Podcast Interview · {"duration"=>"1:05:28", "episode"=>"#10", "source"=>"Zhang Xiaojun Podcast"}

#10 Sophia Xiao(萧慧平):加州土著谈硅谷精神与职场

先完整重建 Sophia Xiao 从上海移民、零售与银行工作,到 IBM、Box、Twitch、投资和中国公司本地化的连续叙述,再分析硅谷的职业流动、叙事能力、弱关系和在地化机制,区分个人回忆、节目观察与 2023 年预测。

Zhang Xiaojun Podcast 张小珺 Sophia Xiao 硅谷 职场 全球化
2026-08-10 · Podcast Interview · {"duration"=>"1:25:18", "episode"=>"#11", "source"=>"Zhang Xiaojun Podcast"}

#11 韩亦东:新加坡的淘金热和政商环境

先完整重建韩亦东从16年新加坡经历、Radio Web3基础设施、数轮淘金热到政府补贴、淡马锡、李显龙和区域总部的连续对话,再分析新加坡为何是枢纽而非中心,保留 Web3、政策、补贴和主权基金口述边界。

Zhang Xiaojun Podcast 张小珺 韩亦东 新加坡 Web3
2026-08-09 · Tech Analysis · single HTML note · six canonical Lil’Log posts + 52-post archive map

翁荔(Lilian Weng)的大模型思想地图:从 Scaling Laws 到 Harness

翁荔(Lilian Weng)大模型思想地图:继续完整重建《Thinking about High-Quality Human Data》《Extrinsic Hallucinations in LLMs》《Reward Hacking in Reinforcement Learning》,并与《Why We Think》《Scaling Laws, Carefully》《Harness Engineering for Self-Improvement》接成“数据—事实—奖励—推理—缩放—Harness”反馈链;同时梳理 Lil’Log 2017-2026 年 52 篇技术正文的主题迁移、阅读路线与证据边界。

Lilian Weng 翁荔 High-Quality Human Data Factuality Scaling Laws Harness Engineering Test-Time Compute Chain of Thought Reasoning Models Reward Hacking LLM Agents Blog Map
2026-08-09 · Podcast Interview · full podcast audio + source-first Chen Xun AI 2.0/3.0 reconstruction + Future Forum biography evidence boundary

#38 和软银愿景原GP聊聊,大模型全球降温后,人工智能何去何从

先完整重建陈恂如何从 AI 1.0/2.0/3.0、语言模型的‘反刍’、世界模型、可变成本转固定成本讲到模型社会、行业模型、隐私/IP、OpenAI 的商业壁垒、推理上量、国产算力、投资审美、创业选择和现金流,再抽象基础能力如何通过专业反馈和责任链进入现实。

Zhang Xiaojun Podcast 张小珺 陈恂 Eric Chen AI 3.0 Foundation Models Inference AI Investment Entrepreneurship
2026-08-09 · Podcast Interview · full English podcast audio + Chinese text version + source-first Kevin Kelly reconstruction + official biography/book evidence boundary

#39 对凯文·凯利的50问:垄断者与国界、大富翁与人生

先按英文原声和中文文字版完整讲清凯文·凯利对下一代垄断者、镜像世界、科技国界、AI 安全、创作者经济、学习、财富与人生的连续回答,再抽象外部崛起、基础设施约束和持续学习这套判断,并区分节目观点、官方人物资料与本文推断。

Zhang Xiaojun Podcast 张小珺 Kevin Kelly AI Mirror World Technology and Society Life Advice Creator Economy
2026-08-09 · Podcast Interview · full podcast audio + source-first Silicon Valley AI second-wave reconstruction + product/compute/investment/regulation evidence boundary

#40 和美国科技界人士聊硅谷AI的冷与热:第二波浪潮拉开帷幕

先按完整音频讲清 Kevin Xu、Sophia Xiao 与张小珺如何从 GPT-3、Copilot、ChatGPT 推进到模型不是产品、GPU 短缺、Copilot 工作流、企业战投、并购、研究者创业、开源/闭源和监管,再抽象第二波不是降温而是价值标准转向产品、反馈、算力与责任闭环。

Zhang Xiaojun Podcast 张小珺 Kevin Xu Sophia Xiao Silicon Valley AI Copilot AI Investment AI Regulation
2026-08-09 · Podcast Interview · full podcast audio + source-first middle-tier company reconstruction + Vipshop/TAL public disclosure evidence boundary

#34 被忽视的中腰部公司活得还好吗?他们的欲望、挣扎与天命

先完整讲清吴杉杉从物理博士、麦肯锡和罗兰贝格,到唯品会与好未来战略岗位的经历,再用唯品会的线上奥特莱斯、拼多多冲击、女性消费心智、好未来的军团化与反思文化解释二级赛道的资源禀赋、增长天花板和多元化诅咒。

Zhang Xiaojun Podcast 张小珺 吴杉杉 Vipshop TAL Education Middle-tier Companies Business Strategy Organizational Learning
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Jump Sea reconstruction + community/scale evidence boundary

#36【做个生意吧!】跳向后海的年轻人、酒精和下沉年代

先完整重建梁二狗从多次创业、账面两亿但没有拿到钱、25岁危机,到客厅酒馆、疫情送酒、礼宾部、打酒师、城市扩张、合伙人拆分和‘站在背面’的连续故事,再分析跳海如何把关系获客、低标准化服务、贡献者分配和城市网络接成一门生意。

Zhang Xiaojun Podcast 张小珺 梁二狗 跳海酒馆 Community Business Young People Entrepreneurship Hospitality
2026-08-09 · Podcast Interview · full podcast audio + edited Tencent text mirror + source-first Li Di/XiaoIce reconstruction + XiaoIce paper evidence boundary

#37 小冰李笛讲点真心话:只做大模型不追求商业模式是很难生存的

先按完整音频和编辑文字版讲清李笛从微软/Bing到小冰的情感路线、大模型第二名武器、参数与延迟、API 商业模式、模型震荡、Tay、安全、微博‘癌症’、记忆与意识,再抽象能力、收入、关系与生存的分层。

Zhang Xiaojun Podcast 张小珺 李笛 XiaoIce Large Language Models AI Business Model AI Companions Product Strategy
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Fan Weifeng content-investment reconstruction + industry evidence boundary

#31【趋势2023】和老范从退潮的内容投资谈起

先完整重建范卫锋从公众号、播客和爆款创作者谈到内容投资退潮、IP 与流量、Bigverse、星球研究所、内容加消费和 Disney 路径,再分析创作者天赋如何穿过组织杠杆、用户关系、供应链和 AI 生产门槛形成可持续现金流。

Zhang Xiaojun Podcast 张小珺 范卫锋 老范聊创业 Content Investment Podcast Economy Consumer Brands Artificial Intelligence
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Shi Hongjun publishing reconstruction + official book-source evidence boundary

#32 第一个把查理·芒格引入中国的人和出版风云

先按施宏俊与张小珺的完整对话重建上海人民出版社、世纪文景、中信大方、出版黄金十年、渠道变化、芒格入华、《穷查理宝典》《芒格之道》和芒格书院,再分析一本书如何穿过发现、编辑、分发与关系链成为长期知识资产。

Zhang Xiaojun Podcast 张小珺 施宏俊 Charlie Munger Publishing Poor Charlie's Almanack Knowledge Institutions
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first internal politics reconstruction + organizational evidence boundary

#33【职场人性】企业内斗,究竟在斗什么?

先完整讲清 Colin 如何区分内斗与内耗、战略模糊和资源冗余如何制造流程自保、组织变大后怎样形成烟囱和中层主战场,再分析行业下行、岗位性质、组织商、CEO 责任与个人退出条件。

Zhang Xiaojun Podcast 张小珺 Colin Workplace Politics Organizational Culture Business Strategy Management
2026-08-09 · Podcast Interview · full English podcast audio + edited Chinese text + source-first neuroscience/LLM reconstruction + technical and forecast evidence boundary

#27 英文播客:和深度学习奠基人聊聊大脑、模型和人类的爱

以英文完整音频为主、中文编辑文字为辅,先讲清 Terrence Sejnowski 从物理、神经生物学、计算神经科学到玻尔兹曼机、连接主义、Minsky 争论、ChatGPT 自监督学习、外星人隐喻、价值函数、长期记忆、身体反馈和能力监管的完整回答,再分析为什么模型能力不等于代理能力。

Zhang Xiaojun Podcast 张小珺 Terrence Sejnowski Deep Learning Computational Neuroscience Boltzmann Machine Large Language Models AI Governance
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first foreign-CEO-visit reconstruction + 2023 macro and policy evidence boundary

#29 逆全球化思潮来势汹汹,外企CEO何故密集访华?

先完整还原王威从马斯克 44 小时访华、CDR 与访问脚本讲到握手合影、外企 CEO 访华潮、美国/欧洲/俄罗斯商业力量、三种所有制和逆全球化重新连接,再把礼仪信号、经营依赖、政治关系和经济结果分层,避免把一次会面直接写成关系缓和或增长证明。

Zhang Xiaojun Podcast 张小珺 王威 Deglobalization China Business Global Supply Chain Geopolitics Foreign Investment
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first emotional-intelligence/organization reconstruction + management evidence boundary

#30【职场人性】情商含量越高,公司越平庸?

先完整重建王亚军从清华、麦肯锡、龙湖到宝龙与管理研究的经历,再按节目顺序讲清正式情绪智能与职场口语的差别、情商对个人低成本却对组织高昂、公司阶段、基层/中层/高层、现实感、战略执行合一、企业级方法和双向 ChatGPT 情绪滤镜;最后分析为什么问题不是情商总量,而是现实能否进入共同决策系统。

Zhang Xiaojun Podcast 张小珺 王亚军 Emotional Intelligence Organizational Culture Management Strategy Execution Enterprise
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Beisen/SaaS/AI reconstruction + 2023 financial and forecast evidence boundary

#24【趋势2023】从北森IPO看充满挑战的中国企服这两年

先完整重建熊飞与北森 IPO 的关系,再按节目顺序讲清企服过山车、2020 年现金流盈利、疫情估值膨胀、单月/全年盈亏平衡、2025 年 IPO 判断、PS/PE/NDR、上市与否、客户规模、AI 投资两层、Midjourney/Stable Diffusion、基础设施、SaaS 解决方案和 iPhone/Android 开源类比;最后分析增长质量、现金流与开源生产门槛,并保留 2023 年财务口述与预测边界。

Zhang Xiaojun Podcast 张小珺 熊飞 Beisen SaaS Enterprise Services IPO Open Source AI
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first LLM-market reconstruction + 2023 prediction and geopolitical evidence boundary

#25 OpenAI开源、亚马逊新动作,全球大模型格局走向何方

先完整重建王怀南的创业与投资背景,再按节目顺序讲清 ChatGPT 3.5 到 4.0、简单机会被模型吸收、垂直 Copilot、OpenAI/亚马逊口述、中国小模型叠加、工具/社区/商业模式三层门槛、搜索/电商/娱乐、35 岁以上老兵与第四消费时代;最后分析 AI 应用的责任闭环,并明确所有新闻与预测的 2023 年证据边界。

Zhang Xiaojun Podcast 张小珺 王怀南 OpenAI Amazon Large Language Models Vertical Copilot AI Business Model
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first US market/globalization reconstruction + 2023 legal, hiring and forecast evidence boundary

#15 到美利坚去创业吧:全球化 3.0 的本地化方法

先完整重建 Joyce、Sophia、Camila 对 going global is going local、Globalization 3.0、远程工作、美国招聘/劳动法、Go-to-market、Zoom、跨国团队、996/007、社区和中美互学的连续对话,再分析出海为何等于重新创业、当地人/关系/故事/法律怎样构成基础设施,并保留 2023 年全球化与美国市场观察边界。

Zhang Xiaojun Podcast 张小珺 Joyce Sophia Camila Globalization Go To Market US Market Cross-border Entrepreneurship Internationalization
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first internet-talent/industrial-transition reconstruction + 2023 career and forecast evidence boundary

#16 Colin:那些挣到钱、消失的互联网中高层去哪了

先完整重建 Colin 从 BCG/消费品、百度、美的到爱博星辰创业的职业叙述,再按节目顺序讲清互联网红利与组织膨胀、三分之二出走观察、四个上车时点、Shein 全价值链、职业经理人转 CEO、美的方洪波接班、互联网文化、2023 产业/AI 机会和下一代教育;最后分析平台能力、产业耐心与责任迁移的边界,保留 2023 年行业口述和预测边界。

Zhang Xiaojun Podcast 张小珺 Colin Internet Industry Career Transition Industrial Internet Entrepreneurship Consumer Brands Management Succession
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Hong Kong market/family-office reconstruction + 2023 financial and legal evidence boundary

#17 田娜:沉闷的港股、家族办公室与富豪的苦恼

先完整重建田娜从嘉实、公募、香港金融科技到财富管理的职业经历,再按节目顺序讲清港股从约 1.4 万点反弹、2017—2023 周期、IPO 冷热、乐华娱乐、香港资本五个时代、家族办公室、信托/保险、代际价值观和富人压力;最后分析市场周期、资产治理与传承规则的边界,保留 2023 年金融口述和预测边界。

Zhang Xiaojun Podcast 张小珺 田娜 Hong Kong Hang Seng Index IPO Family Office Wealth Management Trust Asset Allocation
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Southeast Asia small-state/geopolitics reconstruction + 2023 historical and political evidence boundary

#12 黄宇翔:东南亚五个小国的扈从与对冲

先完整重建黄宇翔从上期东南亚六国回应、小国扈从/对冲框架,到缅甸、老挝、柬埔寨、文莱、东帝汶和中国人出海的连续导览,再分析小国如何用多向量外交、区域组织、路权和资源依赖保存自主性,并严格保留战争、人口、政权、经济和历史数字的节目口述边界。

Zhang Xiaojun Podcast 张小珺 黄宇翔 Southeast Asia Myanmar Laos Cambodia Brunei Timor-Leste Hedging Geopolitics
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first cruise-history/tourism reconstruction + 2023 industry and price evidence boundary

#13 刘建斌:邮轮小史与海面上的乌托邦

先完整重建刘建斌从途牛/京东、2008 年接触邮轮、2020 年创业到南极和行业观察的原文,再按时间顺序讲清邮轮从交通工具到移动酒店、巨头并购、教母、奢华与大众产品、服务/空间比、火山、南极和中国市场;最后分析“海上乌托邦”如何由基础设施、服务密度和逃离现实共同构成,保留历史与价格口述边界。

Zhang Xiaojun Podcast 张小珺 刘建斌 Cruise Industry Travel Luxury Travel Tourism Hospitality Maritime History China Market
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Hong Kong language-policy/education reconstruction + 2023 demographic and political evidence boundary

#14 黄宇翔:香港的语言政策、暧昧和青年迷思

先完整重建黄宇翔从“两文三语”、新加坡双语政策到香港教育、语言身份、产业定位和青年出路的连续对话,再分析语言政策如何同时分配认知时间、经济竞争力与政治/文化认同,保留 3%—5%、学校比例和青年观察的 2023 年口述边界。

Zhang Xiaojun Podcast 张小珺 黄宇翔 Hong Kong Language Policy Singapore Education Cantonese Youth Identity
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first American business history/Google/OpenAI reconstruction + 2023 forecast and oral-history evidence boundary

#18 商业口述史:从美国往事,到 Google 输掉 OpenAI 第一局

先完整重建王怀南从社会学、麦肯锡、宝洁、雅虎、陆奇、Google 中国到创业,再按节目顺序讲清雅虎为何错过 Google、收购后自治、ChatGPT 的用户反馈闭环、BabyTree 垂直数据、招聘 Agent、微软/亚马逊/Meta 和 AI 未来;最后分析创始人连续性、闭环与组织学习,并保留 2023 年口述史和预测边界。

Zhang Xiaojun Podcast 张小珺 王怀南 Yahoo Google OpenAI Sam Altman Lu Qi Company History AI Strategy
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first SVB/liquidity/systemic-risk reconstruction + 2023 financial and forecast evidence boundary

#19 王怀南:硅谷银行危机与未来风险传导

先完整重建王怀南在硅谷银行危机周末帮助创业公司确认存款、区分存款人与股东、解释美联储动作和提出三条风险传导方向的连续访谈,再分析利率、资产期限、流动性、专业银行与中国美元 VC 的连接,并保留 2023 年金融数据和预测边界。

Zhang Xiaojun Podcast 张小珺 王怀南 Silicon Valley Bank Banking Crisis Systemic Risk Venture Capital Liquidity Interest Rates
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Latin America market/field reconstruction + 2023 observation and macro evidence boundary

#20 Yunan:The Information 前记者的拉美商业游记

先完整重建 Yunan 从 The Information、中国科技报道、香港/美国到巴西生活两个月的现场叙述,再按节目顺序讲清外卖与出行、税收与劳工法、Growth VC 缺口、warm introduction、家庭与工作、巴西/阿根廷、中文公司与 2C/2B 市场;最后分析出海为什么首先是获取语境与承受制度成本,并保留 2023 年在地观察边界。

Zhang Xiaojun Podcast 张小珺 Yunan Latin America Brazil Argentina Market Entry Globalization
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first AI-market/investment reconstruction + 2023 market and forecast evidence boundary

#21 投资人视角下的大模型和市场真实水温|和梦秋聊 ChatGPT

先完整重建梦秋从‘给大脑做预训练’、ChatGPT 的 iPhone 时刻、AI 1.0/2.0、DeepMind 与 OpenAI、一级市场水温、搜索互补、教育与 SaaS 土地不平整,到 Jasper、垂直数据、创业资金门槛、涌现和 Prompt Engineering 的连续回答,再分析注意力、资本部署、商业落地和反馈所有权如何错位,保留 2023 年市场判断边界。

Zhang Xiaojun Podcast 张小珺 梦秋 Venture Capital ChatGPT Large Language Models AI Investment SaaS
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first NLP/LLM/organization reconstruction + 2023 cost and forecast evidence boundary

#22 要做中国 OpenAI?李志飞劝各位同仁冷静点

先完整重建李志飞从 Hopkins/NLP、Google Translate、深度学习、自监督与大一统模型,到硅谷三问、OpenAI/Google 组织比较、王慧文饭局、五千万美元估算和公司渐进式路线,再分析基础模型、应用模型与公司生存三种问题为何不能被“中国 OpenAI”一个口号覆盖,并明确 2023 年成本、数量和行业预测边界。

Zhang Xiaojun Podcast 张小珺 李志飞 OpenAI Large Language Models NLP AGI AI Organization
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first AI/robotics/entrepreneurship reconstruction + 2023 forecast and oral-history evidence boundary

#23 和傅盛从这场伟大的 AI 变革,谈到创业、恩怨和心性

先完整重建傅盛从 ChatGPT 使用、大模型逻辑能力、爱因斯坦与平民化模型、搜索/办公/社交、服务机器人、家庭 Hub、交互革命到创业危机、恩怨、现金流和年轻人建议的连续访谈,再分析模型能力如何穿过交互、本体和组织成为可交付服务,并保留 2023 年家庭机器人、价格与产业判断边界。

Zhang Xiaojun Podcast 张小珺 傅盛 ChatGPT Robotics Service Robots AI Applications Entrepreneurship
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Shanghai Auto Show/automotive reconstruction + 2023 industry forecast evidence boundary

#26 令德国人惊吓的上海车展:一幅当代汽车众生图

先完整重建张君毅的工程、咨询与汽车投资经历,再按节目顺序讲清中德汽车影响力、上海车展新能源注意力、特斯拉缺席、价格战、去库存、现金流、美法德能力差异、跨国车企决策权、中国品牌十三张门票与合资未来;最后分析注意力如何兑现为产品、权限、现金流和全球交付,并保留 2023 年行业口述与预测边界。

Zhang Xiaojun Podcast 张小珺 张君毅 Automotive Shanghai Auto Show Electric Vehicles China Manufacturing Global Auto Industry
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Benz/Bertha/Daimler reconstruction + Mercedes-Benz official history and oral-history evidence boundary

#41 汽车史话:世界上第一辆燃油车、女车手和慈禧太后

先按节目顺序讲清汽车史话开篇、卡尔·奔驰、戴姆勒、贝莎带两个孩子长途试车、药房燃料、红旗法案、梅赛德斯品牌、第一辆内燃机车的形态、内燃机能源选择、道路/维修/赛车、家族与职业经理人、慈禧车主和未来出行,再抽象新技术如何从原理穿过现场验证、基础设施和组织承接进入社会。

Zhang Xiaojun Podcast 张小珺 张君毅 Carl Benz Bertha Benz Gottlieb Daimler Automotive History Energy Transition
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Ford/Model T/family-business reconstruction + Ford official history evidence boundary

#42 汽车史话:集权者福特与全球第二畅销 T 型车的衰落

先完整重建亨利·福特的农场童年、机械学习、T 型车、单一车型、黑色车、移动流水线、垂直整合、$5 日薪、通用竞争、T 型车衰落、福特家族、爱德塞、福特二世、艾柯卡、穆拉利、福特太太和基金会,再抽象福特如何把低价变成产品—制造—供应链—劳动力系统,以及成功机制如何反过来制造路径依赖。

Zhang Xiaojun Podcast 张小珺 张君毅 Henry Ford Model T Ford Motor Company Family Business Automotive History
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first GM/Durant/Sloan reconstruction + GM official heritage/filing evidence boundary

#43 汽车史话:从‘盛产管理大师’的通用汽车,看美式车企百年荣辱

先按节目推进完整讲清慕尼黑车展的中国速度、杜兰特从马车/别克到通用、并购与财团接管、雪佛兰、斯隆与德鲁克、事业部制、金融创新、2009 年破产、Mary Barra、工会薪酬和多品牌四象限,再分析通用如何把复杂度组织成管理能力,以及多品牌失控时如何变成成本。

Zhang Xiaojun Podcast 张小珺 张君毅 General Motors William Durant Alfred Sloan Professional Management Automotive History
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Goldin/women-and-work reconstruction + Nobel primary materials and China-context evidence boundary

#44 赵耀辉:为什么很多女性在 40+ 消失在职业黄金阶梯上

先按节目顺序完整讲清 Claudia Goldin 的百年女性劳动市场研究、教育/家务技术/避孕药/市场变化、母职惩罚、greedy jobs、统计性歧视、中国 20+ 女性优势与 40+ 流失、托育、产假、晚婚晚育和男性分工,再抽象教育优势如何在生育与不可替代工作中被逐年消磨;独立判断把平等重写为降低岗位对单人持续在线的依赖。

Zhang Xiaojun Podcast 张小珺 赵耀辉 Claudia Goldin Labor Economics Women and Work Parenthood Penalty Gender Equality
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first P&G organization/brand reconstruction + official P&G history/annual-report evidence boundary

#45 王怀南:宝洁为什么能把‘笨方法’做成百年系统

先完整重建王怀南拒绝宝洁 offer 后写信回归、重复面试、Promotion From Within、Up Or Out、品客与用户调研、德国移民与象牙肥皂、军校人才、Brand House、品牌/品类管理、三层创新、中后台、媒介危机和中国消费品机会,再分析宝洁如何把用户、人才、品牌、供应链和组合管理变成长期系统;独立判断把‘宝洁的笨’拆成有意的慢能力与无意的组织迟滞。

Zhang Xiaojun Podcast 张小珺 王怀南 Procter and Gamble Brand Management Consumer Goods Organizational Culture Supply Chain
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first Double Eleven/platform-war reconstruction + Alibaba official campaign disclosure and oral-estimate evidence boundary

#46 赵圆圆:双十一为什么越来越像一场平台混战

先按 2023 年双十一现场顺序完整讲清平台、商家与消费者的疲劳,平台大混战、规则复杂化、直播超级主播、十五年电商演进、平台抽成、幕后战役组织、茅台、逍遥子与消费话题,再抽象年度大促作为协调系统的机制;独立判断把平台真正的稀缺能力定义为把复杂度留在后台。

Zhang Xiaojun Podcast 张小珺 赵圆圆 Double Eleven E-commerce Livestream Commerce Platform Competition Consumer Culture
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first ZhenFund succession reconstruction + official team identity check and oral-history evidence boundary

#47 刘元:徐小平和他的门徒,接班百亿基金的琐碎小事

先核清本期嘉宾是刘元、方爱之是接班主线中的核心人物而非受访者,再按节目推进讲清刘元写信求师、加入真格、错过悦刻、徐小平逐步退出、IC 投决、合伙人培养、创始人四象限和文化细节;独立判断把基金接班拆成决策权、判断能力、关系资产与文化信用的分步转移。

Zhang Xiaojun Podcast 张小珺 刘元 方爱之 徐小平 ZhenFund Venture Capital Succession Organizational Culture
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first OpenAI crisis reconstruction + official OpenAI/Microsoft announcements and time-slice evidence boundary

#48 骆轶航:OpenAI的权力游戏为何失控

先按 2023 年 11 月 OpenAI 罢免 Sam Altman 后的四天四夜完整复原人物、谈判、员工信和微软介入,再讲清创业/安全理念冲突、非营利母体控制商业化实体的治理错配,以及硅谷政治、联盟与隐形不平等;独立判断把危机抽象为使命控制权、运营信息和问责能力没有匹配。

Zhang Xiaojun Podcast 张小珺 骆轶航 OpenAI AI Governance Sam Altman Silicon Valley Politics Nonprofit Governance AI Safety
2026-08-09 · Podcast Interview · full podcast audio + public chapter description + source-first NIO/XPeng/Li Auto history reconstruction + official company disclosure and oral-history evidence boundary

#49 王潘:蔚小理如何穿越新能源车生死线

先按节目时间线完整讲清王潘如何复原蔚来、理想、小鹏在 2014–2015 年的入局、找人找钱、产品路线、2019 年资金与交付危机以及 2020 年资本窗口,再解释三家公司分别把风险配置到品牌服务、增程产品与智能化技术;独立判断把‘穿越生死线’拆成现金时间、产品适配、组织执行和外部窗口的乘积。

Zhang Xiaojun Podcast 张小珺 王潘 New Energy Vehicles NIO XPeng Li Auto Automotive History Startup Survival
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first young-founder/AIGC reconstruction + SIGGRAPH primary event record and founder-claim evidence boundary

#50 宋亚宸:95后/00后创业者的‘马斯克值’与现实

先完整讲清宋亚宸从商汤 CEO 办公室、MiniMax 到 VAST 3D 的路径,再还原年轻创业者的内容与游戏积累、AI 1.0/2.0、寒冬融资、无工资无算力的早期现实、SIGGRAPH keynote、人才黑洞、技术/产品文化冲突和 AIGC 模板;独立判断把‘年轻优势’重写为长期兴趣、低路径依赖与快速反馈的组合,而非年龄标签。

Zhang Xiaojun Podcast 张小珺 宋亚宸 Yachen Song AIGC 3D Generation Young Founders Startup Culture SIGGRAPH
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first automotive-export reconstruction + CAAM, Toyota and Honda primary-history evidence boundary

#51 张君毅:汽车出海不是销量竞赛,而是地缘与制造系统

先完整重建中国汽车从早期出口受阻、2021–2023 年新能源汽车窗口,到丰田进入美国、本田从摩托车起步、精益生产与日本汽车危机的连续叙事,再提炼产品适配、合规地缘、销售服务、本地制造和组织学习五层出海闭环;独立判断把出口量降回全球经营的前半程。

Zhang Xiaojun Podcast 张小珺 张君毅 Automotive China Auto Export Geopolitics Toyota Production System Honda History Global Manufacturing
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first workplace-envy reconstruction + Annual Review scope and anecdotal-management evidence boundary

#52 王亚军:职场嫉妒如何变成组织的暗流

先按节目推进完整讲清嫉妒如何从‘别人有、我没有’进入岗位分配、领导与下属、同级晋升、绩效评审、办公室空间和企业家决策,再解释正/负嫉妒、‘性/恐惧/爱/信仰’个人框架、内部竞争和入职投资尽调;独立判断把嫉妒视为资源分配与程序公平的报警器,而不是管理 KPI。

Zhang Xiaojun Podcast 张小珺 王亚军 Workplace Envy Organizational Psychology Management Fairness Organizational Culture
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first MINISO retail/globalization reconstruction + company disclosure and consumer-claim evidence boundary

#56 沈帅波:名创优品、分级消费与中国零售全球化

先完整讲清沈帅波从县域消费、实体创业和沉浸式调研进入名创优品,再按单店模型、托管式加盟、供应链、IP、门店密度、直营/代理选择和国家代表重建名创全球化;独立判断把消费升级/降级改写为分级选择,把零售壁垒定义为细节、现金反馈与本地适配的总和。

Zhang Xiaojun Podcast 张小珺 沈帅波 MINISO Retail Consumer Segmentation Globalization Supply Chain IP Retail
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first Shanghai/stock-market reconstruction + exchange, regulator and drama evidence boundary

#57 梁捷:真实版《繁花》、90 年代上海与股市制度试错

先完整还原梁捷如何从小说与电视剧的差异、黄河路的本地记忆讲到上海股市从小柜台、纸质股票和老八股走向电子化与监管,再解释宝总、A 先生、强总、宝延风波、认购证、327 与 519;独立判断把电视剧的英雄叙事还原为城市空间、制度试错和多数人的下岗与希望。

Zhang Xiaojun Podcast 张小珺 梁捷 Blossoms Shanghai Stock Market History Bao-Yan Event Financial Regulation
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first China entrepreneur history reconstruction + business-era and forecast evidence boundary

#58 吴晓波:中国企业家小史与没有大生意之后的人生

先按节目顺序讲清吴晓波如何从茅台的工艺、时间与匠人型企业家切入,重建近百年中国企业家代际、互联网一代的特殊入口、AI 作为工具的边界,以及父辈成功给下一代带来的压力;独立判断把茅台与腾讯拆成两种生产函数,指出大机会退潮后真正稀缺的是愿意长期重复并积累信任的方向。

Zhang Xiaojun Podcast 张小珺 吴晓波 China Business History Entrepreneurship Kweichow Moutai Consumer Brands Life Choice
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first Moonshot/AGI/Sora reconstruction + model, user-scaling and forecast evidence boundary

#59 杨植麟:长文本、非共识与 Sora 之前的 AGI 创业路线

先按两次访谈完整还原杨植麟从语言模型、AGI 组织、Google 第一性原理、ChatGPT 后资本/人才/算力窗口讲到长文本、Kimi、User Scaling 和有概率的非共识,再解释 Sora 的一致性、视频世界模拟器、统一架构与数字—物理世界连接;独立判断把长上下文重写为状态预算和责任链。

Zhang Xiaojun Podcast 张小珺 杨植麟 Moonshot AI Kimi Long Context World Models Sora User Scaling AGI
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first Baichuan/AGI reconstruction + product, team and forecast evidence boundary

#61 王小川:技术与市场之外,中国 AGI 的第三种可能

先完整还原王小川如何回应朱啸虎与杨植麟、提出 TPF、把 AGI 应用解释为造人,再讲清生命建模、三座模型大楼、百川快速入场、搜狗经验、2B/2C、Sora 取舍与春节后从追随 GPT 转向自有价值观;独立判断把第三种声音抽象为模型能力、场景纵深、用户反馈和组织共创的生产函数。

Zhang Xiaojun Podcast 张小珺 王小川 Baichuan AI Technology-Problem Fit AGI Long Context Healthcare AI AI Applications Organization Design
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first cross-border M&A reconstruction + transaction, integration and macro-window evidence boundary

#63 王威:中资出海并购大时代与先正达

先完整还原王威从央企、民企、外企文化差异讲到企业并购与 VC/PE 的区别,再按联想—IBM、吉利—沃尔沃、2009–2017 出海窗口、先正达 430 亿美元交易和四阶段整合讲清中国资本出海的商业史;独立判断把并购的核心抽象为把外部资产、人才与组织能力迁移进自己的战略。

Zhang Xiaojun Podcast 张小珺 王威 Cross-border M&A Syngenta Globalization Corporate Strategy Organization Integration China Capital
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first AGI-infrastructure reconstruction + compute/energy estimate and forecast boundary

#64 广密:AGI 大基建时代,电 + 芯片 = 产出智能

先完整还原广密对 2024 Q1 全球模型赛局、开源、多模态、Inflection、AGI 渐进式解锁、Coding、信息检索和模型/产品南北坡的讲解,再把电力、GPU、万卡集群、数据中心、Scaling Law、Agent、OpenAI 芯片、机器人和硅基智能放进 AGI 大基建链;独立判断指出竞争单位是单位芯片与能源带来的有效学习,而非单纯卡数。

Zhang Xiaojun Podcast 张小珺 广密 AGI Infrastructure Scaling Law Multimodal AI Compute Energy AI Agents Robotics
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first venture-capital/robotics reconstruction + investment-claim and market-forecast boundary

#65 梦秋:风险投资的钥匙失灵了吗?

先按节目顺序还原梦秋如何从美元 VC 募资与 IPO 出口、分红和明股实债,讲到机器人本体、AI for Science、Coding、语音、垂直模型、自动驾驶、消费和养老经济,再分析 VC 从高赔率组合转向现金流层与选择权层;所有基金规模、项目数量、行业缩水和未来判断均保留口述边界。

Zhang Xiaojun Podcast 张小珺 梦秋 Venture Capital Robotics AI for Science AI Coding Startup Survival Consumer Insight China AI
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first IPO/multimodal/entrepreneurship reconstruction + company-claim and forecast boundary

#66 李志飞:IPO、GPT-4o 与前沿科技创业的痛

先完整还原李志飞从出门问问 IPO、前沿技术为何落到项目制、GPT-4o 多模态和 OpenAI/Google 发布会,讲到 API 降价、模型—产品一体化、具身智能、创业现金危机、魔音工坊与十二年战略复盘;独立判断把前沿创业抽象为能力、产品、经济和范式迁移的转换预算。

Zhang Xiaojun Podcast 张小珺 李志飞 出门问问 GPT-4o Multimodal AI Embodied AI AI Entrepreneurship Product Strategy Startup Survival
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first NVIDIA organization reconstruction + management-framework and evidence boundary

#67 谈谈黄仁勋搭建的组织系统:分布式操作系统,“就像一台GPU”

先完整还原王亚军如何从英伟达 60 位高管直接汇报、不做一对一、公开反馈、邮件现实感、不裁员、不做长期计划和爱与关爱,推导出分布式决策与高创业力敏捷组织,再解释 GPU 类比、康威定律、context not control、横向协作与信任;独立判断指出真正稀缺的不是扁平,而是把现实变成共同推理。

Zhang Xiaojun Podcast 张小珺 王亚军 NVIDIA Organization Design Distributed Decision-Making Conway's Law Innovation Trust Leadership
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first MiniMax/product/capital reconstruction + financing and commercialization evidence boundary

#68 和MiniMax天使投资人聊,MiniMax幕后故事和大模型资本扑克牌

先完整还原陈昱从 GenAI Summit、中美资本与十年 AI 浪潮,讲到 MiniMax 从商汤团队、数字人、Glow、Talkie、海螺 AI、星野到模型质量与创始人分工,再分析巨头降价、Club Deal、融资入围线和并购选择;独立判断把 MiniMax 的赌注抽象为模型质量、产品现金流与资本续航的共同飞轮。

Zhang Xiaojun Podcast 张小珺 陈昱 MiniMax Foundation Models AI Applications Venture Capital Club Deal Model Quality China AI
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first AI application ecosystem reconstruction + model economics and forecast boundary

#69 口述全球大模型这半年:Perplexity突然火爆和尚未爆发的AI应用生态

先完整还原广密如何从 Perplexity 的成立、团队、投资人、信息检索与 PMF 讲到 AI 应用为何没有系统性爆发,再解释模型能力、成本、延迟、多模态、端侧、RAG、GPT-5、Scaling Law、巨头依赖和中美创新生态;独立判断指出应用爆发是能力、经济性、入口、反馈与组织瓶颈逐层迁移的结果。

Zhang Xiaojun Podcast 张小珺 广密 Perplexity AI Applications AI Search Model Economics RAG Multimodal AI Silicon Valley
2026-08-08 · Podcast Interview · full YouTube audio + public chapter description + source-first XPeng/FSD/foundation-model reconstruction + hardware/data/organization evidence boundary

#70 何小鹏:FSD、“在血海游泳”、乱世中的英雄与狗熊

先完整还原何小鹏从小米 SU7 发布会、UC 与小鹏的智能化基因、自动驾驶卖车,到 ChatGPT 后读论文、重写数据流、仿真训练、拜访黄仁勋、吴新宙离开、华为竞争、G9 反思、组织变革、MONA M03 和 FSD/Waymo 实测,再进入大模型汽车的六层壁垒与数据—费用—销量飞轮;独立判断指出大模型重构的是汽车公司的单位学习成本,而不是一次性增加一个功能。

Zhang Xiaojun Podcast 张小珺 何小鹏 XPeng FSD Waymo Autonomous Driving Foundation Models Automotive AI Organization
2026-08-08 · Podcast Interview · full YouTube audio + public chapter description + source-first Robotaxi/evaluation-system reconstruction + L2/L4 and data-quality evidence boundary

#71 楼天城:Robotaxi、ACRush 与 L2/L4 的不同目标

先完整还原楼天城从武汉无人车、1/10/100/1000/10000 小时无接管阶梯、Contest-based metric system、端到端、激光雷达/纯视觉/V2X 和 L2/L4 目标函数讲起,再讲清数据超过人类后为何可能成为干扰、Robotaxi 的可预测体验、Pony.ai 的创业与姚班/ACRush 经验;独立判断指出自动驾驶真正稀缺的是定义“什么叫更好”的评价器。

Zhang Xiaojun Podcast 张小珺 楼天城 Robotaxi L2 L4 Autonomous Driving Data Quality Evaluation ACRush
2026-08-08 · Podcast Interview · full YouTube audio + public chapter description + source-first Waymo/Robotaxi operations reconstruction + L4 competition and economics evidence boundary

#74 孟醒:Waymo 和它的对手们

先完整还原 Waymo 从 Google X、DARPA 前史、领导层变化、规则到数据驱动的技术迭代,再讲清孟醒在凤凰城对 Waymo 的真实乘车、停车场长尾、远程协助、运营中心和极限测试,以及 Cruise、Uber、Zoox、Aurora 的分化;独立判断把 L4 护城河从模型准确率推进到异常、责任、车队和单位经济的闭环。

Zhang Xiaojun Podcast 张小珺 孟醒 Waymo Robotaxi L4 Autonomous Driving Cruise Uber Physical AI
2026-08-08 · Podcast Interview · full YouTube audio + public chapter description + source-first global M&A/operations reconstruction + transaction/valuation/return evidence boundary

#77 陆复斌:并购重组会兴起吗?

先完整还原陆复斌从 NASA、Chegg、亚马逊 Two-Pizza Team、百度到全球并购经营的履历,再按 Grindr、英为财情、Coins 和 Yahoo 竞价讲清并购来源、宏观周期、定价、经营者、尽调、跨国差异与退出;独立判断指出并购的最小单位不是交易,而是一个能被接住、整合并持续产生现金流的经营结果。

Zhang Xiaojun Podcast 张小珺 陆复斌 M&A Private Equity Internet Operations Grindr Investing.com Globalization Business Strategy
2026-08-08 · Podcast Interview · full YouTube audio + public episode description + source-first autonomous-driving venture-cycle reconstruction + valuation/cycle/forecast evidence boundary

#78 孟醒:自动驾驶创投过山车这八年

先完整还原孟醒从顺为投资、滴滴自动驾驶 COO 到再次回到投资与孵化的经历,再讲清小鹏、Momenta、Cruise、L2/L4、2016–2024 自动驾驶融资周期、人才来源和无人长期运营;独立判断把技术进度、资本周期、业务闭环和创始人心态拆开,指出真正的反共识是为第二阶段准备资本结构。

Zhang Xiaojun Podcast 张小珺 孟醒 Autonomous Driving Venture Cycles L2 L4 Deep Tech Startup Strategy Incubation
2026-08-08 · Podcast Interview · full YouTube audio + source-first Robotaxi/event reconstruction + operations/unit-economics/teleoperation evidence boundary

#79 孟醒:特斯拉 Robotaxi 大会与无人运营的隐性成本

先完整还原孟醒和张小珺如何点评特斯拉 Robotaxi 大会:从延期、CyberCab、Robovan、Optimus 和 Unsupervised FSD,推进到 L2/L4 责任、片场测试、单位经济、Car Partner、充电洗车、集中式车库与遥操作;独立判断把演示、能力、运营和责任拆开,指出 Robotaxi 的核心是接管司机原本隐形承担的系统责任。

Zhang Xiaojun Podcast 张小珺 孟醒 Tesla Robotaxi Autonomous Driving FSD Optimus Physical AI
2026-08-08 · Podcast Interview · full YouTube audio + Tencent public chapter article + source-first community/AI-search reconstruction + ASR/name/metric boundary

#80 周源:知乎、AI 搜索与社会化编辑部

先完整还原周源如何从 ChatGPT 带来的脱节感、AIGC/UGC 边界、面壁智能投资和知乎直答,讲到 Perplexity、搜索生态、人与人讨论的信任,再回到数据库开发、记者、群体博客、MetaSource、知乎创业、上市后的战略摇摆与 CEO 孤独;独立判断指出 AI 先淘汰的可能是没有解释力的内容生产链,社区壁垒要落到来源、作者、追问和责任。

Zhang Xiaojun Podcast 张小珺 周源 Zhihu AI Search Content Community Perplexity Community Growth Entrepreneurship
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first founder-supply reconstruction + moat/selection evidence boundary

#28 刘元:AI 黑客松、创业者供给与狂欢中的忧伤

先完整还原刘元从 AI 黑客松 90 个项目、Copilot Demo 和应用层护城河讲起,再讲清即刻与 Monica 的创业反馈、创始人工资、黑客松的训练价值、中美小天才/老司机/操盘手/技术派供给、AI 对投资方法和信息服务的冲击;独立判断区分案例口述、结构化框架和虚无主义情绪。

Zhang Xiaojun Podcast 张小珺 刘元 AI Hackathon Startup Founders Venture Capital AI Applications China-US Comparison Product Strategy
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first Sora reconstruction + model/product/forecast evidence boundary

#60 戴雨森与季逸超:Sora 的信息拼图与大模型淘汰赛

先按节目顺序重建戴雨森与季逸超如何从 Sora 发布反应、团队和组织文化讲到模型规模、数据、原生分辨率、世界模拟器与多模态,再分析 GPT 时刻与产品化、模型淘汰赛、AI 应用扩散、投资筛选和个人数据;独立判断区分官方信息、嘉宾推测、产品门槛和世界模型证据。

Zhang Xiaojun Podcast 张小珺 戴雨森 季逸超 Sora Multimodal Models World Models AI Applications Venture Capital
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first commercialization reconstruction + PMF/data/claim boundary

#62 朱啸虎:AIGC 应用、商业化与中国创业的中间地带

先完整还原朱啸虎如何从中美模型分工、被投公司转向 AIGC、AI 视频面试和真实业务数据讲起,再解释 PMF、基础模型资本密度、B2B 先行、中国独有场景、SaaS 寒冬、创业者选择和现金流;独立判断把模型能力、应用闭环、客户结果与可证伪条件分开。

Zhang Xiaojun Podcast 张小珺 朱啸虎 AIGC Applications AI Investment PMF Business Model China AI Startup Strategy
2026-08-08 · Podcast Interview · full YouTube audio + public chapter page + source-first AGI/ecosystem reconstruction + inference-cost/forecast/transferability evidence boundary

#81 李开复:AGI 霸权、低成本推理与中国的第二条道路

先完整还原李开复如何从 Geoffrey Hinton、神经网络与 GPU 历史讲到零一万物的创业选择,再解释低成本推理、模印一体、美国 AGI 路线与中国第二条道路、海外 2C/国内高价值 2B、Service as Software、助手与 Super App;独立判断把价格、模型能力、结果数据和可切换生态拆开,区分节目时期口述、Epoch Scaling 背景与可验证机制。

Zhang Xiaojun Podcast 张小珺 李开复 AGI Hegemony Inference Cost Zero One Everything AI Applications Service as Software China AI Strategy AI Ecosystem
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first autonomous-driving reconstruction + intervention/latency/data boundary

#72 孟醒:特斯拉 FSD、端到端与 L2/L4 的两套安全体系

先完整还原孟醒从创业、投资、滴滴自动驾驶到亲自试驾 FSD 的经历,再讲清 Waymo 与 Tesla 的拐点、V11/V12 体验、端到端架构、BEV/Transformer、数据闭环、传感器、L2/L3/L4 责任和中国落地;独立判断把能力、可靠性、责任、量产和商业化分开。

Zhang Xiaojun Podcast 张小珺 孟醒 Tesla FSD End-to-end Driving Autonomous Driving L2 L4 Safety Responsibility
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first industry reconstruction + reward/environment/transfer evidence boundary

#73 广密:Self-play RL 会不会成为 AGI 的下一条 Scaling Law

先按节目顺序重建广密对预训练 Scaling、数据与 GPU 工程瓶颈的解释,再讲清 Self-play RL 的 agent—environment—action—reward 闭环、奖励黑客、推理时计算、Coding、视频、机器人、中美研究文化与 AI 资本叙事;独立判断提出生成、验证、迁移、变现四道 Scaling Law 门槛。

Zhang Xiaojun Podcast 张小珺 广密 Self-play RL Scaling Law AGI Coding Agent Robotics AI Industry
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first reasoning reconstruction + verifier/medical-roadmap evidence boundary

#76 王小川:从快思考到慢思考,强化学习如何进入医疗

先完整还原王小川如何把 o1 解释为预训练与强化学习的学—思融合,再讲清思维链、隐藏过程、监督学习与强化学习、验证器、数学代码诗歌和医疗,最后分析数字医生、TPF、水涨船高场景与顾问定位;独立判断区分路线假说、公司愿景、可验证结果和医疗责任。

Zhang Xiaojun Podcast 张小珺 王小川 OpenAI o1 Reinforcement Learning Post-training Medical AI Digital Doctor AI Product Strategy
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first technology-philosophy reconstruction + centralization/decentralization evidence boundary

#82 Vitalik:LLM 的权力、Crypto 的规则与一条去中心化 AI 路线

先完整还原 Vitalik 从语言学习、AI 与区块链分工谈到 OpenAI、LLM 黑盒、AI 参与 Crypto 游戏、去中心化 AI、Farcaster、身份和普通人应用,再分析算力/数据权力、公开规则、数据控制与退出权;明确区分哲学框架、技术假设和成熟度证据。

Zhang Xiaojun Podcast 张小珺 Vitalik Buterin Ethereum Crypto Decentralized AI Open Source Technology Philosophy Digital Identity
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first product reconstruction + accuracy/recall and business-claim boundary

#84 岂凡超:模型不能单独创造价值,AI 产品要先解决可信的信息消费

先讲清岂凡超从清华 NLP、Wantwords 到深言科技语鲸的创业路径,再解释模型不确定性、信息单元、跨来源去重、结构保持、可追溯输出、被动信息入口、Cursor/NotebookLM/Perplexity 和 AI 组织;独立判断聚焦可信压缩、评价集、信息流与融资/商业化边界。

Zhang Xiaojun Podcast 张小珺 岂凡超 深言科技 语鲸 AI Applications Information Assistant Product Reliability Content Systems
2026-08-08 · Podcast Interview · full YouTube interview + public sentence-level transcript + source-first founder reconstruction + guest roadmap and metric boundary

#87 李想:宅男、AI、家庭、游戏和天梯

先完整还原李想从宅男、游戏和社会天梯谈到理想成为 AI 公司,再解释功能与能力、理想同学的长期记忆、企业原子数据与后训练、端到端自动驾驶、世界模型、产品体验和 AI 组织;独立判断聚焦能力如何经由数据、终端、安全和责任进入物理世界。

Zhang Xiaojun Podcast 张小珺 李想 Li Auto AI Product Autonomous Driving World Model Physical AI AI Organization
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first Middle East portrait reconstruction + national-plan and anecdotal-claim evidence boundary

#53 李黎:赴中东掘金的中国人肖像

先完整还原李黎 16 天走访沙特、阿联酋和卡塔尔时遇到的巨头员工、创业者、学生、年轻职场人和灰度生意人,再解释三波中国人进入中东、Vision 2030、商务礼仪、华为式本地化、小订单到大业务、主权资本与能源/绿色叙事;独立判断把‘中东热土’拆成国家战略、本地信任、交付能力和组织本地化的乘积。

Zhang Xiaojun Podcast 张小珺 李黎 Middle East Saudi Vision 2030 Globalization Chinese Entrepreneurs Sovereign Wealth Funds Localisation
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first 2023 LLM reconstruction + official release, estimate and forecast evidence boundary

#54 广密:口述全球大模型这一年

先按节目时间线完整讲清广密如何从 OpenAI、Anthropic、Google、GPT-4、Claude 2、Gemini、开源和多模态讲到人才、GPU、数据、Scaling Law、训练成本、Agent、VC、自动驾驶和 OpenAI 治理,再把 2023 年的公开事件、嘉宾估算与预测分开;独立判断把大模型竞争抽象为能力曲线、成本曲线和反馈闭环的共同约束。

Zhang Xiaojun Podcast 张小珺 广密 Global LLM Scaling Law Multimodal AI AI Agents AI Capital Open Source Models
2026-08-08 · Podcast Interview · full podcast audio + public chapter description + source-first career/content reconstruction + personal-experience and macro-claim evidence boundary

#55 小Lin:周期中的微小个体与内容生产方法

先完整还原小Lin从金融专业、纽约投行、留学生求职创业到财经内容创作的经历,再讲清她如何用日本与国家周期解释个人处境、用‘热点+故事+干货’组织内容、用知识树把资料压缩成主线,并回答互联网大厂、大学试错、性格适配和生命质量;独立判断把职业选择重写为低成本验证与保留转向权。

Zhang Xiaojun Podcast 张小珺 小Lin Lindsay Financial Literacy Career Transition Content Strategy Economic Cycles Life Choice
2026-08-02 · Tech Analysis · four full papers + formulas, main tables, ablations and limitations + cross-paper mechanism and evidence audit

语音 OPD 四篇工作深读:学生听错之后,教师究竟怎么教

用同一条音频样本完整重建 CORD、X-OPD、Ark-ASR OPD 与 X³-OPD:解释学生 rollout、同模型文本教师或外部文本教师、reverse KL、关键 token 加权、GRPO、union top-k、teacher-data warm-up 与三层音频推理数据各自解决什么问题;逐项核对跨模态落差、ASR CER/WER、能力保持和失败轴,指出语音 OPD 当前擅长修复可文本化的推理轨迹,却仍受文本教师无法直接感知音乐、音色和细微韵律的监督上限约束。

On-Policy Distillation Speech LLM Audio Language Model CORD X-OPD Ark-ASR X3-OPD Cross-modal Distillation Audio Reasoning Automatic Speech Recognition
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + OpenAI Operator/CUA primary sources + closed-loop, safety and forecast boundary

#88 吴翼:Operator 不是会点网页,而是推理进入闭环

先完整还原吴翼如何从 Operator 的网页 demo 讲到 CUA、截图—推理—动作闭环、2016 年 Web Agent 失败史、OpenAI 五级路线、人机协作、用户数据、物理世界与学术非共识;再用 OpenAI Operator/CUA 一手资料审计模型、基准、安全、产品演进和嘉宾推断。

Zhang Xiaojun Podcast 张小珺 吴翼 OpenAI Operator Computer-Using Agent CUA Agent Multimodal Reasoning Reinforcement Learning
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + DeepSeek/Kimi/OpenAI primary sources + source-first algorithm and reproducibility boundary

#89 潘家怡:DeepSeek-R1、Kimi K1.5 与 o1 的推理训练

先把潘家怡近三小时的论文共读完整讲清楚:o1 的训练时/测试时计算、R1-Zero 的纯 RL、R1 的冷启动与蒸馏、GRPO、PRM/MCTS、Kimi K1.5 的长度控制与课程学习,再分析为什么真正被减少的是逐步示范,而不是数据、任务、验证器和人类设计。

Zhang Xiaojun Podcast 张小珺 潘家怡 DeepSeek-R1 Kimi K1.5 OpenAI o1 GRPO Reinforcement Learning Reasoning Models
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + DeepSeek-R1 primary source + investment-claim and data-boundary audit

#90 朱啸虎:DeepSeek 之后,AIGC 投资判断要怎样重写

先完整还原朱啸虎如何从一年前不信 AGI、拒投中国基础模型,转向重新评估 DeepSeek、开放底座、数据瓶颈、应用、Agent、Stargate 与海外机会;再把 Android 类比、意识判断、用户增长、成本和数据飞轮拆成嘉宾口径、DeepSeek 一手资料与独立投资框架。

Zhang Xiaojun Podcast 张小珺 朱啸虎 DeepSeek AIGC AI Applications Investment Data Moat Open Models
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + nine DeepSeek primary papers + verification-feedback and cost-claim boundary

#91 何俊贤:逐篇讲解 DeepSeek 关键九篇论文

先按节目顺序完整还原 DeepSeek LLM、DeepSeekMoE、V2、V3、Coder、Coder-V2、Prover、Prover-V1.5、R1/R1-Zero 的技术链,解释 MoE、MLA、FP8、MTP、代码/Lean 验证器和冷启动 RL 怎样逐步汇合;再把“低成本”“涌现推理”“开放文化”拆成论文自报、嘉宾判断和可被推翻的独立结论。

Zhang Xiaojun Podcast 张小珺 何俊贤 DeepSeek DeepSeekMoE MLA DeepSeek-R1 Code Intelligence Formal Theorem Proving Reinforcement Learning
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + NSA/MoBA/MiniMax primary papers + hardware, benchmark and forecast boundary

#94 杨松琳:DeepSeek、Kimi、MiniMax 注意力机制新论文

先从 Q/K/V、二次计算和 KV cache 讲清长上下文为何昂贵,再按节目顺序解释 DeepSeek Native Sparse Attention、Kimi MoBA 和 MiniMax Lightning Attention 的选择、压缩、局部窗口、线性状态与硬件执行;随后把三条路线抽象为历史访问预算,并审计论文自报结果、嘉宾对后续模型路线的预测和等预算比较要求。

Zhang Xiaojun Podcast 张小珺 杨松琳 Native Sparse Attention MoBA Lightning Attention Long Context Model Architecture Hardware Co-design
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + source-first technical reconstruction + cost, legal-level and route-attribution boundary

#96 郎咸朋:自动驾驶十年演进史、关键技术细节与特斯拉

先把郎咸朋从高精地图、多激光雷达、BEV+Transformer、特斯拉纯视觉到端到端和 L3/L4 责任的完整叙述讲清楚,再分析自动驾驶十年真正更换的是世界表示和学习接口,而不是简单的传感器信仰;成本、芯片、路线归因和“L3 是 L4 先导”均按嘉宾口径与工程判断分层。

Zhang Xiaojun Podcast 张小珺 郎咸朋 Autonomous Driving BEV Transformer End-to-End Driving Tesla L3 L4
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + RT-1/RT-2/OpenVLA/pi0 primary papers + VLA generalization and online-RL boundary

#98 陈建宇:机器人基座模型与 VLA 经典论文

先按论文史完整还原陈建宇如何从传统机器人“一百种场景、一百套模型”讲到 LLM/VLM 进入规划、感知和控制,再解释 VLA、RT-1、RT-2、Open X-Embodiment、OpenVLA、Pi0、GR00T、HiRT 与在线 RL 的关系;最后把人类类比、跨本体数据、动作头、层级策略和现实试错成本分开审计。

Zhang Xiaojun Podcast 张小珺 陈建宇 Robotics Foundation Model VLA RT-1 RT-2 OpenVLA Embodied AI Online RL
2026-08-02 · Podcast Interview · full YouTube interview + public transcript + Energy Singularity/ITER primary materials + engineering-stage and cost-claim boundary

#99 杨钊:人类驯服可控核聚变还有多远

先完整讲清杨钊如何从核裂变、托卡马克、低温/高温超导、Q 值和三重积,走到能量奇点的洪荒 70、洪荒 170、洪荒 380 与商业化阶梯;再分析高温超导路线真正要验证的是装置能否更快迭代,而不是一次放电就等于商业发电,并把成本、工期、燃料、AI/太空愿景分成嘉宾口述、公司公开资料和独立判断。

Zhang Xiaojun Podcast 张小珺 杨钊 Energy Singularity Controlled Fusion Tokamak High-Temperature Superconductivity Hard Technology Energy
2026-07-31 · Podcast Interview · full YouTube interview + machine-transcription boundary audit + Tsinghua/KAN primary materials + evidence-layered analysis

刘子鸣访谈深读:AI for AI 不是自我神话,而是把模型研究变成可实验的科学

完整梳理 #149 刘子鸣 1 小时 40 分钟访谈:从 KAN、神经—符号连接、Physics of AI,到 O-P-H-I-S 研究结构、原模型预测训练曲线、AI for AI 与 training autopilot;严格区分嘉宾提出的研究纲领、公开论文与机构资料,以及尚未验证的融资、产品和时间表判断。

Liu Ziming AI for AI Science of AI Physics of AI KAN Auto Research Mechanistic Interpretability Research Agents Model Design AI Entrepreneurship
2026-07-31 · Podcast Interview · YouTube-first interview + long-version boundary audit + vLLM/PagedAttention/Inferact primary materials + evidence-layered analysis

游凯超访谈深读:vLLM 从一篇论文走向开源基础设施与模型—Infra 共设计

完整梳理 #148 游凯超 YouTube 版 2 小时 06 分钟访谈:从 PagedAttention、vLLM 的伯克利开源传统,到 PyTorch 基金会、Inferact 公司化、开源治理和模型—Infra co-design;明确 YouTube 版在 2:06:37 截断,小宇宙长版多约 54 分钟,不混写两个版本。

You Kaichao vLLM Inferact PagedAttention LLM Inference AI Infrastructure Open Source Governance Model Infra Co-design Speculative Decoding Berkeley
2026-07-31 · Podcast Interview · full interview + public transcript audit + Robbyant LingBot papers/repos + evidence-layered analysis

沈宇军访谈深读:具身原生的真正瓶颈,从架构选择走向数据规模化

完整梳理 #147 沈宇军 1 小时 52 分钟访谈:从 LingBot 的视觉、深度、VLA、视频/世界模型与 VA 模型族,到约 6 万小时数据、跨本体泛化、任务后训练、身体—传感器协同和具身原生创业;把团队口述、官方论文/代码和本文推断分层,指出下一道门槛是数据诊断学而不只是更大模型。

Shenyujun LingBot Embodied AI Vision-Language-Action World Models Robot Data Native Video-Action Spatial Perception Physical AI Robotics Evaluation
2026-07-31 · Podcast Interview · full YouTube interview + public Scripod sentence-level transcript + official paper/product/protocol cross-check + forecast and time-boundary audit

#97 广密:Pre-training 叙事回归与 AGI 的登山路线

完整解释广密在 2025 年第一季度提出的非共识:预训练并未结束,后训练/RL 负责激活与塑形,Coding 是高反馈的 AGI 环境,Agent 需要环境、工具、记忆、规划和评价,路线再延伸到 AI for Science 与机器人;随后将 OpenAI/Anthropic 判断、token 经济、MCP、DeepSeek-R1 和两年 AGI 等内容分成技术假说、官方事实与强预测。

Zhang Xiaojun Podcast 张小珺 广密 Pre-training AGI Agent AI for Science DeepSeek Model Companies
2026-07-31 · Podcast Interview · full YouTube interview + public Scripod sentence-level transcript + Mercedes official technical cross-check + CEO-claim and ASR numeric boundary

#100 康林松:奔驰的转型,不是豪华与电动化二选一

先还原奔驰全球 CEO 康林松如何回答中国市场、电动化、豪华策略、CLA、800V、MB.OS、合作伙伴、DeepSeek 和 CEO 决策,再分析一家 139 年老公司如何把燃油/混动与纯电、品牌历史与软件架构、内部能力与外部合作放进同一套可演进系统;单独校正 ASR 将 10.9 kWh/100 km 误识别为约 11000 Wh/100 km 的技术数字。

Zhang Xiaojun Podcast 张小珺 康林松 Mercedes-Benz Automotive Electric Vehicles MB.OS Digital Luxury Transformation
2026-07-31 · Podcast Interview · full YouTube interview + public Scripod sentence-level transcript + source-first product history + unreliable speaker attribution and forecast boundary

#101 明超平:YouWare 把 Coding 变成新的创作媒介

完整讲清明超平从 OnePlus、ByteDance、Kimi、Noisee 到 YouWare 的产品来路:辩论和数据如何塑造用户判断,Noisee 为什么从 Sora/Suno 的需求中出现又停止,YouWare 早期版本如何从 AI 原生退化成工程模板,以及 Coding 为什么被他视为像相机一样的新创作媒介;再分析 shell、社区、Agent 生态、动态 UI 和模型/产品关系。

Zhang Xiaojun Podcast 张小珺 明超平 YouWare AI Coding Creative Tools Agent Product Strategy
2026-07-31 · Podcast Interview · full YouTube interview + public Scripod sentence-level transcript + source-first entrepreneurial reconstruction + unreliable speaker attribution and numeric boundary

#103 陈冕:Lovart 从应用创业绝境到垂直 Agent

先完整还原陈冕从摩拜、每日优鲜、字节和剪映走到 Liblib、Lovart 的创业时间线,再分析第一代图像产品如何经历补贴战、下架、现金只剩 4000 元、融资断裂与牌照恢复,以及第二代产品为何转向画布、对话框和设计 Agent;明确区分创业者口述、公开产品定位和本文对垂直 Agent/现金流的独立判断。

Zhang Xiaojun Podcast 张小珺 陈冕 Lovart LiblibAI Vertical Agent AI Applications Entrepreneurship
2026-07-31 · Tech Analysis · X release teaser + official paper + official code + model/data cards + implementation and evaluation boundary audit

OpenMLE 深读:把‘AI 改进 AI’变成可执行的机器学习工程闭环

从 OpenRSI 原帖、Frontis-MA1 论文、OpenRSI 官方仓库与 Hugging Face 发布重建 OpenMLE:解释 OpenMLE-Gym 的可执行任务、OpenMLE-ERL 的执行反馈训练、OpenMLE-Evo 的经验引导搜索,以及 Frontis-MA1 如何在这套闭环中学习并回到搜索环;同时区分模型收益、harness 收益与通用 RSI 尚未成立的证据边界。

OpenMLE OpenRSI Frontis-MA1 AI4AI Machine Learning Engineering Recursive Self-Improvement Evolutionary Search Executable Feedback
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + product-mechanism reconstruction + privacy, metrics and falsifier analysis

#135 Tristan:Context Flow、主体性与 AI 社交

深读自然选择创始人 Tristan 张筱帆关于 EVE、ELYS、Context Flow 和 AI 社交网络的完整访谈:区分陪伴型单节点与网络型多节点,解释低维标签到高维 Context 的范式变化、双重冷启动、隐私交易、主体性和真人连接率,并把产品愿景拆成可验证指标与证伪条件。

Zhang Xiaojun Podcast Tristan Elys AI Social Context Flow Subjectivity AI Companion Privacy
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + economic-history and platform-mechanism analysis + falsifier map

#126 郑庆生:三次流量革命与 AI 的新入口

深读郑庆生关于经济史流量革命、平台行为、AI 新入口、硬件节点、Agent/App 边界与创始人组织能力的访谈。文章把公路、铁路、电话、电视和互联网的历史类比拆成新增行为、连接密度、边际成本、迁移成本和结果反馈等可观测问题,避免把流量类比直接当成因果证明。

Zhang Xiaojun Podcast 郑庆生 Traffic Revolution AI Entry Point Consumer AI Venture Capital Founder Judgment Organization
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + OpenAI/AI capital narrative reconstruction + revenue, margin and return evidence boundary

#125 Freda:从 AI 资本叙事到收入、毛利与回报

深读 Freda Duan 从 2020–2025 硅谷关键词、AI/再工业化/金融数字化三条主线,到 OpenAI 商业模式、Anthropic、Robinhood、机器人和 AI 泡沫的完整访谈。严格区分嘉宾估算与外部事实,把 AI 回报拆成新增收入、转移收入、成本节省和资产重估,并提出毛利、现金流、资本强度和生产率的后续核验框架。

Zhang Xiaojun Podcast Freda Duan OpenAI AI Economics AI Bubble Capital Markets Reindustrialization Venture Capital
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod transcript with unreliable speaker diarization explicitly bounded + application, capital and research synthesis

#124 戴雨森:Year of R——回报、研究、记忆与现实检验

深读戴雨森关于 2025 AI 复盘与 2026 Year of R 的长访谈:从推理时 Scaling、Coding Agent、应用护城河、Context/Memory、Agent 十年过程,到泡沫、回报、研究突破、创业建议和后置公司闲谈。将 Return、Research、Remember、Reasoning/多模态解释为一份投资组合审计表,并明确模型分数、ARR、市场预测和说话人分离的证据边界。

Zhang Xiaojun Podcast 戴雨森 Year of R Return Research Memory AI Applications Agent AI Bubble
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + data-layer and product-architecture reconstruction + generative-system falsifier analysis

#123 王冠:压缩即智能,产品才是数据与系统二

深读 ONE2X/Medeo 创始人王冠关于压缩即智能、数据三个阶段、产品内生数据、视频生成、领域语言、Agent 环境、模型/应用边界和生成系统的长访谈。文章把模型理解为快速的系统一,把产品系统二拆成状态表示、工具环境、评价器、反馈日志与可复用配方,并讨论平台从分销走向产销的条件与证伪路径。

Zhang Xiaojun Podcast 王冠 Generative Systems Product Native Data Video Generation Agent Context Engineering Platform
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + bubble/entry/capital-layer analysis + independent falsifier map

#122 朱啸虎:泡沫、超级入口与 15 度偏差

深读朱啸虎关于 AI 泡沫、OpenAI 超级入口、群聊社交图谱、小模型、DeepSeek、token 消耗与 VC club deal 的访谈。文章把泡沫拆成使用层、生产层和资本层,区分供给紧张与投资回报,解释 15 度偏差如何成为寻找共识边缘机会的方法,并列出 DAU、留存、成本、现金流和退出数据的后续证伪指标。

Zhang Xiaojun Podcast 朱啸虎 AI Bubble Super Entry OpenAI DeepSeek Venture Capital Investment Judgment
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + AR hardware/OS/ecosystem reconstruction + guest operating-metric boundary

#104 祝铭明:智能眼镜的窗口、操作系统与生态

深读 Rokid 祝铭明关于操作系统创业、阿里与 MLab、AI/AR 转型、显示型智能眼镜、巨头窗口、供应链、运行时和生态的长访谈。文章把硬件先发优势重构为产品定义时间、功耗/延迟等运行时质量、用户反馈与生态伙伴的乘积,并列出留存、退货、任务完成和开发者验证项。

Zhang Xiaojun Podcast 张小珺 祝铭明 Rokid AR Glasses Hardware Operating System Wearables Ecosystem
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + automotive software and organization reconstruction + guest-claim safety boundary

#105 王忻:汽车从黑盒供应链走向数据驱动的数字豪华

深读奔驰王忻关于汽车技术周期、Tier 1 黑盒、数据主权、中国研发全球输出、L3、端到端、激光雷达冗余、安全测试和数字豪华的访谈。文章把中国速度与奔驰安全的张力拆成数据、软件、组织、法规和责任的联合系统,并把功能数量转向用户结果。

Zhang Xiaojun Podcast 张小珺 王忻 Mercedes-Benz Automotive End-to-End Driving Digital Luxury Safety Data
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + application/agent mechanism reconstruction + market-observation evidence boundary

#107 梦秋:AI 应用还没有找到“让人兴奋的场景”

深读梦秋关于资本寒冬、DeepSeek、Bot、Agent、信息孤岛、具身智能、可穿戴设备和文化消费的访谈。文章把“模型更便宜”与“应用找到新需要”分开,解释情绪价值和工具价值的双轨、动态目标与垂直 Agent 的门槛,并给出需要、结果、状态和经济四层评估框架。

Zhang Xiaojun Podcast 张小珺 梦秋 AI Applications Agent DeepSeek Venture Capital Wearables Embodied AI
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + founder decision reconstruction + unreliable speaker attribution boundary

#108 余凯:从深度学习研究到机器人计算平台的三十年

深读余凯从物理、深度学习、工业实验室、百度到地平线的三十年口述史:解释 2B 同理心、技术品味、边缘计算、汽车作为第一机器人、早期广撒到 2019 年聚焦、融资漏斗和耐得寂寞的组织含义,并严格保留个人回忆与公司事实的边界。

Zhang Xiaojun Podcast 张小珺 余凯 Horizon Robotics Deep Learning Edge Computing Robotics Founder Judgment Organization
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + hardtech entrepreneurship reconstruction + no-speaker-diarization and numeric-claim boundary

#111 李一帆:激光雷达创业史——从昂贵传感器到安全基础设施

深读李一帆关于禾赛、激光雷达降本、早期商业失败、三人合伙、汽车客户、技术选择和产业机会的长访谈。文章把硬科技壁垒还原为设计、制造、供应链、客户反馈和组织治理的联合系统,并把 LiDAR 作为 Plan A+ 的安全论点拆成可验证的场景、消融与责任问题。

Zhang Xiaojun Podcast 张小珺 李一帆 Hesai LiDAR Hardtech Automotive Robotics Entrepreneurship
2026-07-31 · Tech Analysis · full YouTube interview + public Scripod sentence-level transcript + brand/community mechanism reconstruction + two-guest attribution boundary

#114 殷一、欧迪:萨洛蒙如何从专业小众走向生活方式品牌

深读萨洛蒙、越野跑、小红书与女性消费的长访谈:把专业品牌的增长拆成专业核心、分阶段进入、社区表达和线上线下反馈闭环,并把种草还原为贯穿研发、设计、商品、门店与复购的组织过程;同时分析平台动机数据、女性化传播和 AI 产品如何获得具体场景与个性。

Zhang Xiaojun Podcast 张小珺 殷一 欧迪 Salomon Consumer Brand Community Commerce Xiaohongshu AI Product
2026-07-31 · Tech Analysis · official YouTube channel inventory + numbered/non-numbered deduplication + duration/chapter matrix + existing deep-read coverage audit + thematic and longitudinal synthesis

张小珺 YouTube 播客全频道目录与路线图

完整盘点 Zhang Xiaojun Podcast 官方 YouTube 目录:148 个编号正片(#1–#149,缺 #35)、30 个非编号上传、编号正片约 256 小时 52 分钟。页面将英文重发/投屏/纯享版与正片分开,逐期登记标题、时长、章节、主题和深读状态,并从节目顺序中分析频道如何从人物与商业口述史迁移到模型、Agent、机器人、Physical AI 与 AI for AI。

Zhang Xiaojun Podcast 张小珺 Podcast Catalog AI Interviews Agent Robotics Physical AI AI for AI Technology History Venture Capital
2026-07-31 · Tech Analysis · full DeepSeek-V3/V4, Kimi K2.5/K3 and Kimi Linear technical reports + MHA/MQA/GQA/DSA primary papers + public configuration and release verification + independent cache, complexity and evidence analysis

前沿大模型架构深读:从 DeepSeek‑V3/V4 到 Kimi K2.5/K3

完整核对 DeepSeek‑V3/V4、Kimi K2.5/K3 与 MQA/GQA/KDA/DSA 原始报告,统一解释 MHA、MQA、GQA、MLA、DSA、CSA/HCA、KDA 的状态、计算和失败模式。核心判断是近两年架构竞争已从单纯扩参转向序列—深度—宽度三维信息流治理:V3 压缩逐 token KV,V4 压缩时间轴并稀疏选择,K2.5 把重点放到原生多模态与 Agent Swarm,K3 用固定递归状态和周期性全局 MLA 混合。进一步审计 1M context、K3 2.5× scaling efficiency、视觉 RL 正迁移与 Agent Swarm 4.5× 加速的证据边界。

Large Language Model Architecture DeepSeek-V3 DeepSeek-V4 Kimi K2.5 Kimi K3 Multi-Head Attention Multi-Query Attention Multi-Head Latent Attention DeepSeek Sparse Attention Kimi Delta Attention Mixture of Experts Long Context
2026-07-31 · Paper Note · full arXiv v1 + TeX/appendix + X announcement + RTT/HiR primary-source cross-check + independent result arithmetic and evidence-boundary audit

CoRT 深读:Counterfactual Replay 如何把 Rubric 信号分配到 Token

完整拆解 CoRT 的 rubric-conditioned GRPO、criteria-free counterfactual replay、tokenwise likelihood contrast、bounded response normalization 与 signed advantage redistribution。独立核验主表 26/28 个比较为正、简单均值约 +2.96 个百分点,并指出摘要 +4.4 的聚合口径未说明;附录显示局部格式/关键词约束可被集中定位,而全局语义约束仍然弥散,因此 CoRT 更像上下文敏感性 shaping,而不是完整的因果 token credit assignment。

CoRT Reinforcement Learning GRPO Credit Assignment Rubric-based RL Token-level Supervision Counterfactual Replay Instruction Following RTT
2026-07-31 · Paper Note · full 21-page arXiv v1 + TeX/appendix + official repository, runner and benchmark spec audit + related benchmark comparison + independent protocol and evidence analysis

RSIBench-Data 深读:数据研究 agent 已能发现改进,却还不会可靠递归改进

完整重建 RSIBench-Data 的问题定义、固定目标模型上的数据研究闭环、四套研究 agent、六类 benchmark 与 24 个主设置。核心判断是 14/24 的后续候选确实超过首次有效候选,但 18/23 在越过历史峰值后继续搜索并回落;这说明 agent 已有发现能力,却还缺可靠选择、回滚和跨任务泛化。进一步审计官方代码确认 selection 与 official evaluation 使用同一任务子集,新 E2B 沙箱不等于 held-out 评估;主实验也更准确地说是固定目标上的 data-factory 元搜索,而非严格递归自我改进。

RSIBench-Data Recursive Self-Improvement Data-Centric Research Researcher Agents Synthetic Data Post-Training Benchmark Design Evaluation Generalization SWE-Bench Terminal-Bench AIME
2026-07-30 · Tech Analysis · full Zhihu article + taxonomy source + OpenAI/Anthropic/MiniMax/Weco primary materials + full RHI/Ai2/SIA/Continual Harness papers, appendices and official repository audit + independent two-axis classification and evaluation protocol

自进化与 RSI 深读:三个循环,不等于递归自我改进

完整重建周星星《自进化(Self-evolving/RSI),一篇就够了》的 Artifacts / Harness / Model 分类,并逐项深拆四个核心工作:RHI 如何把 role、contract、hop 与交接信息流变成任务专用搜索对象;Ai2 如何用统一 K=5 和 held-out 拆分检验收益是否只是多次搜索;SIA 如何在外部 Claude 控制下先改 scaffold 再对 gpt-oss-120b 做 LoRA;Continual Harness 如何在不重置的 Pokémon 长程环境中在线生成 skill、再用外部教师训练模型。证据审计进一步揭示 RHI 的生命周期成本口径、SIA 的 test-split adaptation、Continual 的 26B/31B 附录矛盾与共同适应归因缺口;工程上更可行的是高频 Harness 探索、低频 Model 蒸馏的非对称双循环。

Self-Evolving Agents Recursive Self-Improvement Agent Harness Autoresearch Harness Evolution SIA AlphaEvolve AIDE2 Continual Learning Agent Evaluation Reward Hacking
2026-07-30 · Tech Analysis · full Zhihu pin and seven figures + seven arXiv papers and appendices + official repository/release audit + independent mechanism, attribution and reproducibility analysis

多模态 OPD 七篇工作深读:证据、监督与稳定性不是一回事

完整还原知乎“近期多模态推理 OPD”七篇工作,逐篇核对 Vision-OPD、Imagine-OPD、ViCuR、参数稀疏分析、GNDPO、PTD-PO 与 HyperEyes 的方法、主表、消融、限制和公开实现。核心判断是它们共同使用学生 on-policy 轨迹,却分别解决视觉聚焦、privilege 可恢复性、失败路由、梯度尺度、参数几何与搜索成本;真正统一的设计对象是教师优势来自哪里,而不是某个 KL/JSD 名称。进一步指出 HyperEyes 的 OPD 可归因增益约 1.3 点、事后稀疏 mask 不是预先可用训练配方,以及多项代码/数据/权重发布仍未闭环。

On-Policy Distillation Multimodal Reasoning Vision-OPD Imagine-OPD ViCuR GNDPO PTD-PO HyperEyes Privileged Information Visual Grounding RLVR Credit Assignment
2026-07-30 · Paper Note · full 125-page arXiv v1, source and appendix audit + CodeContests/LiveCodeBench/GRPO/CodeContests+ primary-source verification + independent score, measurement and judge-denominator analysis

代码优化 RL 深读:真正被训练的不是“更短耗时”,而是一整条测量—奖励—更新链

完整核对《Reinforcement Learning for Code Optimization》125 页正文、附录、TeX 表格与关键一手来源。先重建 DMC-Optim、隔离计时、三类环境、collapsed binary reward、离线模拟器与稳定化 GRPO 的完整方法,再审计复现性和算法发现证据。核心判断是论文训练的不是绝对运行时间,而是同题同测试下可识别的速度偏序;主增益扎实,但公开版本尚无代码/数据,域外正确性并非完全无损,摘要 14%/28% 与正文 13%/22% 的复杂度比例口径也未对齐。

Reinforcement Learning Code Optimization RLVR GRPO DMC-Optim Reward Design Runtime Measurement Benchmark Reliability Code Generation Reproducibility
2026-07-28 · Tech Analysis · full X Article and six code blocks + author series context + direct runtime reproduction + LangGraph/Temporal/Python official-doc audit + statecharts/Pregel prior-art comparison

Graph Engineering:先看懂 Agent 工作流为什么从循环走向图,再谈它的工程缺口

面向没读过原文的读者,先用 bug 修复案例完整解释 agent loop 如何被拆成节点、边、状态、条件分支、并行汇合与人工审批,再进入代码审计。核心判断是外显控制流的方向正确,但公开“50 行引擎”仍缺少可运行的 fan-out / join、确定性合并与持久恢复语义;更可靠的架构是外层 workflow 管治理边界,内层 agent loop 负责局部探索。

Graph Engineering Agent Workflows Workflow Orchestration Durable Execution LangGraph Temporal Human-in-the-loop State Machines Concurrent Systems Workflow Reliability
2026-07-28 · Paper Note · full X post + official blog and 19-page paper + 3,000-row public dataset and evaluator-code audit + BLINK/AVSD/staged-training comparison + independent score, reliability, judge and representativeness recalculation

PerceptionBench 深读:它测到的是原子视觉,还是困难样本的失误尾部?

完整核对 Kimi 发布帖、官方博客、19 页论文、3,000 行公开数据、评测代码与相关一手研究。核心判断是它没有提出新的视觉机制,而是一套面向当前前沿模型的困难残差测试:适合找盲点,不是稳定的视觉本体或跨代量尺。全量文本复算发现 77.5% 的参考答案只是 A–F 或 0–9 单字符,至少 38.23% 的题面含显式选择项;1,800 道拆解题只对应 1,413 个来源条目,720 题位于共享来源簇中。进一步分析推理轨迹忠实度、答案位置先验、来源聚类、幻觉决策阈值与原子分数的下游中介效度,并提出固定锚点 + 动态残差双轨评测。

PerceptionBench Multimodal Evaluation Visual Perception Atomic Visual Skills Kimi K3 Failure Attribution Benchmark Validity Evaluation Reliability Data Contamination Reproducibility
2026-07-28 · Paper Note · X post + full arXiv v1/source/appendix and fitted-figure audit + four primary scaling-law comparisons + independent exponent, mixture-share, downstream and extrapolation recalculation

原生多模态 Scaling Law 深读:测到的是通用规律,还是一条 MoE 配方曲线?

完整核对 HuggingPapers 发布帖、arXiv v1 正文/附录/TeX、全部拟合图与下游结果,并与 Chinchilla、两项原生多模态 scaling law 及数据混合研究交叉审计。核心校准是论文的 multimodal objective 只对图像条件下的文本 token 计算损失;复核确认其图文目标随配比上升相对更 data-hungry,但低配比下仍比语言目标更偏参数,且既有 MoE 研究给出相反指数方向。进一步复算语言平均分、21 项 few-shot 结果与 Pareto 外推,指出 3B 的 3-shot 平均 +2.43pp 同时在 CountBench 下跌 10.43pp,而所谓精确可部署前沿最远外推到观测算力一万倍之外。

Native Multimodal Pre-training Scaling Laws Vision-Language Models Mixture of Experts Compute-Optimal Training Data Mixture Pareto Frontier In-Context Learning Multimodal Evaluation Chinchilla
2026-07-28 · Paper Note · full 47-page technical report and appendix + launch blog/version drift + public weights/config/license/deployment audit + KDA/AttnRes/LatentMoE/QB source tracing + independent benchmark, parameter and memory recalculation + AISI/CAISI external cyber evidence

Kimi K3 技术报告深读:2.8T 只是表层,核心是三维信息流与系统协同

逐页核对 Kimi K3 47 页技术报告、官方博客、公开权重与配置、许可证、部署文档及 AISI / CAISI 独立安全评测。核心判断是 K3 用 KDA + 周期性 MLA、Block AttnRes、Stable LatentMoE 分别重构序列、深度、宽度信息流,并让长程 RL 与推理系统围绕状态、专家和环境协同;复算 104.2B 仅占 2.78T 的 3.75%,50 个子指标中 agentic / coding 强而 reasoning 仅 2/5 进入前二。进一步指出 2.5× 是缺少原始拟合点与组件消融的发布方 scaling claim,1M raw context 未胜 300K compaction,公开主仓库也未包含报告中的 EAGLE-3 / MTP 草稿模型。

Kimi K3 Moonshot AI Kimi Delta Attention Attention Residuals LatentMoE Mixture of Experts Long Context Agentic RL Multimodal Models Systems Co-design Open-weight Models Model Evaluation
2026-07-28 · Tech Analysis · full Zhihu article and author reply + six cited methods + TITO primary explanations + cross-paper objective and evidence audit + SWE-bench state-restoration design

Credit Assignment 深读:长程 Agent RL 真缺的是分数,还是可重放的状态?

完整核对 haotian 的原文、SWE-bench 环境恢复回复、PivoARL、PivotRL、ReOPD、TreeRL、EVPO、SAO 与 TITO 原始说明。核心判断是 outcome reward 确会让失败轨迹中的正确前缀承受同一负 advantage,但 Prefix Replay 只是一种训练接口:四项工作分别优化局部回报、重试回报、教师 KL 与树节点价值,不能因都复用前缀就视为同一证据。进一步指出 SWE-bench 的真正瓶颈是恢复文件系统、进程与工具状态并校准局部 verifier;EVPO 只保证特定假设下的 baseline 方差,不支持“任意 partial credit 都安全”。

Agentic RL Credit Assignment Prefix Replay PivotRL PivoARL ReOPD TreeRL EVPO SAO TITO GRPO SWE-Bench
2026-07-23 · Tech Analysis · full X Article and replies + six launch figures + live 168-paper dashboard audit + VERITAS/MechEvalAgent/OpenAIReview full-method review + independent distribution and denominator recalculation

SAI × ICML 2026 深读:只有 7 篇撑住,还是只有 7 篇可验证?

完整核对 Chenhao Tan 的 X Article、作者回复、六张首发图、SAI 168 篇动态面板与代表性逐篇报告,并通读 VERITAS、MechEvalAgent、OpenAIReview 的方法和限制。复算 105 篇得分中位数约 20.5%、均值约 28.4%,确认 27 篇超过 40%、7 篇超过 80%;同时指出 105 篇按资源成本选择、得分混合结果冲突与工件/协议失败、78% 是人类共识问题召回率而非 precision,8,900 美元成本图只覆盖 105 篇且与正文对失败尝试成本的描述冲突。核心判断是这项工作足以证明执行式审查的必要性,却不足以推出“ICML 只有 7 篇可信”。

SAI Review ICML 2026 Scientific Reproducibility VERITAS Agentic Review Artifact Evaluation Peer Review Research Agents OpenAIReview Evidence Infrastructure
2026-07-22 · Tech Analysis · 49 complete interviews + 121:06:52 of YouTube-first materials + episode-level primary-source verification + source-reconstruction-first notes + cross-interview synthesis

Zhang Xiaojun Podcast 四十九期深读:AI 时代真正稀缺的是可验证的系统

综合 121:06:52、49 期 Zhang Xiaojun Podcast 深读:把机器人策略、数据、世界模型、前沿训练、Agent、模型架构、Physical AI、AI Native 产品、模型公司、资本、在线学习、推理时计算、企业级 Agent、具身原生、开源 Infra、AI for AI、品牌、汽车、硬科技与 AR 硬件放入同一张任务—模型—环境—状态—硬件—产品—组织—治理系统图;本轮进一步把每期笔记改成先完整重建原文、再做证据审计和独立判断,区分嘉宾主张、公开事实与本文推断。

Zhang Xiaojun Podcast AI Systems Embodied AI Robotics World Models Agents Formal Verification Engineering Organization Product Strategy Research Synthesis
2026-07-22 · Podcast Interview · full YouTube interview + Scripod transcript audit + OpenAI/Anthropic/DeepSeek primary materials + evidence-layered analysis

吴翼访谈深读:o1 的关键变化,是把算力预算移到推理时

完整梳理并二次深读吴翼 1 小时 14 分钟 o1 解读:从预训练第二座矿山、RL 的奖励/搜索/任务三件事,到推理时计算、长上下文、Chain of Thought、反事实探索、安全、泛化和 OpenAI 研究组织;新增训练时/测试时算力双账、reward 任务边界、CoT 证据边界与推理验收协议,严格区分官方披露与嘉宾推断。

Wu Yi OpenAI o1 Reasoning Models Reinforcement Learning Test-Time Compute Chain of Thought AI Safety Scaling Law Research Organization
2026-07-22 · Podcast Interview · full YouTube interview + Scripod transcript audit + Manus/DeepSeek/OpenAI/Anthropic primary materials + evidence-layered analysis

肖弘 Manus 三小时访谈深读:不要线性外推,成为博弈中的重要变量

完整梳理并二次深读肖弘 3 小时 22 分钟、跨两个录制阶段的创业访谈:从微信插件治理、产品化等待与资本选择,到 GPT-3、Monica、模型商品化、DeepSeek 和 Manus 的 Agent 环境;新增选择权账本、技术事件四层翻译与 Agent 责任运行时,强调可承受成本下提前准备、保留反事实和可逆环境。

Xiao Hong Manus Monica Agent Product Context Engineering Sandbox Error Recovery DeepSeek AI Entrepreneurship Model Commoditization
2026-07-22 · Podcast Interview · full YouTube interview + Scripod transcript audit + Anthropic/Google/DeepSeek primary materials + evidence-layered analysis

广密大模型季报 #112 深读:模型差距收敛之后,竞争进入 L4 体验

完整梳理并二次深读广密 1 小时 09 分钟大模型产品化季报:分析模型分化与收敛、ChatGPT/Google 全家桶、垂直应用窗口缩短、API 成本、Deep Research/Claude Code 的 L4 体验以及中国团队全球化;新增 L0–L4 结果验收、平台窗口四状态与证据账本,后编辑率、接管率和严重错误比生成速度更接近生产力。

Guangmi Large Language Models L4 Experience AI Product Coding Agents Deep Research Model Distribution Google Anthropic AI Economics
2026-07-22 · Podcast Interview · full YouTube interview + Scripod transcript audit + OpenAI/Anthropic/Google/DeepSeek primary materials + evidence-layered analysis

广密大模型季报 #127 深读:AI War 的真正战场是算力、流量与在线学习

完整梳理并二次深读广密 1 小时 18 分钟跨年大模型季报:把 AI War 还原为资本、算力、分发与反馈的协调论,比较 GPU/TPU 联盟与 GPT/Claude/Gemini 轮换领先,拆解基础模型—应用层迁移、知识工作 L3/L4、机器人数据和在线学习控制回路。新增参数/记忆/策略三层更新、Agentic Web 控制面与证据账本;收入、ARR、公司名单与概率均按嘉宾估算或推断处理。

Guangmi Large Language Models AI War Online Learning Test-Time Compute AI Economics Google TPU Nvidia Robotics Data Agentic Web
2026-07-22 · Paper Note · full arXiv v1 + appendix + SFT/RL code-path audit + model/data release audit + causal and falsification analysis

UniVR 深读:视觉空间推理,还是视觉轨迹策略学习?

二次完整核对 UniVR 论文、附录、SFT/RL 数据路径、代码、模型与 VR-X 发布物:将其定位为目标条件下的视觉观察轨迹/策略学习,而非已识别的动作动力学世界模型;推导 Rg−2|Rg−Rs| 的分段几何与共同盲点,拆解 Step-Focal 的长程信用分配价值;复算 VR-X 增益、全配对成本和数据表统计,并审计公开 SFT 默认监督逐帧 caption/final answer、公开 RL 缺失论文 CLIP 方差选择器、单一 train split 与训练配置不一致等关键复现边界,最后给出八项可证伪实验。

UniVR Visual Reasoning Visual Chain of Thought World Models Long-Horizon Planning GRPO Multimodal Reinforcement Learning Emu3.5 VR-X Embodied AI
2026-07-22 · Paper Note · X post + full arXiv v1/source/appendix + official Cambridge technical blog + primary benchmark and predecessor-method audit + independent metric recalculation

Red Queen Gödel Machine 深读:评委也进化,目标还可靠吗?

完整核对 Yi Lu 发布帖、RQGM 38 页 arXiv v1/附录/TeX 与 Cambridge 作者技术博客:解释固定 epoch、anchor best-belief、选择性擦除和指数检查点如何让 learned evaluator 受控换届;复算编码 119/166 对 116/166、写作面板 1.78–1.86×、grader +9 个百分点与 reviewer 1.91× 口径。核心判断是方法建立了评价语义版本化的实用协议,但主结果来自单次短搜索、单一模型与模型评委,理论只保证 epoch-local 有效性,anchor 仍同时构成防漂移地板与能力天花板。

Red Queen Gödel Machine Self-Improving Agents Co-Evolution LLM-as-a-Judge Reward Hacking Huxley Gödel Machine HyperAgents Controlled Utility Evolution Agent Evaluation AI Safety
2026-07-22 · Tech Analysis · full experimental blog and appendix + RLM arXiv v3 + training-code/model-card audit + metric recalibration and reproducibility analysis

RLM Harness 深读:把长任务改写成同分布小调用

二次深化核对 Alex Zhang 与 Omar Khattab 的 harness 组合泛化实验、九对成功轨迹、RLM/prime-rl 信用分配与公开 LoRA:解释最终组相对 reward 如何只训练根模型 action token,校准 8–32× 与约 10× eval lift,并指出跨域实验存在长度/难度联合移位。核心判断是 harness 已展现可训练的高层归纳偏置,但所谓等价类实际依赖 harness、策略与采样,近似邻近不天然满足传递性;LID 只由根轨迹词面代理,成功最近邻存在选择偏差,系统预算、全量轨迹、精确配置和独立复现仍未闭环。

Recursive Language Models Harness Engineering Compositional Generalization Long Context Agentic Reinforcement Learning Context Offloading Sub-agents Qwen3 RLM System Evaluation
2026-07-22 · Paper Note · X post + arXiv v1→v2 PDF/source revision audit + official Qwen3 configuration and model/code availability audit + recurrent-model comparison + conditional compute/KV/SPT recalculation

Loopie 深读:循环 MoE 真正赢在复用参数,还是复用硬件效率?

以 arXiv v2 为当前版本重新审计《Loop the Loopies!》,逐文件比较 v1/v2 后发现:v2 删除“最强循环 Transformer”与 IMO/IPhO 金牌表述,并撤下整段奥赛章节和六题附录,且未说明原因。深入复算 27 层×2 次 layer-loop 的资源转换链,撤回用 1.424× 代理与 1.379× 吞吐反推 step time 的伪精度;若 Qwen3-like 基线沿用官方 attention 形状,更细的线性层计算代理约为 1.23×,而标准 KV cache 每 token 可能约为基线 2.53×。同时审计 3T/2.28T 预训练口径冲突、2T SPT 的 nominal/target token 歧义、约 1.49 万次更新、scaling ladder 与 R=2 证据边界。核心判断是 Loopie 已证明特定训练栈上的系统共设计价值,但尚未证明推理部署优势。

Loopie Looped Transformers Mixture of Experts Recurrent Depth Compute Matching Training Systems Supervised Pre-Training Test-Time Compute Model Efficiency Reproducibility
2026-07-22 · Paper Note · arXiv v1 + official project/repository corpus audit + SEAL/ACE/WebRL/DGM/Self-Refine/Reflexion/OPRO primary-paper cross-check

Self-Improving Agents 综述深读:真正的分界线是经验能否跨任务写回

深度解读 Self-Improvements in Modern Agentic Systems 97 页综述:指出原更新算子只定义持久适应、未形式化保证提升,引入独立 promotion gate 与受保护治理状态 Γ;以七篇原论文区分瞬时 refinement、episodic adaptation 和跨任务写回,审计当前 245 条方法清单的类别、年份、代码覆盖、重复与链接错配,并提出多轴 change manifest、统计准入门槛、两速学习和 skill 部署契约。

Self-Improving Agents Agent Scaffolding Continual Learning Agent Memory Tool Governance Recursive Self-Improvement Agent Evaluation Reward Hacking Agent Safety
2026-07-22 · Tech Analysis · X reading list + six full arXiv papers/source appendices + official code/model/data audit + numerical recalculation + layered memory-system synthesis

LLM 记忆系统深读:容量不是瓶颈,寻址与写入才是

串联 Latent Rishi 清单中的六篇记忆研究:从约 3.6 bits/parameter 的经验容量、Active Reading 的合成写入、Cartridge KV 编译,到固定 keys/稀疏 values、CAS 多文档联合训练与 Cartridge RAG。核心判断是可用记忆的首要瓶颈是寻址、隔离、写放大和生命周期治理,而非单纯参数容量;笔记同时复算 membership 外推误差与 CAS 数据表不一致,并给出原始证据—检索—编译缓存—稀疏巩固的分层架构。

LLM Memory Cartridges Active Reading Continual Learning Sparse Memory Retrieval-Augmented Generation Long Context KV Cache Knowledge Acquisition Memory Systems
2026-07-22 · Paper Note · full arXiv v2/source/appendix + v1-v2 revision audit + RaR dataset inspection + HeRL/SDPO and concurrent-work comparison + independent result and wall-clock recalculation

CriPO 深读:Rubric RL 缺的不只是探索,而是信号不被标量吞掉

完整核对 CriPO arXiv v2 的 18 页正文/附录/TeX、v1→v2 修订、RaR 公开数据、HeRL 官方论文与代码、SDPO 及同期 rubric-conditioned self-distillation:解释 Unexplored / Suppressed Criteria 如何分别触发局部 forward-KL 与反事实 token advantage flipping。复算两种 Qwen3 规模对 GRPO 为 10 胜 0 负,但四组完整训练 wall-clock 平均多 19.2%,达到 GRPO 最终表现的提前量从 2.56× 到几乎持平;同时指出完整回答进入教师使定位属于后见编辑显著性,Science hard split 仅保留约 59.5%,负 Pitfall 权重映射、单 seed、置信区间和官方实现仍未闭环。

CriPO Rubric-based Reinforcement Learning On-Policy Self-Distillation GRPO Credit Assignment Counterfactual Teacher Advantage Flipping LLM-as-a-Judge Qwen3 Post-Training
2026-07-22 · Paper Note · X post + full arXiv v1/source/appendix + OPCD/OEL/RaR comparison + objective/toy-model derivation + falsification matrix + official repository audit

LLM-as-a-Coach 深读:把评分改成经验,真能替代标量奖励吗?

二轮完整审计 X 发布帖、arXiv v1 全文/附录/TeX、OPCD/OEL、Rubrics as Rewards 与官方仓库:在复算 EL 相对 10 级 GRPO 为 18 胜、1 平、1 负之外,逐公式拆解 semi-gradient、同题后见经验与未归一化 student-top-256 伪 KL;推导 Figure 4 的台阶来自预设的 5 档奖励,不能证明标量奖励的数学上限。核心判断是 EL 是有效的 privileged-context distillation recipe,但可迁移性、高带宽贡献、等计算优势和 reward-hacking 缓解仍需 experience-swap、连续/多维 reward、完整 KL、隐藏人评与预注册 checkpoint 才能成立。

LLM-as-a-Coach Experiential Learning On-Policy Context Distillation LLM-as-a-Judge Rubrics as Rewards Reward Hacking Knowledge Distillation Non-Verifiable Tasks Post-Training
2026-07-22 · Tech Analysis · X post + official competition rules + public evaluator/data/baseline code + primary recurrent-depth research

One Layer Deeper 深读:测试时多跑几层,为什么不是简单加循环?

深度审计 Core Automation × Tilde Research 的 One Layer Deeper 竞赛:解释权重共享循环、信用分配与测试时扩深,并进一步计算固定模数的 Carmichael 周期、输出像空间和跨深度初值覆盖率,指出公开 OOD-depth 可能混入有限群周期、seen-x 记忆与十进制解码捷径;以二维留出、循环剂量反应、状态因果干预和等预算基线给出可证伪的深度外推标准。

One Layer Deeper Recurrent Depth Looped Transformer Test-Time Compute Depth Extrapolation Latent Reasoning Optimizer Algorithmic Reasoning Modular Squaring Dynamical Systems
2026-07-20 · Podcast Interview · full YouTube interview + Mininglamp HKEX prospectus + OSWorld/Agent primary materials + evidence-layered analysis

吴明辉访谈深读:企业级 Agent 的护城河是数据上下文与可信行动

完整梳理吴明辉 3 小时 47 分钟企业 AI 口述史:从广告测量、明略科技与明链数据,到 DeepMiner、Foundation Agent、GUI/Browser 操作、数据挖掘、可信 Agent、多智能体组织与 SECI 知识循环;核心 insight 是 Y=F(X) 中的企业私有 context 比通用模型更稀缺,Tool Use、人机协同、身份信用与专业 Agent 组合才构成可交付的可信生产力。

Wu Minghui Mininglamp Enterprise AI Enterprise Agents Agentic Model DeepMiner Tool Use Context Engineering Multi-Agent Organization Trusted AI
2026-07-20 · Podcast Interview · full YouTube interview + Li Auto annual report/official disclosures + evidence-layered analysis

李想第二次访谈深读:CEO 大模型、VLA 与可信的 AI 终端

完整梳理李想 2 小时 46 分钟访谈:以 CEO 大模型和技术/战略/组织 MoE 为入口,拆解信息工具到生产工具、AgentOS、32B 到 3.2B VLA 蒸馏、动作后训练、交通世界模型、云边协同、组织能量与 Agent 信用;结合理想汽车官方年报和业绩披露,提出 AI 的终点不是更会说,而是能负责地做。

Li Xiang Li Auto CEO Model AgentOS VLA World Model Autonomous Driving AI Terminal AI Organization Human AI Collaboration
2026-07-20 · Podcast Interview · full YouTube interview + public product references + evidence-layered analysis

张月光访谈深读:AI Native 不是加一个模型,而是重写上下文与结果

完整梳理张月光 3 小时 14 分钟访谈:从元音停服、妙鸭写真业务与串型模型管线,到 One Way Door、AI Native 上下文设计、AI 组织、AI companion、内容平台、游戏与 Dokie Agent;核心判断是 AI Native 的最小单位不是功能,而是一次让用户无法回到旧流程的结果改善,Agent 还要区分替人自动化与扩展人的创造能力。

Zhang Yueguang AI Native Miaoya One Way Door Context Design AI Product Agent Product AI Companion Content Platform Startup Strategy
2026-07-20 · Podcast Interview · full YouTube interview + Zhipu HKEX prospectus + GLM/DeepSeek primary materials + evidence-layered analysis

智谱张鹏访谈深读:IPO 不是终点,而是 AGI 开路的工程承诺

完整梳理张鹏 2 小时 26 分钟访谈:从清华认知智能、Paper to Project、GPT-3 与 GLM-130B,到 ChatGPT 冲击、Scaling Law、DeepSeek、开源/闭源与香港上市;区分研究、工程、商业交付和组织规模的约束,提出 IPO 是时间预算、开源降低协作摩擦、认知智能的可操作核心是错误修正、垂直模型的护城河是环境与反馈等 insight。

Zhang Peng Zhipu AI GLM Large Language Models Scaling Law DeepSeek Open Source AI AI Commercialization IPO AI Organization
2026-07-20 · Podcast Interview · full pre-acquisition YouTube interview + Manus official context-engineering/product announcements + evidence-layered analysis

季逸超 Manus 最后访谈深读:Agent 公司的护城河是可逆产品与环境

完整梳理季逸超 3 小时 31 分钟收购前访谈:从 iOS 浏览器、搜索与自研 NLP 的早期经历,到 Monica 正向现金流、Manus 的云端沙盒/异步长任务/通用 Agent,拆解 Model—Environment—Feedback 的产品策略、Context Engineering、KV cache、文件系统记忆、错误恢复、RLI 式结果评价、制造业经济和小团队取舍。核心判断是 Agent 公司的壁垒不是拥有一个模型,而是可逆的产品迭代、行动环境、失败数据和可验证的高价值任务;后续收购只作为时间线,不倒灌为当时的必然性。

Yichao Ji Manus General Agents Context Engineering Agent Runtime Sandbox Error Recovery Agent Evaluation AI Economics Meta
2026-07-20 · Podcast Interview · full transcript-duration-audited interview + StepFun official platform/research materials + evidence-layered analysis

印奇访谈深读:AI 2.0 不是模型升级,而是公司与终端的重组

完整梳理印奇 2 小时访谈:从阶跃星辰与千里科技的双重身份出发,解释 AI 1.0 到 2.0 的脑—身闭环、基础模型与汽车/终端、数据—资本—人才—产品长链、旷视时期的战略反思、技术信仰与价值务实、组织重建以及未来五年的学习/记忆/世界模型预判。特别标注公开转录音频 2:01:28 与 YouTube 目录 1:58:15 的媒体边界差异。

Yin Qi StepFun Qianli Technology AI 2.0 Foundation Models AI Terminals VLA AI Organization Strategy Physical AI
2026-07-20 · Podcast Interview · full YouTube interview + Anthropic Economic Index/Claude Code primary materials + evidence-layered analysis

Freda 投资札记深读:Token 不是产品,结果与组织才是单位经济

完整梳理 Freda Duan 1 小时 23 分钟访谈:建立用户数×任务数×token/task×价格的 AI 单位经济分解,解释 Tokenmaxxing 与结果定价,审视 Coding 递归、UI/结构化软件的暴露面、决策上下文、接力赛到篮球赛的组织重构、Agent 基础设施、资本开支、裁员/通缩与人的连接。核心 insight 是 token 是工业成本账本,不是价值本身;AI 扩散的瓶颈从信息传递转向组织重构、责任和结果。

Freda Duan Tokenmaxxing AI Economics Outcome Pricing Software AI-native Organization Agent Infrastructure Investment Labor Market Human Connection
2026-07-20 · Podcast Interview · full YouTube interview + Anthropic Claude Code/Economic Index primary materials + evidence-layered analysis

戴雨森访谈深读:从 DAU 到任务完成,Harness 正在成为 AI 时代的操作系统

完整梳理戴雨森 2 小时 18 分钟访谈:从上一期预测被市场反驳出发,拆解 Model—Context—Harness—Runtime 的产品栈、Coding Agent 的高质量反馈、DAU 与 agentic hours 的指标迁移、AI 三阶段、AI-native 组织和中美创业差异。核心判断是 AI 时代的价值单位从注意力迁移到任务完成、状态迁移成本与可复用反馈;模型像处理器,Harness 像操作系统,但其独立护城河仍需用真实任务、成本、权限与长期留存验证。

Dai Yusen Harness Agentic Coding Model OS AI Economics Agentic Hours AI-native Organization Startup Strategy Anthropic AI Labor
2026-07-20 · Podcast Interview · full YouTube interview + StepFun/OpenAI/ResNet/DiT primary materials + evidence-layered analysis

张祥雨访谈深读:多模态的下一次跃迁需要视觉推理与行动底座

完整梳理张祥雨 2 小时 28 分钟多模态研究访谈:从 ResNet 与视觉 scaling、Step 1/Step 2 的统一模型尝试,到 o1、RL、Meta-CoT、视觉生成、视频/具身数据、层级记忆、在线学习与世界模型;明确区分内部实验重构、OpenAI/StepFun 官方公开资料和嘉宾预测。核心 insight 是多模态的下一次跃迁不只是接入更多模态,而是建立可迁移的视觉动作空间,让模型能够观察、操作、验证、反思与回退;长上下文解决存储,层级记忆才解决使用。

Xiangyu Zhang Multimodal Models Visual Reasoning Visual Generation Meta-CoT StepFun OpenAI o1 World Models Online Learning Long Context
2026-07-20 · Podcast Interview · full YouTube interview + Moonshot Kimi K2/Muon/OpenAI primary materials + evidence-layered analysis

杨植麟访谈深读:Agentic LLM 的瓶颈不是调用工具,而是可泛化的环境学习

完整梳理杨植麟 1 小时 41 分钟访谈:从 AGI 的无限山、Reasoning RL 与 Agentic RL 的 test-time scaling,深入 Kimi K2 的 1T MoE、32B active、15.5T tokens、MuonClip、MLA 与 agentic-first 训练,再分析数据墙、token efficiency、Agent 评价泛化、开源/产品边界、多模态与组织 RL。核心 insight 是 Agent 的竞争不在于能否调用工具,而在于能否在陌生工具、长任务和不完美评价器中持续学习、验证和泛化;早期 token efficiency 倍率与时间预测均保留为创始人口径。

Zhilin Yang Kimi K2 Agentic LLM Reasoning RL Agentic RL Muon Tool Use Agent Evaluation Data Scaling AI Organization
2026-07-20 · Podcast Interview · full YouTube interview + original papers/official materials + evidence-layered analysis

谢青池访谈深读:AI 范式史不是模型年表,而是基础设施的接力

完整梳理谢青池 4 小时 22 分钟论文与模型范式史:从 GPU/Brook、AlexNet、Seq2Seq、Attention、ResNet、Transformer、GPT-1/2/3、Scaling Law、Chinchilla、ZeRO、InstructGPT,到 ViT、CLIP、Latent Diffusion 与 DiT;以模型—数据—计算—infra—评价五力解释为什么范式会延迟兑现,并把论文阅读转成边界、等待和产品判断。由于字幕 speaker diarization 不可靠,正文不强行归属每句对白。核心 insight 是 AI 历史真正接力的是可扩展的资源与反馈,而不是论文名字。

Qingchi Xie AI Paradigm History Transformer Scaling Laws Chinchilla InstructGPT Vision Transformer CLIP Latent Diffusion AI Infrastructure
2026-07-20 · Podcast Interview · full YouTube interview + Kimi Linear/Gated DeltaNet/MiniMax/DeepSeek primary materials + evidence-layered analysis

杨松琳访谈深读:注意力的下一场竞争是状态、硬件与评测的共同设计

完整梳理杨松琳 1 小时 43 分钟访谈:从 Kimi Delta Attention、Gated DeltaNet、Delta Rule 与 Full/Linear/Sparse/Hybrid Attention,追到 MiniMax M1、DeepSeek Sparse Attention、MoE、FP8、kernel 与硬件协同;严格区分 Kimi Linear 官方公开的 KDA/MLA、48B/3B、KV cache 与吞吐结果,以及嘉宾关于 3:1 层比、模型回退和国内架构创新的口述。核心 insight 是注意力的竞争单位不是单一模块,而是有限状态、长程依赖、硬件执行与等预算评测共同构成的系统可行域。

Songlin Yang Kimi Linear Kimi Delta Attention Gated DeltaNet Linear Attention Sparse Attention Hybrid Attention Long Context Muon Model Architecture
2026-07-20 · Paper Note · four coauthor/reader X posts + 37-page arXiv v1/source/appendix + figure/formula/statistical audit + official code/model/data audit + primary comparison research + independent recalculation

Understanding Reasoning 深读:预训练决定 RL 的起点,也塑造它的学习速度

逐页复审 Shen 等人的 37 页预训练—RL 联合 scaling 研究:还原 54B-token 棋谱、十种模型规模、36 条 GRPO 曲线与 OLMo-2 数学迁移,并审计局部斜率的 sigmoid 工作点混淆、未完全嵌套的 run-level LOO、三阶段 FLOPs、完整六类策略迁移和多条作者 / 读者解读。进一步核对公开代码、数据与新增墙钟估计。核心判断是 pretraining loss 的域内预测证据较强,但“RL 无法补偿弱预训练”只在已观测算力窗口成立;token 的因果解释、20%–28% 精确端点及“尾部发现等于创造新能力”同样不成立。

Understanding Reasoning Pretraining Reinforcement Learning GRPO Scaling Laws Chess Policy Evolution Coverage Reasoning Compute Allocation
2026-07-20 · Tech Analysis · full X Article + technical report + model card + source-code defaults + benchmark recalculation + PR/issue timeline audit

MOSS-TD × SGLang Omni 深读:90 分钟多说话人 ASR 如何真正跑起来

完整核对 Yichi Zhang 的 X Article、MOSS-TD 技术报告、模型卡、SGLang Omni 源码与相关 PR/issue:解释 0.9B 模型如何在 128K 上下文中联合生成文字、说话人和时间戳,以及 encoder graph、异步解码、chunked prefill、缓存和流式输出如何随音频长度改变收益。复算单卡 H100 的 379.5/97.5 audio-s/s,指出短音频结果与官方 cookbook 相差约 4.6 倍、基准未钉版本且数据私有;更关键的是默认输出预算仍可能静默截断长转写,贪心解码也存在非语音循环。核心判断是 90 分钟输入能力与高吞吐已经成立,但默认生产闭环仍需时长感知预算、尾部护栏和可复现基准。

MOSS Transcribe Diarize SGLang Omni Automatic Speech Recognition Speaker Diarization Long Audio CUDA Graph Chunked Prefill Inference Optimization Serving Systems
2026-07-20 · Paper Note · X post + full arXiv v2/source/appendix + official code/data/browser audit + 77 unit tests and 5 subtests

Value Leakage 深读:模型的‘好价值观’为什么会悄悄改写客观答案

完整核对《Value Leakage》arXiv v2、107 页正文与附录、官方代码、数据说明和结果浏览器:解释反事实答案分布如何识别模型价值对用户无关任务的隐性干预,拆解 Donation Bet、公司相关回答、Agentic Grading、Job Offer 与随机活动选择实验,并区分分布级偏差、单次回答归因和推理披露。核心判断是论文给出了多任务、多模型的价值泄漏证据,但不能据此给模型作统一排名,也不能把摘要式 CoT 当成可靠的因果解释。

Value Leakage Model Values CoT Faithfulness Counterfactual Evaluation Agentic Grading Sycophancy LLM Evaluation AI Alignment
2026-07-20 · Paper Note · X post + full arXiv v1/source/appendix + controlled-result recalculation + primary poisoning and data-pipeline research

HalfLife 深读:开放评论能否污染语言模型预训练数据?

完整核对《Pretraining Data Can Be Poisoned through Computational Propaganda》正文、附录、TeX 源与关键前置研究:解释 HalfLife 如何拆解评论注入、抓取和过滤三段概率,复算 0.13% 纳入估计与受控模型偏好移动;指出 250 文档阈值来自触发式 DoS 后门而非本文信念操纵、正文与附录 WARC/页面统计冲突、S1 将评论存在近似为可注入、SFT 后效应明显衰减且缺少多 seed/置信区间。核心判断是论文确认了片段级数据供应链攻击面,但尚未完成真实网站到前沿模型的端到端攻击闭环。

HalfLife Data Poisoning Pretraining Security Computational Propaganda Common Crawl Data Provenance Supply Chain Security Language Models
2026-07-20 · Tech Analysis · full X Article + LatentMoE arXiv v1 + Nemotron 3 Super technical report + Kimi K3 official release audit + independent recalculation

LatentMoE 深读:Kimi K3 与 Nemotron 3 Super 真走上了同一条路吗?

从青稞社区的 X Article 回到 NVIDIA LatentMoE 论文、Nemotron 3 Super 技术报告与 Kimi K3 官方博客:解释 routed width 如何从主干 hidden dimension 解耦,区分 efficiency / accuracy 两种变体,复算 95B 主表增益与 H100 五档并发吞吐,并指出 350B、3.46× 与 9% 均来自万亿参数模拟而非真机。核心判断是 K3 与 Nemotron 方向相似,但 K3 的 Stable LatentMoE、Quantile Balancing 与 2.5× scaling efficiency 在技术报告和权重发布前仍属发布方报告,不能认定为同一实现。

LatentMoE Mixture of Experts Kimi K3 Nemotron 3 Super Expert Parallelism All-to-All Inference Efficiency Quantile Balancing Model Architecture Hardware-Software Co-Design
2026-07-20 · Tech Analysis · X Article + eight core papers and appendices + five official implementation audits + SAGE-GRPO and SoliReward counterevidence + closed-loop stability analysis

视频模型 RL 后训练深读:真正的瓶颈不是优化器,而是奖励能否代表世界

完整核对 Anirudha Majumdar 的《Understanding Video Models: Part III》、八篇核心论文、附录与五个官方实现:从隐式 DPO reward、GRPO 终局信用分配和局部 SDE-KL,追到 24×A800、64×H800 等真实训练协议;揭示 VideoAlign 将运动幅度写入 MQ、训练裁判与报告指标耦合等实现偏置,并用 SAGE-GRPO 的 off-manifold 探索反证和 SoliReward 的 reward-utility 反例,重构为“测量—探索—更新—独立验收”的闭环稳定性问题。

Video Generation Reinforcement Learning RLHF Verifiable Rewards Flow Matching DPO GRPO Reward Models Geometric Consistency World Models
2026-07-20 · Paper Note · X post + arXiv v1 full text/source + benchmark datasets + qTTT and primary long-context research

Self-Guided TTT 深读:长上下文真正缺的不是窗口,而是可信训练信号

深度解读 Meta AI 与 UVA 的 Self-Guided Test-Time Training:还原模型自选证据 span、query-projection LoRA 临时适配与全文回答流程,复算摘要中的最高 15% 实为 30.7→35.3 的 +4.6pp;逐项审视 oracle 诊断、八格主结果、21.5%–39.9% 开放问答 fallback、注意力案例和 H200 相对延迟,并指出缺少选段 prompt、代码、逐桶样本量、置信区间与绝对成本。进一步提出 S-TTT 是证据放大器与实例级课程设计器,生产化必须加入更新门控、adapter 作用域、污染测试和不训练的同预算基线。

Self-Guided TTT Test-Time Training Long Context LongBench-v2 LongBench-Pro LoRA Evidence Selection Inference-Time Compute Context Engineering
2026-07-20 · Paper Note · X post + full arXiv v2 + official model/config + public evaluation repository audit + independent benchmark win-loss recount

Agents-A1 深读:35B 不是打败 1T,而是在系统预算下重画能力边界

深度核对 Agents-A1 主帖、arXiv v2、TeX 源码、35B/4B 配置与公开评测仓库:解释 KAG、约 45 亿 SFT trajectory tokens、分领域教师与 domain-routed OPD;用反例揭示 SVA 截断 KL 可在 teacher top-k coverage 很低时仍为零,区分过程信息进入上下文、奖励与 token loss 的不同通道。进一步复算 OPD 相对全域 SFT 在 16 项中提升 15 项,并审计新发布 4B 在 XBench、VitaBench、MatTools 等任务追平或超过 35B,以及 pass@1/retry@5、模型卡版本漂移、工具预算和训练资产缺失。

Agents-A1 Agent Horizon Scaling On-Policy Distillation Salient Vocabulary Alignment Knowledge-Action Graph Long-Horizon Agents Tool Use Mixture of Experts Evaluation Reproducibility
2026-07-20 · Paper Note · X thread + arXiv v2 + official code/config audit + released model weights + primary latent-reasoning references

LOTUS 深读:并行潜变量推理真正压缩的是什么?

深度解读 LOTUS:把可变长显式 CoT 改写成固定 K×c 潜变量工作区和 R 轮循环深度,拆解主 LM head 的并行 step loss、answer loss 与 parallel chain likelihood,复算 3B GSM8K 准确率、2.5×/6.9× 思考延迟和可读 latent 结果;结合论文附录、训练 curriculum、官方代码与 HF checkpoint 集合,指出并行只消除了 token 解码轴、readout 不等于因果忠实性、自然语言 stress test 换用了更宽 latent block、固定预算缺少自适应停止,以及所谓超长链自回归回退尚未在公开推理路径中实现。

LOTUS Latent Reasoning Chain-of-Thought Looped Transformers Recurrent Depth Parallel Inference Test-Time Compute Interpretability GSM8K
2026-07-17 · Podcast Interview · full YouTube interview + Habitat/Domain Randomization/Open X/π0 primary materials + evidence-layered analysis

王鹤访谈深读:具身智能从学术边缘走向资本中心,真正稀缺的是不砸行业招牌的生产力

完整梳理王鹤 2 小时 38 分钟访谈:追踪具身智能从计算机视觉的 passive perception 走向 perception–action loop 的学术史,解释人类视频交互、类别级位姿与合成数据的连续问题,分析软硬件螺旋、生产力即产品、遥操作与资本泡沫。核心 insight 是必须把研究成功、演示成功、部署成功和规模化生产力分开,用连续运行、人工介入、单位产出和跨场景复测守住行业信用。

He Wang Embodied AI Academic History Perception Action Loop Synthetic Data Sim2Real Robotics Product Robot Hardware Production Force AI Capital
2026-07-17 · Podcast Interview · full YouTube interview + Sim-to-Real/Open X/π0/NVIDIA/Scale primary materials + evidence-layered analysis

谢晨访谈深读:机器人数据荒的核心,不是小时数,而是可迁移、可评价的经验

完整梳理谢晨 1 小时 41 分钟仿真与合成数据专访:把 Sim2Real、Real2Sim、资产/场景、物理 solver、API、质检和真实回归串成一条生产线,比较自动驾驶与具身在跨本体、物理交互和 RL 并行上的差异,分析数据金字塔、跨宇宙泛化、Meta/Scale 资本叙事与客户 reward。核心 insight 是仿真不等于仿真器,合成数据的价值应按减少了哪类真实失败来计量。

Chen Xie Simulation Synthetic Data Real2Sim Sim2Real Robotics Data Reinforcement Learning Cross-Embodiment Physical Intelligence NVIDIA Isaac
2026-07-17 · Podcast Interview · full YouTube interview + XPENG official AI/ foundation-model materials + evidence-layered analysis

刘先明访谈深读:拆掉 Language 之后,小鹏如何把智驾重写成 Physical AI

完整梳理刘先明 1 小时 48 分钟访谈:解释从 Software 1.0/1.5/2.0 到端到端、拆规则/拆 loss/拆 Language 的技术判断,拆解主机厂数据闭环、云端—车端 scaling、Physical AI 的硬件/芯片/模型/数据乘法因子,以及世界模型、实时性、安全下限和组织承压。核心 insight 是接口删除不会消灭复杂度,只会把责任迁移到数据选择、硬件协同、回归评测和安全治理。

Xianming Liu XPENG Physical AI End-to-End Driving VLA World Models Data Flywheel Scaling Edge AI Safety
2026-07-17 · Podcast Interview · full YouTube interview + Google DeepMind/Open X-Embodiment/Genie primary materials + evidence-layered analysis

谭捷访谈深读:机器人真正的拐点,是跨本体数据与可用的世界模型

完整梳理谭捷 2 小时 6 分钟访谈:从图形学、Sim2Real 与数据金字塔出发,拆解机器人基座模型尚未完全独立的原因,分析 Gemini Robotics 1.5 的 Thinking、跨本体 motion transfer、ER/VLA 双层、世界模型与触觉阶段性约束。核心 insight 是机器人规模化的中间层不是更大的脑,而是能把经验从一个身体迁移到另一个身体、同时保持实时性和安全边界的可评价数据系统。

Jie Tan Gemini Robotics Cross-Embodiment Sim2Real Data Pyramid World Models VLA Robotics Foundation Models Tactile Sensing Robotics Organization
2026-07-17 · Podcast Interview · full YouTube interview + Kimi/Qwen/OpenAI/Manus primary materials + evidence-layered analysis

郑博元访谈深读:Kimi K2 之后,Agent 竞争进入系统工程

完整梳理郑博元 2 小时 20 分钟技术报告导读:统一定义 Coding、Search、Tool Use、Computer Use Agent 的观察—行动闭环,比较 Context Engineering 与端到端训练,逐层拆解 Kimi K2 的知识重写、工具/任务合成、verifiable 与 Rubric reward、RL rollout 和安全工程,再对照 ChatGPT Agent、Qwen3-Coder、Manus 的行动空间、环境基础设施与 KV Cache/Filesystem 记忆管理。核心 insight 是数据合成正在成为训练编译器,环境是被低估的训练硬件,Context Engineering 本质上是状态治理。

Zheng Boyuan Kimi K2 Agent Training Verifiable Rewards Synthetic Data Reinforcement Learning Qwen3-Coder ChatGPT Agent Context Engineering Agent Infrastructure
2026-07-17 · Podcast Interview · full YouTube interview + The Second Half + Agent research lineage + evidence-layered analysis

姚顺宇旧访谈深读:Agent 下半场的核心是上下文、任务与评估

完整梳理姚顺宇 2 小时 31 分钟旧访谈并对读《The Second Half》:从 WebShop、ReAct、代码 affordance 与真实环境出发,区分知识/策略/规格泛化,建立可靠性—创造性、深度—广度评价矩阵,分析长期记忆、内在奖励、数据飞轮、创业接口、中心化与多样性。由于本期逐句材料没有可靠说话人分离,正文不强行标注身份。核心判断是模型能力的下半场首先是任务规格、环境和现实效用的下半场。

Shunyu Yao The Second Half Language Agents WebShop ReAct Context Long-Term Memory Intrinsic Reward Agent Evaluation Startup Interfaces
2026-07-17 · Podcast Interview · full YouTube interview + company primary materials + evidence-layered analysis

广密访谈深读:Coding 不是垂直场景,而是 AI 的第二幕加速器

完整梳理广密 1 小时 22 分钟全球大模型季报:把 Coding 解释为代码—执行—测试的短反馈闭环和 AI 的二阶加速器,比较 Anthropic、OpenAI、Google、Meta、xAI 的组织聚焦与路径依赖,拆解 Harness Engineering、模型 OS、白领通缩、初级岗位学习阶梯和投资叙事。所有公司、收入、token 和市场判断都按嘉宾观察或预测处理,不替代财务事实或投资建议。

Guangmi Coding Agents AI Economics Harness Engineering Model OS Anthropic OpenAI Gemini AI Labor Investment Thesis
2026-07-17 · Podcast Interview · full YouTube interview + Agent research lineage + evidence-layered analysis

苏煜访谈深读:Agent 不是新物种,而是正在学会成为专家的运行系统

完整梳理苏煜 2 小时 17 分钟访谈:从逻辑 Agent、神经 Agent、语义解析到 Language Agent 的技术史,拆解语言作为感知—推理—行动与记忆压缩的脚手架,解释 Coding 为何成为数字世界的通用接口,追踪 OpenClaw Moment、浏览器/桌面/CLI/API 的统一行动空间,以及专家化智能、世界模型、持续学习和权限经济。核心 insight 是 Agent 的竞争单位不是单次模型回答,而是能否在具体工作世界中持续获得反馈、压缩经验并可靠承担行动后果。

Su Yu Agent History Language Agents OpenClaw Specialized Intelligence Continual Learning World Models Coding Agents Computer Use AI Organization
2026-07-16 · Podcast Interview · full YouTube interview + annual report + official product disclosures + CPSC recalls + primary technical references

Anker 阳萌访谈深读:成熟公司转向 AI,难点不是模型,而是能力迁移

完整梳理阳萌 3 小时 37 分钟访谈:从 Google、Amazon 与五系品质品牌,讲到浅海/深海、1357 用户分层、2022 多产品线失败、七系转型、NOR Flash 存算一体芯片、端侧安防、机器人、第三类公司和企业 Agent;结合 2025 年报、官方芯片资料与 CPSC 召回记录,提出用户邻接×技术邻接的品类框架,解释专用芯片如何用通用性换能效,并指出 10 万亿 token 是燃料表而非生产率、价值观必须通过召回与停止权变得可证伪。

Anker Innovations Steven Yang Consumer Electronics Edge AI Compute in Memory Product Strategy Enterprise Agents AI Organization Robotics Brand Trust
2026-07-16 · Podcast Interview · full YouTube oral history + SpaceX/NASA/FAA/FCC/SEC primary sources + engineering and governance analysis

SpaceX 洪力德访谈深读:可回收火箭只是起点,真正的产品是工程反馈系统

完整梳理洪力德三小时 SpaceX 口述史:从跨行业制造、Falcon 1→9→Starship、高 SKU 生产、高压容器内制、Musk 第一性原理与 2015/2016 事故,延伸到 NASA COTS/CRS、垂直整合、商业航天权力和太空数据中心;用 NASA、FAA、FCC、SEC 与 SpaceX 一手资料校准关键时间和监管口径,并提出复用运营函数、接口压缩、验证性原理、政府市场架构与太空算力热/维护约束等独立判断。

SpaceX Lewis Hong Falcon 9 Reusable Rockets Engineering Organization First Principles Vertical Integration NASA COTS Orbital Data Centers Commercial Space
2026-07-16 · Podcast Interview · full YouTube interview + Axiom Putnam source repository + Lean/Mathlib primary documentation + funding announcement

Carina Hong 访谈深读:证明不是终点,规格才是

完整梳理 Carina Hong 4 小时 23 分钟访谈:从数学直觉、MIT/Oxford/Stanford 跨学科路径到 Lean/Mathlib、AxiomProver 的模型—工具—搜索—验证—库系统、猜想生成、代码验证、团队与登月文化。逐项核验 Putnam 2025 官方仓库并纠正宣传口径:12 题最终均有公开可检查证明,但比赛截止时为 8/12,其余四题赛后完成。核心判断是 AI for Math 是规格编译器栈;kernel 保证相对形式命题的推导,不保证自然语言翻译、现实规格或问题意义。

Carina Hong Axiom Math AxiomProver Lean Mathlib Formal Verification AI for Math Putnam 2025 Conjecture Generation Verified AI
2026-07-16 · Podcast Interview · full YouTube interview + Xiaomi MiMo/DeepSeek official repositories + primary technical reports

罗福莉访谈深读:Agent 框架正在成为新的训练对象

完整梳理罗福莉 3 小时 34 分钟访谈:从 OpenClaw 高强度体验、harness 对弱/强模型的不同作用、skills 作为可执行组织记忆,到 MiMo-7B 与 MiMo-V2-Flash 的 hybrid attention、MTP、long context、MOPD、Agent RL 环境,延伸至多 Agent 的等预算问题、统一多模态、无组无职级的隐性权力和 AGI 概率更新。核心 insight 是模型与框架将协同进化;post-training 的稀缺品最终会从 GPU 迁移到真实且不易 reward hack 的 evaluator。

Fuli Luo Xiaomi MiMo OpenClaw Agent Harness Agent Skills MiMo-V2-Flash Multi-Token Prediction Long Context Multi-Agent Systems Post-Training
2026-07-16 · Podcast Interview · full YouTube interview + personal profile + primary physics paper + Anthropic/Google official materials

姚顺宇访谈深读:Benchmark 之后,真正稀缺的是任务规格

完整梳理姚顺宇 3 小时 48 分钟访谈:从非厄米 skin effect、高能理论的反馈困境到 Claude 3.7 的环境化后训练、Coding 验证器经济、预训练是否撞墙、Gemini long horizon、有限训练/近无限使用、机器人 scale-up、Anthropic 与 Google 的条件化组织最优、集体主义工程和 24 小时面试风险。核心判断是竞争正从能力发现迁移到规格发现;长程 Agent 的本质是信息预算治理,算法则是数据、FLOPs、infra 和 production constraint 下的系统控制器。

Shunyu Yao Claude 3.7 Gemini Long-Horizon Agents Agentic Coding Reinforcement Learning Pretraining Context Management Non-Hermitian Physics AI Organization
2026-07-16 · Podcast Interview · full YouTube interview + official research pages/papers + AMI funding disclosures

谢赛宁七小时访谈深读:表征、世界模型与 AMI Labs 的反向 OpenAI

完整梳理谢赛宁 6 小时 44 分钟访谈:从交大 ACM 班、屠卓文、何恺明与李飞飞,串起 DSN、HED、ResNeXt、MoCo、MAE、ConvNeXt、DiT、Cambrian、REPA 与 RAE 的表征学习主线;严格区分语言作为文明压缩/沟通接口、世界模型的状态—动作—后果内核与视频 world simulator,并审视预测安全、下载人类、AGI/松鼠智能、AMI Labs 反向 OpenAI 数据联盟、研究自由和正式融资。核心 insight 是“寻找梯度”同时统一了他的研究方法、表征观与创业模型,而 state 充分性、数据治理和组织证伪机制才是路线的关键考题。

Saining Xie AMI Labs Yann LeCun World Models Representation Learning JEPA Diffusion Transformer Cambrian-S Research Methodology Physical AI
2026-07-16 · Podcast Interview · full YouTube interview + Lightwheel official materials + UMI/BEHAVIOR/GR00T/PI primary sources

谢晨访谈深读:机器人数据的终局不是数据集,而是评价环境

完整梳理谢晨关于机器人数据与仿真的 2 小时 37 分钟访谈:从 Cruise/NVIDIA/蔚来经历、静态数据集到系统中心数据引擎、纠错轨迹、可规模化评价、World Model/VLA/LLM 共生、真实—仿真—人类视频金字塔、价格与 Lightwheel Data Engine,解释为什么评价器同时是闭环控制面和课程生成器;对称审计真实数据商与仿真商的利益叙事,并纠正 Generalist 27 万小时数据并非官方定义为 UMI、BEHAVIOR 26% 需按首届榜单口径核验等易误传说法。

Xie Chen Lightwheel Robot Data Simulation Scalable Evaluation Real2Sim2Real World Models UMI BEHAVIOR-1K Embodied AI
2026-07-16 · Podcast Interview · full YouTube interview + OpenGalaxea model/data/code + Waymo VectorNet primary sources

高继扬访谈深读:GALAXEA 的整机—数据—模型闭环

完整梳理高继扬 3 小时 4 分钟访谈:从 Waymo VectorNet、Momenta 量产交付到 GALAXEA R1/R1 Lite、真实数据成本与 recipe、Carry/Pick/Pack/Fold/Operate 场景筛选、G0 VLM+VLA 双系统、开发者市场、许华哲离开、传播周期、组织高压与万台生产力目标;结合 G0 仓库、项目页、论文和 Waymo 一手资料,指出真正护城河是整机—数据—模型—渠道—场景的复制时间栈,而出货、客户数、融资和精选 demo 都不能替代长期生产运行账本。

Jiyang Gao GALAXEA G0 Robot Foundation Models Vision-Language-Action Robot Data VectorNet Developer Ecosystem Embodied AI Robotics Evaluation
2026-07-16 · Podcast Interview · full YouTube interview + XPENG AI Day/CVPR official materials + evidence-layered analysis

何小鹏访谈深读:IRON、VLA 与一次 Physical AI 组织换轨

完整梳理何小鹏 1 小时 26 分钟访谈:复盘 2025 年第一代 VLA 停止与组织重组、第二代 VLA 的范式替换,追踪 IRON 从探索到量产目标、拟人化设计、柔性皮肤/热管理、恐怖谷和舆情信任,审视 20% 胜率、20–100 倍汽车难度、80% 硬件自研、GX/Robotaxi/L4、销量归因和软件价值;结合 XPENG 2024–2026 官方资料,指出 Physical AI 的真正竞争是能力、尾部安全、场景覆盖、制造可靠与法规可售构成的联合可行域,AI-native 首先是组织与反馈闭环。

He Xiaopeng XPENG IRON Physical AI VLA 2.0 Humanoid Robotics Robotaxi Autonomous Driving AI-native Organization Robotics Evaluation
2026-07-16 · Podcast Interview · full YouTube interview + official PI research pages/papers + openpi repository

柯丽一鸣访谈深读:Physical Intelligence 的真正赌注

完整梳理近四小时访谈:从柯丽一鸣的竞赛、博弈论、模仿学习与强化学习经历,解释传统规划控制与数据驱动机器人的成本曲线之争;系统拆解 PI 的 π0 能力、π0.5 开放环境泛化、π*0.6 真实经验闭环与录制后 π0.7 多模态上下文 / 组合泛化,进一步审视真机数据、奖励与归因、throughput 评估、跨本体非人形路线、合作伙伴组织模式和中美软硬件优势,并区分官方证据、访谈立场与尚未证明的外推。

Physical Intelligence Liyiming Ke Robot Foundation Models Vision-Language-Action Pi0 Pi0.5 Pi*0.6 Pi0.7 Reinforcement Learning Cross-Embodiment Robotics Evaluation Embodied AI
2026-07-16 · Tech Analysis · X Article + primary MAD research + third-party code audit + production protocol

Agent Swarm 深读:多角色辩论何时增智,何时只是昂贵的共识剧场

深度解读《A Swarm of Agents for Multi-Angle Analysis》:还原 orchestrator、隔离专家、单轮辩论、反方审查与低温合并五段式架构;结合 self-consistency、MAD、DMAD、置信度与多样性、等 thinking-token 预算和 debate collapse 研究,解释上下文隔离为何不等于认知独立、错误相关性如何侵蚀有效专家数,以及为什么开放决策的最佳产物常是下一项消歧实验;同时审计第三方代码镜像并给出可验证的生产协议。

Agent Swarm Multi-Agent Debate Test-Time Scaling Self-Consistency Reasoning Diversity Confidence Calibration Decision Intelligence LLM Orchestration
2026-07-16 · Paper Note · X thread + arXiv v1 + official code + primary context-engineering research

Context Rot 深读:长程搜索 Agent 为什么会被自己的历史拖垮

深度解读 Diagnosing and Mitigating Context Rot in Long-horizon Search:还原四模型、三 benchmark、六类终态与七种上下文治理方法,拆解长轨迹如何把失败叙事变成行动先验,逐项核验摘要、裁剪、子 agent 隔离和八轨迹 rejection sampling 的准确率—rot—未完成率权衡;结合官方代码审计指出指标故障转移、不确定性洗白、plurality 投票、计数口径和原始结果缺失等边界,并提出事件日志、结构化证据账本与活跃工作集的抗 rot 架构。

Context Rot Long-Horizon Search Agent Context Engineering Deep Research Agents Context Compaction Rejection Sampling Agent Evaluation Subagent Isolation Long Context
2026-07-16 · Tech Analysis · official announcement + model card + released config/weights + Tinker docs + framework integrations

Inkling 深读:开放的不是榜单冠军,而是一套可更新模型栈

深度解读 Thinking Machines Lab 首个开放权重模型 Inkling:从 975B/41B MoE、5:1 局部/全局注意力、学习式相对位置、短卷积、encoder-free 图像与 dMel 音频、MTP,到 45T 预训练、30M+ 异步 RL、thinking effort 和 Tinker LoRA 自我微调闭环;复算 active parameters 与百万上下文 KV cache,逐项审视榜单、安全、事实性、硬件、许可证、框架集成、权重参数记账与数据透明度,并提出可塑性弹性、adapter 策略记忆和质量—成本曲线等七条独立判断。

Inkling Thinking Machines Lab Open Weights Mixture of Experts Long Context Multimodal Model Reinforcement Learning Thinking Effort Tinker LoRA Model Customization
2026-07-15 · Paper Note · arXiv v2 + official project page + code + model collection

Direct-OPD:把弱模型 RL 的策略位移迁移给强模型

深度解读 Weak-to-Strong Generalization via Direct On-Policy Distillation:从 KL-regularized RL 推导 teacher/reference log-ratio 如何成为 reward-like policy shift,拆解 student on-policy rollout、top-16 解析更新、自适应 KL 与顺序组合;逐项核验 AIME24/25 主结果、matched-route GPU-hours、严格 weak-to-strong 设置、官方实现与复现边界,并指出数学单域、理论—实现近似、词表兼容、reward hacking 传播和多 seed 缺失等关键限制。

Direct-OPD Weak-to-Strong On-Policy Distillation RLVR Policy Shift Implicit Reward Post-training Reasoning Models Knowledge Distillation
2026-07-15 · Tech Analysis · X article + ICML / OpenReview / arXiv primary sources

ICML 2026 研究趋势深读:当生成变便宜,评测、环境与记忆成为真正的瓶颈

深读 Soham Ray 的《Research Trends at ICML 2026》:完整还原自动研究、评测迁移、合成数据与 Agent Memory 四条主线,反向核验 MARS、InnoEval、benchmark saturation、Edge of Comprehension、REAL、Rubric Curriculum RL、Less is Enough、Simula、MemoryArena 与 τ benchmark 等代表工作;区分原文观察、论文证据与独立推论,并提出生成、验证、环境、记忆四层反馈栈,以及 benchmark 生命周期、executable environment、memory governance 和 verifier independence 等研究与工程判断。

X Article ICML 2026 AI Scientist Research Taste Agent Evaluation Benchmark Saturation Synthetic Data Agent Memory Tau Bench
2026-07-15 · Paper Note · X thread + arXiv v1 + public model cards

SAR 谱重连:RL 参数增量里的“推理核心”究竟是什么?

完整还原 SAR 作者主帖与 1–10 条线程,深读 21 页 arXiv v1:拆解基座 top-k SVD 坐标、RL delta 低秩截断与双侧投影,逐项核验 AIME、Pass@k、内部 agentic coding、32B Mix-RL 和 1.5B/14B 专家合并结果;区分紧凑更新表示、探索改善、跨域正则化与“原子技能/功能流形”机制叙事,并指出 Coverage@256 仅多覆盖一道题、rank 选择缺少独立测试、0.58% 参数记账无法按正文独立复算、官方代码与内部模型尚未公开等关键证据边界。

SAR Spectral Rewiring RL Post-training Parameter Geometry Pass@k Model Merging Multi-Domain RL Exploration SVD
2026-07-15 · Paper Note · arXiv v1 + official model cards/configs + public inference implementation

DeepSeek-V4 深读:百万 Token 不是窗口数字,而是一整套系统契约

深度解读 DeepSeek-V4 技术报告:完整拆解 1.6T/49B Pro 与 284B/13B Flash、CSA/HCA 多尺度压缩注意力、mHC 四路残差、Muon 与 MoE 稳定性、FP4/FP8 和确定性内核、异构 KV cache、多教师全词表 OPD、百万 Token rollout 与沙箱基础设施;逐项核验公开评测、内部真实任务和官方模型配置,并指出 1M 是模型—训练—推理—后训练的系统契约,不是无损记忆保证。

DeepSeek-V4 Million-Token Context Compressed Sparse Attention Heavily Compressed Attention Manifold-Constrained Hyper-Connections Muon Optimizer On-Policy Distillation Mixture of Experts Agent Infrastructure Long Context
2026-07-15 · Tech Analysis · X post + official research pages + primary papers

Richard Sutton 创办 Oak Lab:运行时经验、Big World 与深度学习底座之争

深度解读 Richard Sutton 创办 Oak Lab 的 X 公告及回复区争议,并用 Oak 官方材料、Big World、OaK / FC-STOMP、IDBD / NetworkIDBD、SwiftTD、实时递归学习、Physical Atari、持续学习可塑性论文,以及 Keen 与 Ineffable 的公开路线交叉核验:核心不是“RL 取代深度学习”,而是重写离线 batch、全局信用、经验回放和冻结部署的学习制度;同时严格区分已有问题证据、组件级结果与尚未验证的一万亿参数 / 20W 愿景。

Richard Sutton Oak Lab OaK Architecture Continual Learning Reinforcement Learning Big World Hypothesis Credit Assignment Runtime Learning Event-driven Networks Era of Experience
2026-07-09 · Paper Note · OpenAI research paper + Lilian Weng blog

Beneficial RL 与 Harness Engineering:自我改进系统的内外两层持久性

合读 OpenAI Beneficial RL 与 Lilian Weng Harness Engineering:把自我改进系统拆成内部 trait persistence 与外部 harness persistence 两层,解释 beneficial trait RL 如何在 53 个 OOD alignment eval、adversarial prompting 与 harmful finetuning 中报告更持久的有益行为,以及 harness 如何通过 context、workflow、tools、memory、evaluation、permission 和代码化 self-improvement 承载近中期 RSI。

Beneficial RL Harness Engineering Alignment Self-Improvement Recursive Self-Improvement Agent Harness Context Engineering Evaluation Governance AI Safety
2026-07-09 · Paper Note · arXiv papers + project pages + GitHub

Verifier、Compaction 与 Direct-OPD:Agent RL 的三种可复用中间信号

综合 LLM-as-a-Verifier、CompactionRL 与 Direct-OPD:解释 agent RL 如何从稀疏最终奖励转向可复用中间信号,包括用评分 token logprob expectation 做候选选择与进度估计、把 context summary 训练成 policy action,以及从弱模型 RL 前后 log-ratio 中提取可迁移 policy-shift reward;同时明确 logprob API、summary 质量、AIME-only 证据、v1/v2 数字冲突和代码发布边界。

LLM-as-a-Verifier CompactionRL Direct-OPD Agent RL Verifier Context Compaction On-Policy Distillation Weak-to-Strong Reward Shaping
2026-07-09 · Paper Note · arXiv papers + official project/model pages

EdgeBench 与 Gemma 4:环境学习评测和可部署开放模型栈

合读 EdgeBench 与 Gemma 4 Technical Report:解释为什么 agent 时代需要把环境交互时间作为 scaling axis,同时也需要开放模型栈在长上下文、thinking、function calling、QAT、MTP、多模态接口和部署成本上支撑长反馈循环;梳理 EdgeBench 134/51 任务、log-sigmoid 拟合、经验保留与上下文 ablation,以及 Gemma 4 dense/MoE 架构、encoder-free 12B、长上下文和量化边界。

EdgeBench Gemma 4 Agent Evaluation Environment Learning Scaling Laws Open Models Long Context Multimodal Models Deployment
2026-07-09 · Tech Analysis · X posts + arXiv papers + official blogs

六条 X 材料深读:AI 前沿的六个反馈闭环压力测试

深度改写六条 X/Twitter 材料:逐条展开 beanie0__0 的 self-distillation/epistemic verbalization、Grad 对 GLM-5.2/SAO 与 PPO 归因的成本质疑、dongxi_nlp 对 Anthropic J-space readout/control 的怀疑、OpenAI SWE-Bench Pro 审计、Cognition SWE-1.7 与 FrontierCode 发布,以及 Shilong Liu 的 self-evolving agents taxonomy;先完整介绍原帖、回复、外部材料与证据边界,再给出 senior researcher insight,避免浅层主题摘要。

X Thread AI Research Self-Distillation Agentic RL J-space Coding Agents SWE-Bench Self-Evolving Agents Evaluation
2026-06-15 · Tech Analysis · single HTML note · X post + X article + arXiv papers

Solving OPSD?正向 pressure、regretful teacher 与 RLRT 边界

深度 review ar0cket1 的 X 长文《Solving OPSD (basically)》:解释为什么这篇帖真正有价值的不是“OPSD 基本解决了”,而是把 hinted self-distillation 中 teacher-student gap 拆成 positive pressure 与 negative pressure,并进一步提出 regretful teacher 这一语义诊断;系统梳理 hint rewrite、KL shocks、trace labeling、与 RLRT 的 exploration / exploitation 分工,并明确哪些论点已有证据支持、哪些仍属于强假设。

OPSD On-Policy Self-Distillation Positive Pressure Regretful Teacher RLRT OPD Self-Distillation RLVR X Article Post-training
2026-06-12 · Paper Note · single HTML note · X post + arXiv paper + Kyutai blog + HF models

Kyutai 语音交互对齐:Full-Duplex 模型不是更快说话,而是更会合拍

深度解读 Kyutai Labs 发布的 Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models:解释为什么 full-duplex 语音模型的自然性不只是低延迟,而是停顿处理、接话、backchannel 附和和用户插话四类交互节奏的联合优化;系统梳理真实双人对话片段抽取、轴特定 VAD 奖励、LLM Judge 语义保护、GRPO 后训练、Full-Duplex-Bench v1/v2 结果、消融实验与安全退化风险,并给出语音 Agent 交互层 reward stack 的工程启发。

Kyutai Full-Duplex Speech Moshi PersonaPlex Speech Model Alignment GRPO Backchanneling Turn-taking Voice Agents Post-training
2026-06-12 · Paper Note · single HTML note · X post + arXiv paper + GitHub

Attention Amnesia:CoT 后训练如何改坏 Hybrid LLM 的长程检索路由

深度解读 sheriyuo 关于 Attention Amnesia 的 X 帖与 arXiv 论文:解释为什么在 hybrid linear-attention 模型中,CoT-SFT 会把少数 full-attention 层的 W_Q/W_K 路由几何推向局部推理轨迹,导致长上下文 Needle-In-A-Haystack 召回退化;系统梳理 gradient locality、routing-extraction decomposition、QK-Restore、QK-Pro、non-CoT SFT 对照、Q/K/V 消融与 pure softmax 边界,并给出 post-training 中监控 routing stability 的工程清单。

Attention Amnesia QK-Restore Hybrid LLMs Linear Attention Long Context Chain of Thought CoT-SFT NIAH Attention Routing Post-training
2026-06-09 · Paper Note · single HTML note · X post + arXiv paper

CL-Bench:Agent Memory 不是记住,而是从经验中变好

深度解读 Continual Learning Bench / CL-Bench:解释为什么 Agent memory 评测不能停留在 recall,而要看历史经验是否带来 stateful 相对 stateless 的 gain;系统梳理六个任务、gain 指标、ICL 强基线、Mem0/ACE/Notepad 等记忆系统表现、稳定性与可塑性失败案例,并提出把 memory 设计成带证据、置信度、适用范围和失效条件的假设治理系统。

CL-Bench Continual Learning Agent Memory LLM Agents Agent Evaluation In-Context Learning Stateful Systems Memory Benchmark Concept Drift
2026-06-09 · Paper Note · single HTML note · X post + arXiv paper

OPD 参数几何:低秩锁定是正则化,还是泛化瓶颈?

深度整理 rosinality 对《On the Geometry of On-Policy Distillation》的讨论:解释 OPD 为什么在最终更新量级上介于 SFT 与 RLVR 之间,却在训练轨迹上很早进入低维 update channel;系统梳理 bf16-aware sparsity、principal-angle rotation、spectral drift、stable rank、rank-16 投影实验与 objective mixing 控制实验,并讨论 subspace locking 对泛化的双重含义:既可能是保留预训练结构的隐式正则化,也可能是 teacher / rollout / objective 共同造成的早期路径依赖瓶颈。

On-policy Distillation OPD Parameter Geometry Subspace Locking Stable Rank RLVR SFT Generalization Post-training
2026-06-09 · Tech Analysis · single HTML note · X Article + evaluation framework analysis

大规模 Test-Time Compute:从模型分数到能力曲线

深度整理 Noam Brown《Implications of Large-Scale Test-Time Compute》:解释为什么现代 LLM 能力越来越像 tokens、成本、时间和 scaffold 共同决定的预算函数,而不是 leaderboard 上的单一分数;并梳理 performance-vs-compute 曲线、Preparedness/RSP 安全评估、Gemini Deep Think 争议、产品选型中的 cost per solved task,以及 benchmark 从排行榜转向 Pareto 曲线的实践清单。

Test-Time Compute LLM Evaluation Benchmark Reasoning Models AI Safety Preparedness Framework Inference Budget Agent Evaluation Pareto Frontier
2026-06-09 · Tech Analysis · single HTML note · X Article

Codex Token 从 245M 到 28M:上下文治理,而不是省钱小技巧

深度解读 Tim Jayas 的 X Article《How I Cut Codex Tokens from 245M to 28M Per Day For Free》:把表层的省 token 技巧重读为 coding agent 的上下文治理系统,拆解预压缩 raw data、命令输出限流、living handoff、Do Not 规则、targeted snippets、周期 compact 和低 verbosity 背后的信息架构,并指出 summary-first 不能替代 raw-slice 取证、head/tail 可能漏掉中部错误、helper script 也需要校验等关键边界。

Codex Coding Agents Context Engineering Token Efficiency Agent Workflow Handoff Prompting Developer Productivity
2026-06-09 · Paper Note · single HTML note · X thread + arXiv paper + project page

NF-CoT:把 Chain-of-Thought 迁移到可采样的连续潜变量空间

深度解读 Jiatao Gu 发布的 NF-CoT / Latent Reasoning with Normalizing Flows:解释为什么 continuous CoT 的难点不是把思考藏进 hidden state,而是保留显式 CoT 的左到右生成、概率采样、精确似然、KV-cache 友好和 GRPO 后训练接口;系统拆解 VAE latent、normalizing flow 重参数化、LLM-facing continuous thoughts、统一 causal stream、pass@k 多样性、效率收益与可解释性边界。

NF-CoT Latent Reasoning Chain of Thought Normalizing Flow STARFlow GRPO Code Generation Test-Time Compute
2026-06-08 · Paper Note · single HTML note · X post + arXiv paper + GitHub + HF dataset

MMAE:音频编辑从“能生成”到“能精修”的评测分水岭

深度解读 Tencent Hunyuan 发布的 MMAE: A Massive Multitask Audio Editing Benchmark:解释为什么指令式音频编辑不同于普通音频生成,MMAE 如何用 2,000 个样本、17,741 条 rubric、7 类模态、6 类复杂度和 8 类操作构建评测,并分析当前模型 EMR 低于 5% 背后的结构性瓶颈、planner 局限与下一代音频编辑系统设计方向。

MMAE Audio Editing Audio Generation Benchmark Rubric Evaluation Tencent Hunyuan Multimodal Audio Model-as-Judge
2026-06-08 · Tech Analysis · single HTML note · X post + arXiv paper + AutoLab site + GitHub

AutoLab:长时程 Agent 的胜负手不是第一拍,而是闭环控制

从 Rohan Paul 的 X 帖深入到 AutoLab 论文、官网、代码仓库与公开轨迹子样本:解释这个 benchmark 真正测到的不是励志意义上的 persistence,而是长时程 agent 在固定预算下管理 benchmark、反馈吸收、best-so-far 状态、收尾纪律与 harness 的闭环控制能力;并对比 RE-Bench、AIRS-Bench、KernelBench,厘清 AutoLab 的定位与边界。

AutoLab Long-Horizon Agents Closed-Loop Optimization Agent Evaluation Harness Benchmark Research Agents
2026-06-08 · Tech Analysis · single HTML note · X Article + Zhihu + RL infra references

Prime Intellect 视角下的 RL 后训练 32 答:vivek_2332 的算法/Infra 双向工程笔记

深度解读 @vivek_2332 对 sheriyuo 35 道 RL Interview Questions 2026 的 32 答长帖:页面先补齐可直接查阅的 32 问与答速查(Algo 19 个题位中 16 条实质答复 + Infra 16 个题位),再按 Prime Intellect 工业视角重排为 6 层技术栈地图,涵盖 Actor-Critic 显存预算、GRPO 变体横向对比、KL 去留、OPD、DPO、trainer-inference 数值一致性、fp8/int8、vLLM/SGLang、PP 不推荐、staleness 1-4 步,以及 Prime-RL/verl/TRL/AReaL 框架差异。

LLM RL GRPO Family PPO Clipping KL Regularization OPD DPO Reward Hacking MoE Routing Quantization fp8 int8 Continuous Batching vLLM SGLang Async RL Staleness Prime Intellect AReaL verl TRL MoE
2026-06-08 · Paper Note · single HTML note · X post + arXiv paper + project page

RAGEN-2:Entropy 没塌,不代表 Agent 还在看输入

深度解读 RAGEN-2: Reasoning Collapse in Agentic RL:解释为什么 token-level entropy 只能看到同一输入下的表面多样性,无法发现跨输入的 template collapse;拆解 mutual information proxy、in-batch cross-scoring、reward variance / SNR 机制、SNR-Aware Filtering 的实验收益与工程边界。

RAGEN-2 Agentic RL Template Collapse Mutual Information Reward Variance SNR-Aware Filtering Reasoning
2026-06-08 · Tech Analysis · single HTML note · X Article + 35 道面经

RL Interview Questions 2026:从面经到 LLM/Agentic RL 全栈能力地图

深度解读 sheriyuo 的 RL Interview Questions 2026 / 2026 年 RL 方向面经合集:把 35 道算法与 Infra 问题拆成 LLM RL / Agentic RL 的能力地图,覆盖 PPO/GRPO、DAPO/GSPO/CISPO、OPD、reward、rollout、KV cache、MoE、异步训练、staleness 与 VeRL/AReaL/slime 选型。

RL Interview LLM RL Agentic RL GRPO PPO RL Infrastructure Async RL
2026-06-08 · Paper Note · single HTML note · X post + arXiv paper + project page + GitHub

Self-Trained Verification:把“带答案时会挑错”蒸馏成可用 verifier

深度解读 Chen Henry Wu 与 Aditi Raghunathan 的 Self-Trained Verification:解释为什么 reasoning self-improvement 的瓶颈是 verifier,STV 如何把 reference-conditioned teacher 蒸馏成不看答案的 verifier,以及 ViL 如何用诊断反馈突破标准 RLVR plateau;同时梳理 hard math、SciKnowEval、weak-to-strong verifier、reward hacking 和开放式任务迁移边界。

Self-Trained Verification Verifier RLVR On-policy Distillation Test-time Compute Reasoning Self-Improvement
2026-06-08 · Tech Analysis · single HTML note · X post + Substack + arXiv papers

GRPO++:让 RLVR 真正跑起来的后训练工程手册

深度解读 @neural_avb 推荐的 Cameron R. Wolfe《GRPO++: Tricks for Making RL Actually Work》:从 PPO/GRPO 基础出发,系统梳理 vanilla GRPO 的 reward noise、entropy collapse、长度偏置、zero-gradient prompts 与 sampler-learner off-policy gap,并解释 DAPO、Dr. GRPO、TIS、GSPO、GMPO、CISPO 分别在修哪一层后训练工程问题。

GRPO RLVR Post-training Reasoning Models DAPO Dr. GRPO TIS GSPO
2026-06-04 · Tech Analysis · single HTML note · arXiv + W&B report + X thread

Fantastic Pretraining Optimizers and Where to Find Them:一次 optimizer benchmark 的清算

深度解读 Kaiyue Wen 等人的工作,结合原论文、W&B 详尽实验报告和 GitHub 实验索引,解释为什么很多 1.4–2× optimizer speedup claim 是弱 baseline 和 unfair benchmark 造成的幻觉,以及 matrix-based optimizer 在公平比较下的真实边界。

Optimizer Pretraining AdamW Muon SOAP Scaling Law Benchmark Hygiene
2026-06-03 · Tech Analysis · single HTML note · MAI-Base-1 architecture + literature survey

LLM Infra 设计谱系:从 attention 到 MoE 再到 FP8

从 MAI-Base-1 的架构表出发,调研 local/global attention、GQA/MQA、top-k MoE、LatentMoE、dropless routing、zero-init attention output、FP8 E4M3/E5M2 等 infra 术语背后的技术动机、演进轨迹、代表工作和关键结论:这些设计共同服务于 attention FLOPs、KV cache、all-to-all、router imbalance、GEMM shape、数值稳定和 goodput 的预算化。

LLM Infrastructure Attention GQA Mixture of Experts FP8 Distributed Training
2026-06-03 · Tech Analysis · single HTML note · Microsoft technical report PDF

MAI-Thinking-1:微软如何把模型研发做成 Hill-Climbing Machine

深度分析 Microsoft AI 技术报告《MAI-Thinking-1: Building a Hill-Climbing Machine》:解释 35B active / 1T total MoE、30T token 预训练、scaling-aware data mixture、NLL suite、dropless MoE、zero-init attention、GRPO-style RL、self-distillation recovery、agentic SWE 环境、安全 gated reward、YOLO/Rocket 基础设施和 8K GB200 goodput 背后的系统性模型研发范式;并本地化所有编号 Figure/Table 所在页面作为图表证据索引。

MAI-Thinking-1 Microsoft AI Hill-Climbing Machine MoE Reasoning Model RL Post-training LLM Infrastructure
2026-06-03 · Paper Note · single HTML note · X thread + arXiv paper

OmniOPD:用语义 chunk 验证绕开 teacher logits

深度解读 Zhuokai Zhao 关于 OmniOPD 的 X 原帖、前序 OPD 脆弱性长帖和 arXiv 2606.01476:解释标准 OPD 为什么受限于 teacher logits、tokenizer/style mismatch 和 fragile next-token overlap,以及 OmniOPD 如何用 peak-entropy chunk selection、teacher Monte Carlo rollouts、semantic similarity、Dirichlet-Multinomial prior 和 reference KL anchor 构造 logit-free on-policy distillation。

OmniOPD On-policy Distillation Logit-free Distillation Post-training Reasoning Black-box Teacher
2026-06-03 · Tech Analysis · single HTML note · X thread + arXiv/blog/report reading map

LLM RL at Scale:从 scaling law 到 agentic post-training 的阅读路线

深度解读 Cameron Wolfe / cwolferesearch 的 RL at scale X 书单:把 26 条论文、框架、agentic RL 与工业技术报告短链整理成一条后训练路线,解释为什么 LLM RL scaling 不能照搬预训练 scaling law,而必须同时处理 rollout 吞吐、policy freshness、importance sampling、reward/verifier 可靠性、agent 环境供应链和真实产品闭环。

RL at Scale Post-training Agentic RL Async RL RL Infrastructure Scaling Law
2026-06-03 · Tech Analysis · single HTML note · X post + Papers with Code + Phi-4 + arXiv

Mid-training:预训练和后训练之间真正发生了什么

深度解读 Niels Rogge 关于 mid-training 的 X 原帖与 Papers with Code 方法页:解释 mid-training 为什么不是简单的 post-training,而是把通用 base model 继续推向长上下文、领域知识、代码、数学或 agent 轨迹等目标能力分布的中间层;并用 Phi-4、distribution bridging、daVinci-Dev 和 Agentic CPT 说明它和 SFT、DPO、RL 的真实边界。

Mid-training Pretraining Post-training LLM Training Agentic Training Data Quality
2026-06-03 · Paper Note · single HTML note · X thread + arXiv paper

CAST:给 GRPO 补上 verifier-grounded 的 token 级信用分配

深度解读 @sheriyuo 关于 CAST / GRPO 的 X 原帖与 arXiv 2606.00172:解释 GRPO 在 all-correct / all-wrong zero-variance groups 上的死区,OPSD token preference 与 trajectory correctness 的错位,以及 CAST 如何用 answer-free self-teacher、asymmetric clipping、zero-variance base advantage 和 bidirectional advantage flipping 给 RLVR 训练补上 verifier-grounded 的 token 级信用分配。

CAST GRPO RLVR Self-Distillation Credit Assignment Post-training
2026-06-02 · Tech Analysis · single HTML note · X thread + GitHub + arXiv

A-Evolve:把 Agent Harness 变成可演化的工程对象

深度解读 A-Evolve 两篇论文与开源框架:拆解 Position Paper 的方法贡献(≈ 0 新算法)、Harness Updating ≠ Harness Benefit 作文的受控实验发现(evolver 强弱不重要,solver 能力才决定收益),并把 A-Evolve 放进 2023-2025 十种同类工作的坐标里,逐项审视每个卖点是否算创新。追加赛道全景对照表、7 项机制创新性评估、诚实总结。

A-Evolve Self-improving Agents Harness Evolution Agent Workspace SWE-bench
2026-06-02 · Tech Analysis · single HTML note · X Article + papers + serving docs

Speculative Decoding:投机解码的真实收益、校正采样与生产边界

深度解读 Mohit 的 X Article《Everything you need to know about Speculative Decoding Inference》:在“小模型先猜、大模型验收”的入门直觉之外,补齐 speculative sampling、modified rejection sampling、residual correction、lossless guarantee、draft model / EAGLE / Medusa / MTP / NGRAM 方法谱系,以及 SGLang/vLLM 生产部署中的 batch、KV cache、显存和采样边界。

Speculative Decoding LLM Inference Serving EAGLE Medusa vLLM SGLang
2026-06-02 · Paper Note · single HTML note · X thread + Substack + arXiv PDF

The Thinking Pixel:把 test-time compute 放进扩散模型 latent 层

深度解读 che_shr_cat 关于 The Thinking Pixel 的 X thread、作者 Substack 公开片段与 arXiv 2604.25299:解释 Recursive Sparse Reasoning 如何在 SD3 / DiT 的 joint attention 层内用 Mixture-of-Adapters、Gumbel-Softmax 路由和 LoRA 低秩专家给视觉 latent token 增加递归 test-time compute;同时校正 GenEval、DPG、ImageNet FID 与 FrozenLake 实验的证据边界。

Thinking Pixel Diffusion Model Test-Time Compute Mixture of Adapters Visual Latent Reasoning
2026-06-02 · Paper Note · single HTML note · X thread + arXiv paper + HF dataset + GitHub

RHELM:长期记忆评测为什么必须超越静态对话

深度解读 HuggingPapers 推荐的 Microsoft / Renmin University RHELM benchmark:解释为什么长期记忆评测不能停留在静态对话检索,而要覆盖动态 persona、LOOP 轨迹演化、邮件/附件/对话多源同步、misleading query、hallucination correction 与 cross-source aggregation;并分析 RAG、长上下文模型和 memory frameworks 在 RHELM 上暴露的统一记忆架构缺口。

RHELM Long-term Memory Memory Benchmark RAG Personal Assistant
2026-06-02 · Paper Note · single HTML note · X thread + arXiv paper + GitHub + HF

LongTraceRL:用搜索轨迹和实体级 rubric 训练 128K 长上下文推理

深度解读 HuggingPapers 推荐的 LongTraceRL:解释为什么长上下文 RLVR 不能只靠随机 distractor 和 outcome-only reward,LongTraceRL 如何用 Wikipedia KG random walk 生成 8-hop 问题、用 search agent trajectories 抽取 Tier-1/Tier-2 hard distractors,并用 positive-only entity-level rubric reward 在 128K context 上训练证据接地推理;同时梳理 4B/8B/30B 实验、rubric/distractor ablation、公开模型和数据集边界。

LongTraceRL Long Context RLVR Rubric Reward Search Agent
2026-06-02 · Tech Analysis · single HTML note · X thread + slide deck + GitHub

Agentic RL 的 rollout 层:从 Agent Loop 到 Agent Environment

深度解读 Yuan He 关于 multi-turn RL rollouts 的 X 主帖、From Agent Loops to Agent Environments slide deck、strands-env 与 strands-sglang:解释为什么 agentic RL 的第一问题不是 KL/GRPO 等算法,而是 rollout system 是否保持 token-faithful、strict tool parsing、termination taxonomy、train-inference match 与环境并发效率;并把 A2E 回复区链接作为 agent-to-environment 协议层对照。

Agentic RL Rollout System Agent Environment Strands Env Strands SGLang
2026-06-02 · Paper Note · single HTML note · X thread + arXiv paper

TRB:把 OPD 的早期采样问题改写成受约束的教师引导

深度解读 Trust-Region Behavior Blending for On-Policy Distillation:解释 OPD 为什么会卡在 early student rollout,TRB 如何用 student-centered KL trust region 临时构造接近 teacher 的 behavior policy,并在 warmup 后退火回纯 student rollout;同时分析 Qwen3 数学蒸馏实验中 0.4-0.9 pass@1 平均提升的证据边界。

TRB On-policy Distillation Trust Region Warmup Reasoning
2026-06-02 · Tech Analysis · single HTML note · 102 rounds / 241 tweets / 10 topics

X 推文周期观察:AI 研究动态 102 轮选 24 条

SheSheBot x-tweet-digest 流水线 24 小时内 102 轮(每 15 分钟)周期观察的精选版:241 条独立推文覆盖 audio LM / multimodal / agent / harness / RL / reward / agentic 7 个方向,10 个主题均衡。报告拆解 Physical AI / Omnimodal(NVIDIA Cosmos 3)、Multimodal Agent(Step 3.7 Flash、Qwen3.7-Plus、MiniMax M3)、Agentic RL & Reward(Kimi subagent RL、Harnessy、Repo2RLEnv)、Speech LLM(OpenAI gpt-realtime-translate、AA-WER Streaming、Tencent 通用 audio tokenizer)四条产业主线,并解释周期观察、去重和主题轮换的工程实现。

X Tweet Digest Periodic Fetching Audio LM Multimodal Agent Agentic RL Harness Reward Model
2026-06-02 · Tech Analysis · single HTML note · X thread + author blog

Async RL 是否已解决:policy lag、IS 偏差与后训练系统边界

深度解读 Luke J. Huang 关于 frontier asynchronous RL 的 X thread 与长文:解释异步 RL 如何用 rollout/training 解耦换取 2-3x 吞吐,又如何因 policy lag 产生 stale trajectory 和 off-policy instability;梳理 TIS/CISPO、MIS/IcePop、DeepSeek masking、M2PO、MoE routing replay、batch-invariant kernels、FP32 LM head、fast weight sync 等修补手段,并分析 sequence-level IS、token-level IS 与低偏差 compute scaling hypothesis 的工程边界。

Async RL Policy Lag Post-training Importance Sampling RL Infrastructure
2026-05-30 · Paper Note · single HTML note · X thread + arXiv paper + GitHub + HF

BES:把搜索从同分布采样推进到目标反推与轨迹重组

深度解读 Kevin Guowei Xu 关于 BES 的 X 线程、arXiv 2605.28814、GitHub 仓库和 Hugging Face 模型集合:解释 Bidirectional Evolutionary Search 如何用 backward goal decomposition 把稀疏终局奖励变成子目标覆盖信号,并用 combination、deletion、translocation、crossover 重组不同错误轨迹里的局部正确片段,分析其在 post-training、multi-hop agent 和 open problem solving 中的证据与边界。

BES Bidirectional Search Evolutionary Search Post-training Test-Time Search
2026-05-28 · Tech Analysis · single HTML note · X thread + arXiv papers

Self-Distillation 的两面性:World-Bayesian 与 Self-Bayesian 推理

深度解读 Jeonghye Kim 关于 MSRA 实习研究线的 X 线程:解释为什么 self-distillation 在 long-horizon agent 任务里像外部世界经验压缩,却在数学和纯内部推理里可能压制 epistemic verbalization,并串联 EMPO²、Strategic Information Allocation、Self-Distillation Degradation 与 Rebellious Student/RLRT 四篇工作。

Self-Distillation LLM Reasoning Post-training RLVR Epistemic Verbalization
2026-05-28 · Paper Note · single HTML note · X thread + arXiv paper

Self-Verified Distillation:模型如何把自验证变成后训练数据引擎

深度解读 Tony Lee 与 Percy Liang 的 Self-Verified Distillation 论文和 X thread:解释模型如何从无标签 seed questions 出发,用自生成候选解、UQ 风格多阶段自验证和 SFT 构造 post-training 数据,并分析 generator-validator consistency、UQ-TTC 168 次推理成本、Qwen3 多规模实验收益和自验证边界。

Self-Verified Distillation Self-Training Post-training Verification Reasoning
2026-05-28 · Paper Note · single HTML note · X thread + arXiv paper + GitHub

LRPO:把语言选择变成多语言后训练的可学习变量

深度解读 CherylolGuo 关于 LRPO 的 X 线程、arXiv 2605.25360 和官方 GitHub README:解释为什么知识不是均匀分布在语言中,LRPO 如何把 rollout language 作为可学习变量,用 language router、跨语言 reward calibration 和语言一致性奖励改进多语言 policy optimization,并分析其对多语言 RAG、国际化 agent 和 reward 设计的工程启发。

LRPO Multilingual RL Policy Optimization Language Routing Reward Calibration
2026-05-28 · Tech Analysis · single HTML note · X Article + LAB materials

Harvey/Baseten:开放法律 Agent 后训练路线

深度解读 Gabe Pereyra 关于 Harvey 与 Baseten Research 的开放法律 Agent 后训练文章:解释 LAB 如何从法律 agent benchmark 变成可训练环境,为什么 read-heavy 行为、compaction harness、iSFT 和 rubric-passing trajectories 共同构成垂直 agent 后训练闭环,并分析外部复现、rubric reward、private-mode submit 与 KV cache compaction 的边界。

Legal Agent Post-training Harvey LAB Baseten Research Compaction
2026-05-28 · Tech Analysis · single HTML note · X thread + official blog + GitHub

Orbit:把万亿模型 RL 后训练改写成部署一致性问题

深度解读 Besteuler 关于 Orbit 的 X 帖、SphereLab 英文博客、GitHub 仓库和 rollout 架构补充页:解释为什么 Orbit 的关键不是单点 OFT,而是 frozen low-precision base、BF16 adapter、deployment-aligned RL、adapter-native async 和 double-buffered rollout 共同降低万亿模型后训练的显存、权重同步与 train-rollout gap。

Orbit RL Post-training OFT PEFT LLM Infrastructure
2026-05-27 · Tech Analysis · single HTML note · X thread + project materials

CUA-Gym:Computer-Use Agent 的 RLVR 数据基础设施

深度分析 Bowen Wang 关于 CUA-Gym 的 X 线程、论文页、项目主页、Hugging Face 数据集与 GitHub 仓库:解释为什么 Computer-Use Agent 的 RLVR 瓶颈在可复位、可检查、可程序化奖励的数据环境,而不只是算法;同时梳理 setup-gen / reward-gen / orchestrator 闭环、CUA-Gym-Hub 状态 API、OSWorld / WebArena 结果和当前发布材料中的数字差异。

Computer-Use Agent RLVR CUA-Gym OSWorld WebArena
2026-05-27 · Tech Analysis · single HTML note · X thread + Notion blog

KPop:用自适应 Mask 稳住 Agentic RL 的训练-推理错配

深度解读 Jia Guo 关于 KPop 的 X 主帖与 Notion 博客:解释为什么大规模 MoE / agentic RL 会出现 training-inference mismatch,IcePop 固定 ratio mask 为什么失效,以及 KPop 如何用 symmetric binary KL 构造 token-level hard trust region,让 Ring-2.6-1T 的 SWE agentic RL 在作者报告中从 70.8% 提升到 76.28%。

Agentic RL MoE Training-Inference Mismatch KPop SWE-bench
2026-05-27 · Paper Note · single HTML note · X thread + Ai2 paper

Cracks in the Foundation:长上下文扩展为什么会被小架构选择击穿

深度解读 Gabriele Berton 关于 OlmPool 的 X 主帖与 Ai2 论文:为什么 QK norm、GQA、sliding window attention 和预训练上下文长度这些看似局部的架构选择,会在 context extension 中复合放大,导致长上下文 benchmark 表现最多下降约 47%。

Long Context LLM Architecture Attention Context Extension OlmPool
2026-05-26 · Study Resource · single HTML note · reading map

Hwcoder 算法笔记体系读书笔记

把 Hwcoder 算法笔记分类中的 23 篇算法入门、力扣刷题和手撕经典算法内容整理成一份站内读书笔记:按基础工具、刷题题型、通用模板、深度学习手写组件和复习路线重构,保留完整源笔记清单与阅读定位。

Algorithm LeetCode Manual Coding Dynamic Programming Transformer
2026-05-26 · Paper Note · single HTML note · arXiv paper + project page

SkillEvolBench 深度解读:从一次性经验到可复用程序性技能

深度解读 arXiv 2605.24117 与项目主页:SkillEvolBench 如何用 6 个真实 agent 环境、180 个任务、acquisition/deployment/replay 协议和 Raw-Trajectory control 评估 agent 能否把 episodic trajectory 演化为 reusable procedural skill,并分析当前 skill abstraction 为什么经常输给原始轨迹复用。

Agent Skills Skill Evolution Experience Reuse Agent Evaluation Procedural Memory
2026-05-25 · Tech Analysis · single HTML note · X thread + arXiv paper

Shannon Scaling Law 与 Token Noise 极限解读

深度解读 rosinality 对《LLMs as Noisy Channels》的评论:为什么 token noise exponent 大于 signal exponent 会让继续加 tokens 的单调收益失效,以及 Shannon Scaling Law 如何用 SNR、loss basin 和外推实验解释过训练、量化与 SFT 扰动。

Scaling Laws Shannon LLM Training Data Quality X Thread
2026-05-25 · Paper Note · single HTML note · arXiv paper

RL Memory Agent 训练数据效应:Curriculum 如何塑造外部记忆问答能力

深度解读 arXiv 2605.23067:在 memory-augmented QA 中,LoCoMo、LongMemEval 与混合 curriculum 如何改变 RL Answer Agent 的细分技能 profile;同时梳理单 GPU GRPO 下 memory bank 清洗和 binary exact-match reward 方差塌缩的工程边界。

Agent Memory GRPO Curriculum Evaluation RL
2026-05-25 · Tech Analysis · single HTML note · X thread + paper + official blog

SaaS-Bench 解读:Computer-Use Agent 为什么还不是可靠的 SaaS 工作者

深度解读 @sheriyuo 关于 UniPat AI SaaS-Bench 的 X 帖、官方 blog 与 arXiv 论文:解释 23 个真实 SaaS 系统、106 个长程任务、Checkpoint Score 与 Resolved Score 的巨大落差,以及为什么当前 Computer-Use Agent 还缺少状态验证、跨应用依赖管理和错误恢复能力。

Computer-Use Agent SaaS-Bench Agent Evaluation Browser-Use Workflow Reliability
2026-05-25 · Tech Analysis · single HTML note · X Article + official blog

ZCube 推理网络架构解读:KV Cache 流量如何改变数据中心拓扑

深度解读 Z.ai 关于 ZCube 的 X Article 和官方博客:从一次 PD 请求链路、KV Cache 体积公式、ROFT/Fat-Tree 局部热点机制讲起,解释 ZCube 如何用扁平二部拓扑、单轨/多轨混合接入和路径分散降低 TTFT 慢尾,并给出可落地的集群诊断清单。

LLM Inference Datacenter Network KV Cache ZCube TTFT
2026-05-25 · Tech Analysis · single HTML note · X thread + arXiv paper

EqR 与 Neural Attractors:从 Feedforward 到 Iterative Reasoner

深度解读 Benhao Huang 关于 EqR 的 X side-post 与 arXiv 论文:解释 weight tying、segmented online training、hierarchy、ACT、RI/NI 如何共同塑造 neural attractor landscape,并区分 residual convergence 与真实 correctness 的边界。

EqR Iterative Reasoning Test-Time Scaling Neural Attractors X Thread
2026-05-25 · Tech Analysis · single HTML note · X thread + arXiv paper

Agentic Systems as Boosting Weak Reasoning Models 深度解读

深度解读 Grigory Sapunov 的 X 线程与 arXiv 2605.14163:为什么弱模型候选池里经常已有正确 patch,critic-comparator harness 如何回收 oracle best-of-k 暴露的 latent capability,以及 blind-spot floor 为什么限制 test-time boosting。

Agent Test-Time Scaling SWE-bench Verifier Boosting
2026-05-25 · Tech Analysis · single HTML note · X thread + survey paper

可信 Audio LLM Survey 深度解读

深度解读 HuggingPapers 推荐的 arXiv 2605.20266:Audio LLM 的可信问题为什么不是语音版文本安全,而是连续声学信号引入 hallucination、robustness、safety、privacy、fairness、authentication 六维风险。

Audio LLM Trustworthy AI Multimodal Safety Voice Privacy Evaluation
2026-05-25 · Tech Analysis · single HTML note · X thread + Cursor reports

Grok V9、Cursor 数据与 Mid-training 深度解读

深度梳理 Elie Bakouch 关于 Grok V9 的 X 帖:为什么 1.5T 模型、Cursor 数据、supplemental/mid-training 和 2-3 周 RL 发布窗口共同指向 coding agent 能力重心前移。

Grok Cursor Mid-training Coding Agent RL
2026-05-25 · Tech Analysis · single HTML note · X thread + paper

ZEDA:后训练 MoE 如何跳过一半专家计算

深度解读 Rohan Paul 关于 ZEDA 的 X 帖与论文《Post-Trained MoE Can Skip Half Experts via Self-Distillation》:解释 zero expert、自蒸馏、组级路由约束如何把已后训练 MoE 转成动态 MoE,并分析 50% expert FLOPs 削减、约 20% 推理加速和部署边界。

MoE Inference Efficiency Self-Distillation Dynamic Routing ZEDA
2026-05-25 · Tech Analysis · single HTML note · ICML 2026 poster

NITP:Next Implicit Token Prediction 技术解读

aHpaBean 关于 NITP 的 X 预告、ICML 2026 poster 与 GitHub README 深度解读:解释为什么 NTP 的 one-hot CE 可能欠约束 hidden geometry,NITP 如何用下一 token 的浅层表示作为辅助目标,以及它和 JEPA、distillation、Cut Cross-Entropy 的边界。

NITP Pre-training Representation Learning LLM X Thread
2026-05-25 · Tech Analysis · single HTML note · X Article + paper

Test-Time Scaling 与 Training-Free RL 深度解读

深度解读 Xiuyu Li 的 X Article:Test-Time Scaling 如何通过 reward-aware sampling 连接 KL 正则 RLHF、Power Sampling、ETS 与 Self-Evolving 路线。

Test-Time Scaling Training-Free RL ETS RLHF Inference
2026-05-25 · Tech Analysis · single HTML note · X thread + arXiv paper

VPO:为什么多样性训练会改善测试时搜索

深度解读 Ryan Boldi 关于 Vector Policy Optimization 的 X 线程与 arXiv 2605.22817:解释 VPO 如何用向量奖励、多答案链和集合级目标保留可搜索解空间,并分析它在 LiveCodeBench、OpenEvolve 和多目标奖励场景中的适用边界。

VPO Test-Time Search RL Diversity Vector Reward
2026-05-25 · Tech Analysis · single HTML note · X thread + official article

Applied Compute RMSD:把 OOD 企业行为拉回模型分布内

深度解读 Applied Compute 的 RMSD 线程与长文:解释 Relevance-Masked Self-Distillation 如何把自然语言 hint 转成 token-level 蒸馏信号,并通过 relevance mask 减少自蒸馏中的无关风格梯度噪声。

RMSD Self-Distillation Post-training Credit Assignment Enterprise LLM
2026-05-21 · Study Resource · single HTML note · source imported

手撕经典算法 #1 Attention 篇整理

把 Manual-Coding-1 的 Attention 手写内容整理成站内学习笔记,覆盖 SDPA、MHA、KV Cache、MQA、GQA 的张量形状、mask 边界、缓存语义和实现风险。

Attention Manual Coding Transformer PyTorch Inference
2026-05-20 · Tech Analysis · single HTML note

大模型测试的下半场:Agent 时代评测该测什么

Agent 时代大模型评测应该关注什么维度的深度分析。

Evaluation Agent LLM
2026-05-20 · Tech Analysis · single HTML note

rosinality X 帖与 Proxy Metrics 论文深读

rosinality X 帖与 Proxy Metrics 相关论文的深度阅读。

Metrics Evaluation X Thread
2026-05-20 · Tech Analysis · single HTML note

Delegation Intelligence:Agent 时代该如何重新理解评测

Agent 时代 Delegation Intelligence 评测范式的重新理解。

Agent Evaluation Delegation
2026-05-20 · Tech Analysis · single HTML note

GRPO 之后:Dense Credit Assignment 的下一步

GRPO 之后 Dense Credit Assignment 的下一步方向分析。

RL GRPO Credit Assignment
2026-05-20 · Tech Analysis · single HTML note

ECHO: Terminal Agents Learn World Models for Free

ECHO 终端 Agent 世界模型学习机制的 X Article 梳理。

Agent World Models Terminal
2026-05-20 · Tech Analysis · single HTML note

NanoGPT-Bench X 线程解读:Coding Agent 能做研究吗?

NanoGPT-Bench X 线程深度解读,探讨 Coding Agent 的研究能力边界。

Agent Coding Benchmark
2026-05-20 · Tech Analysis · single HTML note

Mid-training/RL 数据重叠会伤害 RL 吗?

Mid-training 和 RL 阶段数据重叠对 RL 效果的影响分析。

RL Data Overlap Training
2026-05-19 · Tech Analysis · single HTML note

推特大模型动态日报 | 2026-05-19

Twitter/X 上大模型相关动态的每日精选汇总。

Twitter LLM Daily Digest
2026-05-19 · Study Resource · 20 chapters · 130+ worked examples

数学基础速修手册

一本零基础友好的数学复习手册,围绕微积分、线性代数、概率统计组织 20 个章节,用概念起点、公式读法、完整例题、反例边界、算法流程和 LLM/Quant 应用链路帮助重新建立知识结构。

Mathematics Review Calculus Linear Algebra Probability Quant
2026-05-18 · Tech Analysis · single HTML note

Lilian Weng: System Accidents 解读

Lilian Weng 系统事故分析经典博客解读。

System Design Safety Blog
2026-05-18 · Tech Analysis · single HTML note

Memento / KV Cache X 帖深度解读

Memento KV Cache 优化技术的 X 帖深度讨论。

KV Cache Efficiency LLM Inference
2026-05-18 · Tech Analysis · single HTML note

MEMENTO 深度解读:教 LLM 管理自己的上下文

LLM 上下文管理机制的深度分析。

Context Management LLM Memory
2026-05-15 · Paper Note · single HTML note

SEIF 论文与 X 帖深度分析

SEIF 指令遵循相关研究的深度分析。

Instruction Following Alignment LLM
2026-05-15 · Paper Note · single HTML note

Prime Intellect autonomous nanoGPT speedrun 解读

Prime Intellect autonomous nanoGPT speedrun 深度解读。

nanoGPT Autonomous Training
2026-05-15 · Paper Note · single HTML note

168X / Herman Jin 半导体访谈深读

168X Herman Jin 半导体行业访谈的深度阅读分析。

Semiconductor Industry Interview
2026-05-15 · Paper Note · single HTML note

RESD X 线程与论文解读

RESD X 线程与论文的深度阅读分析。

RESD X Thread Paper
2026-05-15 · Paper Note · single HTML note

AVB OPD / OPSD 资源帖深度解读

AVB OPD / OPSD 资源帖的深度阅读分析。

Resources OPD Analysis
2026-05-15 · Paper Note · single HTML note

Fast-Slow Training X Thread Analysis

Fast-Slow Training X 线程的深度分析。

Training Efficiency X Thread
2026-05-15 · Paper Note · single HTML note

G-Zero X 线程与论文深读

G-Zero Self-Play 开放生成 X 线程与论文深度阅读。

Self-Play Generation X Thread
2026-05-15 · Paper Note · single HTML note

TencentDB Agent Memory 推文与开源项目分析

TencentDB Agent Memory 推文与开源项目的深度分析。

Agent Memory Tencent
2026-05-15 · Paper Note · single HTML note

RELEX / Minimal RLVR Training 深度解读

RELEX Minimal RLVR Training 的深度解读。

RLVR Training X Thread
2026-05-15 · Paper Note · single HTML note

Reward Hacking in Rubric-Based RL:X 线程与论文深读

Rubric-Based RL 中 Reward Hacking 问题的 X 线程与论文深读。

RL Reward Hacking Rubric
2026-05-15 · Paper Note · single HTML note

Dr. Post-Training 推文与论文深读

Dr. Post-Training 推文与相关论文的深度阅读。

Post-training RL LLM
2026-05-15 · Paper Note · single HTML note

Harbor 与 RL Coding Environments 长文梳理

Harbor RL Coding Environments 的长文梳理。

RL Coding Environment
2026-05-15 · Paper Note · single HTML note

KLieret X 线程解读:GPT 5.5 首次解出 ProgramBench 实例

GPT 5.5 首次解出 ProgramBench 实例的 X 线程解读。

GPT Benchmark ProgramBench
2026-05-15 · Paper Note · single HTML note

Agents Need Feedback Loops 阅读分析

Agents Need Feedback Loops 相关内容的阅读分析。

Agent Feedback Loops Prompts
2026-05-15 · Paper Note · single HTML note

ACuRL X 线程与论文解读:Computer-use Agent 的自主持续学习

ACuRL Computer-use Agent 自主持续学习的 X 线程与论文解读。

Agent Computer Use Continual Learning
2026-05-15 · Paper Note · single HTML note

SWE-ZERO-12M Trajectories X 帖深度解读

SWE-ZERO-12M Trajectories X 帖深度解读。

SWE Trajectories X Thread
2026-05-15 · Paper Note · single HTML note

LongMemEval-V2 深度解读:Agent Memory 如何走向有经验的同事

LongMemEval-V2 Agent Memory 评估框架深度解读。

Agent Memory Evaluation
2026-05-15 · Paper Note · single HTML note

Lighthouse Attention X 帖与论文深读

Lighthouse Attention X 帖与论文的深度阅读。

Attention Architecture X Thread
2026-05-15 · Paper Note · single HTML note

MMProLong / LongPT 深度解读

MMProLong / LongPT 长上下文 LVLM 的深度解读。

Long Context LVLM Multimodal
2026-05-15 · Paper Note · single HTML note

GMI Cloud 足球踢球动画 Thread 梳理

GMI Cloud 足球踢球动画空间推理 Thread 梳理。

Spatial Reasoning Animation X Thread
2026-05-13 · Study Resource · 90 chapters

大模型面试题库

按章节拆分的大模型面试题库,包含 90 个独立章节、筛选搜索、本地 SVG 导图和训练/推理/系统专项内容。

LLM Interview Systems Reasoning
2026-05-13 · Paper Note · single HTML note

Unmasking On-Policy Distillation

中文论文深读笔记,聚焦 on-policy distillation 为什么更像 token-level credit assignment,而不是全序列模仿。

Distillation RL Post-training
2026-05-13 · Tech Analysis · single HTML note

Artificial Analysis 语音 Agent 评测解读

Artificial Analysis τ-Voice 与 S2S 客服任务评测解读。

Voice Agent Evaluation S2S
2026-05-13 · Paper Note · single HTML note

Rebellious Student / RLRT 论文深读报告

RL 蒸馏与叛逆学生机制的论文精读。

Distillation RL Student Model
2026-05-13 · Paper Note · single HTML note

LCO-Embedding 论文深读报告

LCO-Embedding 方法的深入分析与解读。

Embedding Representation Learning
2026-05-13 · Tech Analysis · single HTML note

长周期 Agent、None-Person Company 与自我进化

Jie Tang X 帖深度解读,探讨长周期 Agent 与自我进化。

Agent Long-horizon Self-evolution
2026-05-12 · Paper Note · single HTML note

Synthetic Pre-Pre-Training Improves LM Robustness

合成数据预训练提升语言模型鲁棒性的深度解读。

Pre-training Synthetic Data Robustness
2026-05-12 · Paper Note · single HTML note

Visual Generation Unlocks Human-Like Reasoning

多模态世界模型与视觉生成推理的深度解读。

World Models Visual Generation Multimodal Reasoning
2026-05-12 · Paper Note · single HTML note

TRACE: Capability-Targeted Agentic Training

面向能力的 Agent 训练框架深度论文报告。

Agent Training Capability Targeting
2026-05-12 · Paper Note · single HTML note

OnlineRubrics 论文深读与 Insight

OnlineRubrics 在线评分标准的深度解读。

Evaluation Rubrics LLM
2026-05-12 · Tech Analysis · single HTML note

Nitrobrew 推文与技术解读

Nitrobrew Twitter/X 技术线程的深度分析。

Twitter Industry Analysis
2026-05-12 · Paper Note · single HTML note

Iterative Finetuning is Mostly Idempotent

迭代微调是否幂等的机制洞察。

Fine-tuning Training Dynamics LLM