跳转至

2026

Modern Matchmaking System

导言

当代成年人并不只是缺少认识异性的渠道,更缺少一种低冒犯、低浪费、可逐步建立信任的了解方式。工作压力压缩了交往时间,陌生人之间又缺乏共同经历;吃饭、看电影和交换兴趣爱好可以判断相处是否舒服,却很难及早暴露城市选择、生育、金钱、父母照护、职业规划和冲突处理等长期问题。

本文不试图发明一套“灵魂伴侣算法”,而是从古代婚姻流程中提取分阶段确认、双向披露、可信中介和体面退出等机制,再用现代关系研究、平等原则与隐私保护重新设计。目标不是替人决定应该爱谁,而是让两个人更早看见:能否共同经营一个长期生活系统。

WaferLLM Co-Design

导言

WaferLLM 是一篇很适合学习软硬协同设计的系统论文。它没有把晶圆级芯片当作“更大的 GPU”,也没有从某个孤立 Kernel 开始优化;论文先用 PLMR 模型提炼硬件的不可回避约束,再依次重做 LLM 的并行策略、数据布局、KV Cache、GEMM/GEMV 和推理运行时。

本文是系列第一篇,只回答两个问题:WaferLLM 的总体设计链是什么,以及这条链上有哪些值得单独深挖的方向。MeshGEMM 的对齐、循环移位、Interleave、缓冲区生命周期与完整伪代码会放在后续专文中。

AI Engineering Roadmap

导言

这份六页 PDF 与其说是“学习路线图”,不如说是一套 AI 应用工程判断法:先找到结构化、问答、摘要等能交付价值的任务;承认模型输出有波动;把真实用户反馈变成评测集;最后只在评测证明简单方案不够时,逐步增加检索、工具、工作流、Agent 或微调等复杂度。

本文逐页解释图中的观点,同时区分三件事:页面明确表达了什么、它对工程实践意味着什么、哪些口号不能按字面当成技术事实。原 PDF 没有附数据集、实验方法或参考文献,因此曲线和阶梯只能当作概念图,而不能当成性能证据。

AI Coding Harness

导言

AI Coding IDE 的核心并不只是一段 system prompt。模型负责判断,Harness 负责把判断变成连续、受控、可恢复的工程过程。本文固定 Codex 与 OpenCode 源码版本,并以 Claude Code 官方行为契约为界,回答三个问题:Goal 是否只是定时任务,推理强度是否只是换 prompt,以及三种工具如何控制子 Agent 的上下文、模型与推理强度。

Codex Model Speed Benchmark

导言

Codex 的 Fast 模式究竟快多少?Sol 与 Luna 谁输出更快?我在同一台 Mac、同一账号和同一时间窗口内,串行运行了 36 次真实请求:24 次约 10K 用户输入差分,12 次至少 10K 文本 token 的流式输出。结果很明确:Fast 将持续输出吞吐提高到约 1.50–1.53 倍,Sol 的流式速度只比 Luna 高 3.4%–5.6%;但输入处理速度被连接重试与缓存噪声淹没,本轮无法识别。

Rental Checklist

导言

租房不是在几十分钟里挑一间看起来不错的房,而是在判断:自己能否在这里连续生活几百天。先用安全、权属、噪声、通勤和预算淘汰不合格房源,再比较面积、采光、通风、晾晒和装修;如果是合租,还要把室友、公共资源、服务费和退出机制当成房屋的一部分。

Echo Training Simulator

导言

Echo 是一个面向大规模分布式训练的混合性能模拟器:它先在少量真实 NVIDIA GPU 上逐 Rank 执行和计时,再用 NCCL 白盒公式、离散事件时间线以及 XGBoost 重叠减速模型,预测目标集群的单步时间。它模拟的是执行时序,不是张量数值、loss 或收敛过程。

截至本文固定的公开版本,Echo 已公开 workload tracer 与 slowdown predictor,但论文中的集成通信估算器和 timeline composer 尚未在仓库中找到;代码明显绑定 CUDA、NCCL 和 Nsight,没有开箱即用的 Ascend 支持。论文在 NVIDIA 测试域内给出 91.4% 平均预测准确率,以及 GPT-175B、96 张 H800 上约 8% 的单步时间误差,但这些数字不能直接外推到 Ascend。

SimAI Architecture

导言

SimAI 不是把上千张 GPU 在软件里逐晶体管复刻一遍,也不是实际训练一个没有数据的模型。它把训练框架、算子耗时、集合通信和网络拆成不同精度的模型,再用事件依赖重建一次迭代的时间线。本文基于 NSDI 2025 论文与固定版本源码,回答五个问题:它是什么、架构如何组织、是不是仿真、精度证据有多强,以及公开版是否支持 Ascend。

GLM Post-Training Open-Source Map

导言

GLM-5/5.2 已公开模型权重、技术报告、slime 大模型 RL 框架和部分昇腾训练/推理能力,但这些材料处在不同层次。论文公开、仓库中有同名函数、存在可运行 recipe、能够复现 GLM-5.2、已经打通 NPU 端到端,是五件不同的事。

本文不重复上一篇《GLM Post-Training Beyond SFT》的公式推导,而是把 Reasoning/Agentic/General RL、IcePop、TITO、DIS、DSA Indexer、Cross-Stage OPD、MOPD、SAO 与 CompactionRL 逐项落到公开仓库,回答三个工程问题:slime 里有什么、昇腾 NPU 到了哪一层、智谱/THUDM 还有哪些相关开源仓。

GLM Post-Training Beyond SFT

导言

部门要突破 GLM 模型的 NPU 原生训练,真正困难的不是把一个 GRPO loss 搬到 NPU,而是让 Actor 训练、推理 Rollout、Teacher Prefill、Verifier、权重同步和低精度数值形成闭环。

本文以 GLM-5 技术报告为主线,并补充 GLM-5.2 已公开的 SAO、CompactionRL 和十多个专家的并行 OPD。重点解释非 SFT 后训练中的 RL、OPD/MOPD,同时单独澄清 QAT 与量化:GLM-5 明确把 INT4 QAT 放在 SFT 阶段,它对 NPU 后训练很重要,但不是非 SFT RL 的一个阶段。