-
把「What the Fork is Rust?」重写成工程可读的一页
The Rust programming language keeps winning the middle-school popularity…
-
「The Pattern Language of Project Xanadu」笔记:界面、文化和技术叠在哪
When it comes to visionary, before-its-time software, it’s hard to find …
-
读懂「What the Fork is xState?」:把观察写成可落地的笔记
xState is a snazzy way to manage JavaScript application state using visu…
-
零对齐:当模型和人的目标对不齐
This talk is the first public demo of Ace – a new research prototype we’…
-
工程上真正卡住的是05. 激活函数
上一篇我们论证了一件事——纯线性的网络再深,也只是一个线性变换。把 $W2(W1mathbf{x} + mathbf{b}1) + mathbf…
-
智能体栈里的04. 函数与神经网络:延迟、成本和翻车点
如果你问我「神经网络到底是什么」,我会先把所有教材合上,然后给你一句朴素得近乎敷衍的话——神经网络就是一个函数。
-
工程上真正卡住的是03 矩阵乘法的两种视角
把矩阵乘法掰开成两种等价但风格不同的视角——『行 × 列』的点积视角和『列的线性组合』视角,最终落到 QK^T 的形状分析。
-
智能体栈里的02 向量与点积的几何直觉:延迟、成本和翻车点
从二维平面上的箭头开始,把『向量、内积、夹角、相似度』这几个概念用几何方式串起来,最后落到注意力公式里那个 QK^T 的来历。
-
大模型不是多起一个服务:基础设施要从五层来拆
这是【Transformer 与注意力机制】系列的第一篇,承担两件事:一是把这套五十多篇文章为谁写、解决什么问题、彼此之间是什么关系交代清楚;二…
-
便宜从哪来:MoE、KV 压缩和量化叠在一起的账
从 MoE 激活比、CSA/HCA 混合注意力、mHC、Muon,到磁盘级 KV cache、FP4 QAT 和专家蒸馏,系统拆解 DeepSe…