值得一读的想法
关于人工智能与产品实践的短文。


AI 转型最后要服务客户
为 AI 而追求 AI 影响,旅程太弱。无论 B2B 或 B2C,营运者都该把每道流程与文化变革,锚定在更好、更快的客户体验上。
阅读全文
为什么董事会想要 AI,现场节奏却对不上
许多高管与董事自认尚不足以治理 AI。断层来自董事会组成、从提问到预算与人才的时差——有时则是营运端已自行往前冲。
阅读全文
AI 优先组织的三根支柱
Box 自身的「Box on Box」转型指出:别只盯个人效率——用 AI 重设企业流程、给 agent 干净且受权限治理的数据,并带齐每一个人,而不是丢给夜晚与周末自学。
阅读全文
企业自称 AI「先进」时,到底在量什么?
Box AI 报告中,自评为先进的企业从 8% 跳到 64%。这反映问题已从「该不该做」变成「怎么做」——真正进阶的公司量的是影响,而不只是把工具发出去。
阅读全文
大模型现在到底在比什么?
根据月之暗面在英伟达 GTC 的演讲,以及 Kimi K2.5 技术报告,用通俗说法说明:大模型竞争已不只是堆规模。
阅读全文
从「会聊天」到「真能办事」
用日常语言说明:Kimi K2.5 技术报告与 GTC 演讲,如何指向多模态能力与智能体协作,让 AI 更接近「真能办事」。
阅读全文
先做一辆 AI「领跑车」流程
未来 90 到 180 天,选一个让人兴奋的流程与愿意做成的团队——别用银河级战略一次重写所有事。早期胜利定调;煮干大海只会卡住。
阅读全文
企业 AI 为何正转向开源模型
依据 Glean 创办人 Arvind Jain 在 20VC 的访谈,用通俗说法说明:推动企业转向开源的,是成本与「够用」的能力,不是当年那种数据恐慌。
阅读全文
别用 AI「取代自己」
依据 Glean 创办人 Arvind Jain 在 20VC 的访谈:「用 AI 取代自己」是错目标。工具人人一样时,胜者会抬高门槛;强公司更可能变大,而不是空洞裁员。
阅读全文
大模型的「事实」主要存在哪里?
注意力让 token 互相谈话;前馈网络做许多深加工——并保存相当一部分事实知识;残差与归一化则让极深网络训得动。
阅读全文
同一个骨架,GPT、Claude、LLaMA 差在哪?
下一词预测、解码参数、后训练,以及逐渐收敛的现代 Transformer 技术栈——熟悉的模型名字,真正差在哪。
阅读全文
大模型为什么连 strawberry 里有几个 R 都会数错?
模型并不像人一样逐字母阅读。它看到的是 token 编号——这个设计取舍,解释了经典的「数字母」失误。
阅读全文
注意力机制到底在算什么?
用通俗说法说明 Query、Key、Value、因果掩码、多头注意力、归纳头,以及长提示词为何昂贵。
阅读全文
大模型到底能记住多少?
ICML 2026 一项研究为 GPT 式模型标出容量量级:BF16 下约每参数 3.6 比特——并说明为何不能当成硬盘容量。
阅读全文
模型参数不是硬盘
依据 ICML 2026 记忆容量研究:权重同时混着样本细节、通用规律与训练痕迹;过了相变点,死记会让位给泛化。
阅读全文
机器人流量已经超过人类:这意味着什么?
依据 Cloudflare CEO Matthew Prince 的公开对谈:2026 年上半年,自动化流量已超过人类流量;并说明这个时间点为何一再提前。
阅读全文
为什么 AI 帮你选相机,会让网站被访问五千次?
依据 Cloudflare CEO Matthew Prince:真正把流量曲线拉陡的,不是传统爬虫,而是为了给完整答案而大规模遍历网站的 AI 智能体。
阅读全文
机器人不会点广告:互联网商业模式为何必须重写?
Matthew Prince 的直白约束:若机器主导流量,近三十年靠广告养活免费内容的逻辑就会从底层松动;按次抓取付费,是他提出的破局方向之一。
阅读全文
Agent 来了,软件界面会消失吗?
依据 a16z「无头软件」对谈,用通俗说法说明:当 Agent 也成为使用者,界面不再是进入产品的唯一入口。
阅读全文
为什么像 SAP 这样的系统还死不了
依据 a16z 关于无头软件的对谈:企业软件的粘性藏在定制化业务逻辑,不在漂亮画面;Agent 也不会一夜之间把它抹平。
阅读全文
Agent 越能干,你越容易放松警惕
依据 DeepMind 播客中 Nenad Tomasev 的说法:任务越复杂,智能体失败率越高;「信任要赢来」并不代表可以省略核对。
阅读全文
网页也能「骗」你的智能体
依据 DeepMind 播客中 Nenad Tomasev 的说法:开放互联网就是智能体的环境——隐藏指令、动态伪装,以及为何需要纵深防御。
阅读全文
当一百万个 Agent 想法都差不多
依据 DeepMind 播客中 Nenad Tomasev 的说法:同源模型造成认知单一文化——决策相关、故障相关,以及新的串通风险。
阅读全文
中端模型为何突然能「做智能体」?
根据 Anthropic 发布 Claude Sonnet 5 的公开说明,用通俗说法解释:旗舰级智能体能力,正在下沉到中端价位。
阅读全文
「努力程度」比模型名字更重要
Anthropic 在 Sonnet 5 公告中公布的成本—性能曲线说明:与其只在旗舰与中端之间选边,不如学会按任务调努力程度。
阅读全文
为什么更强的模型,往往也更「守规矩」?
Anthropic 关于 Sonnet 5 的安全说明提示一个有用的分拆:中端模型在日常智能体场景可以更安全,但高风险网安技能与旗舰仍有巨大差距。
阅读全文
「智能成本趋近于零」为什么说不通?
依据李飞飞与 David Rogier 在《硅谷女孩》的对谈:当下热议的多半是语言智能;把「智能成本趋近于零」说成定论,并不负责任。
阅读全文
十年后,更值钱的两类工作者
依据李飞飞与 David Rogier:未来职场或呈「杠铃」结构——顶尖专家与高主动性通才;中等水平的手艺最容易被 AI 抹平。
阅读全文
AI 会改写辅导成本,不该改写教育目标
依据李飞飞与 David Rogier:AI 让一对一辅导成本骤降;学校真正该守住的,仍是培养人,而不是陷入禁 AI、防作弊的二元对立。
阅读全文
AI 正变成公用事业,但用户买的不是「智能」
依据萨姆·奥特曼在斯坦福的圆桌对话:早期电力卖的是夜间照明,不是「电」本身。AI 终将像水电一样成为基础设施——前提是找到普通人一听就懂的价值承诺。
阅读全文
企业 AI 落地的瓶颈,早就不是技术了
波士顿咨询集团《AI at Work》近 1.2 万人调研指出:真正卡住企业的,不再是大模型与工具,而是战略、组织与人。
阅读全文
战略比工具更重要:为什么方向差了二十个百分点
BCG《AI at Work》数据:有清晰战略、工具有限,也比工具齐全却没方向更能拿到可衡量成果;蜜月期的新鲜感撑不久。
阅读全文
AI 的「喜悦悖论」:更满意,也更累
BCG《AI at Work》发现:工作满意度上升与认知负荷上升同时发生;创造最多商业价值的企业,往往也是员工体验最好的地方。
阅读全文
AI 省下的时间,为什么没有变成企业价值
BCG 发现许多一线 AI 用户每周能省出接近一个工作日,但多数人几乎没拿到指引——效率提升很容易在组织里白白流失。
阅读全文
人人都听说过 AI Agent,但治理还没准备好
BCG《AI at Work》:Agent 认知与工作流整合上升很快,但人机协作规则与责任归属仍明显落后。
阅读全文
AI 的价值在「集体」,不在「私人秘书」
依据 Michael I. Jordan 在 Machine Learning Street Talk 的访谈:当下 AI 聚合数十亿人的输入,本应服务数十亿人的需求。追逐全程陪侍的私人秘书,反而错过更大的经济问题。
阅读全文
会写流畅文字,不代表离通用智能只差一步
依据 Michael I. Jordan 在 Machine Learning Street Talk 的访谈:「第一步谬误」把今日出色的演示,误当成通用智能近在眼前。流畅的输入输出映射,还不是系统级思考。
阅读全文
AI 真的「理解」世界吗?还是只会模仿?
用日常语言谈 AGI 时间表背后的硬问题:若今天的系统只是在复制数据里的模式,单靠把模型做大,未必会带来真正的理解。
阅读全文
强化学习最接近真正智能,差的是什么?
在各类 AI 范式中,强化学习最接近「透过互动学习」;但 Sutton 与 Rafiee 指出,仍有三个关键落差,使它尚未等同生成认知。
阅读全文
AI 暗产出:为什么 AI 改变了一切,却在 GDP 里看不见?
科技头条都在说 AI 正在改变世界,官方生产力却几乎不动。就像索洛的电脑悖论——AI 创造的真实价值,可能永远进不了传统 GDP。
阅读全文
新增型暗产出:那些以前根本不会做、现在天天在做的工作
文献综述从约两千美元降到约两美元时,我们不会只做同样数量的工作——我们会做多得多。这些价值除了 token 账单,几乎不留痕迹。
阅读全文
AI 不是突然变聪明,而是终于够可靠
依据 OpenAI 后训练负责人扬·杜布瓦公开分享的科普解读:外界感受到的「一夜变强」,更像是可靠性跨过可用门槛,而不是智力曲线突然断裂。
阅读全文
为什么这一代更强调「快一倍」,而不是刷分
依据扬·杜布瓦对 GPT 世代进度的公开说法:最值得自豪的产品成果,可能是整条延迟—性能曲线左移,而不是某一项炫技分数。
阅读全文
AI 技术债为什么会复合增长
依据 Anthropic《创始人手册》:一般技术债慢慢累积;没有共享设计模型时,AI 生成的债务会漂移——常常要等真实用户涌入才爆。
阅读全文
Agent 的钱,其实花在「读上下文」而不是「写答案」
2026 年多机构研究显示:Agentic Coding 的成本由输入 Token 主导——平均每写出 1 个输出 Token,就要处理约 154 个输入 Token。
阅读全文
同一题跑两次,账单可以差三十倍
在 SWE-bench Verified 的 Agent 实验中,Token 消耗不仅任务之间差距巨大,连同一任务重复运行也可能差数倍到数十倍。
阅读全文
模型省不省钱,看行为习惯,不看题目难不难
在同一套 OpenHands 与 SWE-bench Verified 设定下,前沿模型之间的 Token 效率差距极大;即便筛成「全对」或「全错」子集,消耗排名仍几乎不变。
阅读全文
人类觉得难不难,预测不了 Agent 要花多少钱
人类依解题时间标的难度,与 Agent 实际 Token 消耗几乎弱相关;前沿模型对自身消耗的自预测也系统性低估,尤其是输入 Token。
阅读全文
大模型心里在想什么,终于能「读成字」了
Anthropic 的自然语言自编码器(NLA)把高维激活直接译成可读文字,无需标注,让可解释性更像「阅读」而非解码特征清单。
阅读全文
模型嘴上不说、心里知道:评估意识能被查出来吗?
未言说的评估意识是安全审计的核心痛点。Anthropic 的 NLA 能从激活中捕捉它,而不只依赖模型在文字里承认什么。
阅读全文
押韵还没写完,第二行已经想好了
Anthropic NLA 的诗歌案例:模型会提前规划押韵;改写解释还能因果性地改变接下来的输出。
阅读全文