值得一讀的想法
關於人工智能與產品實踐的短文。


AI 轉型最後要服務客戶
為 AI 而追求 AI 影響,旅程太弱。無論 B2B 或 B2C,營運者都該把每道流程與文化變革,錨定在更好、更快的客戶體驗上。
閱讀全文
為什麼董事會想要 AI,現場節奏卻對不上
許多高管與董事自認尚不足以治理 AI。斷層來自董事會組成、從提問到預算與人才的時差——有時則是營運端已自行往前衝。
閱讀全文
AI 優先組織的三根支柱
Box 自身的「Box on Box」轉型指出:別只盯個人效率——用 AI 重設企業流程、給 agent 乾淨且受權限治理的數據,並帶齊每一個人,而不是丟給夜晚與週末自學。
閱讀全文
企業自稱 AI「先進」時,到底在量什麼?
Box AI 報告中,自評為先進的企業從 8% 跳到 64%。這反映問題已從「該不該做」變成「怎麼做」——真正進階的公司量的是影響,而不只是把工具發出去。
閱讀全文
大模型現在到底在比什麼?
根據月之暗面在英偉達 GTC 的演講,以及 Kimi K2.5 技術報告,用通俗說法說明:大模型競爭已不只是堆規模。
閱讀全文
從「會聊天」到「真能辦事」
用日常語言說明:Kimi K2.5 技術報告與 GTC 演講,如何指向多模態能力與智能體協作,讓 AI 更接近「真能辦事」。
閱讀全文
先做一輛 AI「領跑車」流程
未來 90 到 180 天,選一個讓人興奮的流程與願意做成的團隊——別用銀河級戰略一次重寫所有事。早期勝利定調;煮乾大海只會卡住。
閱讀全文
企業 AI 為何正轉向開源模型
依據 Glean 創辦人 Arvind Jain 在 20VC 的訪談,用通俗說法說明:推動企業轉向開源的,是成本與「夠用」的能力,不是當年那種數據恐慌。
閱讀全文
別用 AI「取代自己」
依據 Glean 創辦人 Arvind Jain 在 20VC 的訪談:「用 AI 取代自己」是錯目標。工具人人一樣時,勝者會抬高門檻;強公司更可能變大,而不是空洞裁員。
閱讀全文
大模型的「事實」主要存在哪裡?
注意力讓 token 互相談話;前饋網絡做許多深加工——並保存相當一部分事實知識;殘差與歸一化則讓極深網絡訓得動。
閱讀全文
同一個骨架,GPT、Claude、LLaMA 差在哪?
下一詞預測、解碼參數、後訓練,以及逐漸收斂的現代 Transformer 技術棧——熟悉的模型名字,真正差在哪。
閱讀全文
大模型為什麼連 strawberry 裡有幾個 R 都會數錯?
模型並不像人一樣逐字母閱讀。它看到的是 token 編號——這個設計取捨,解釋了經典的「數字母」失誤。
閱讀全文
注意力機制到底在算什麼?
用通俗說法說明 Query、Key、Value、因果掩碼、多頭注意力、歸納頭,以及長提示詞為何昂貴。
閱讀全文
大模型到底能記住多少?
ICML 2026 一項研究為 GPT 式模型標出容量量級:BF16 下約每參數 3.6 比特——並說明為何不能當成硬碟容量。
閱讀全文
模型參數不是硬碟
依據 ICML 2026 記憶容量研究:權重同時混著樣本細節、通用規律與訓練痕跡;過了相變點,死記會讓位給泛化。
閱讀全文
機器人流量已經超過人類:這意味著什麼?
依據 Cloudflare CEO Matthew Prince 的公開對談:2026 年上半年,自動化流量已超過人類流量;並說明這個時間點為何一再提前。
閱讀全文
為什麼 AI 幫你選相機,會讓網站被訪問五千次?
依據 Cloudflare CEO Matthew Prince:真正把流量曲線拉陡的,不是傳統爬蟲,而是為了給完整答案而大規模遍歷網站的 AI 智能體。
閱讀全文
機器人不會點廣告:互聯網商業模式為何必須重寫?
Matthew Prince 的直白約束:若機器主導流量,近三十年靠廣告養活免費內容的邏輯就會從底層鬆動;按次抓取付費,是他提出的破局方向之一。
閱讀全文
Agent 來了,軟體介面會消失嗎?
依據 a16z「無頭軟體」對談,用通俗說法說明:當 Agent 也成為使用者,介面不再是進入產品的唯一入口。
閱讀全文
為什麼像 SAP 這樣的系統還死不了
依據 a16z 關於無頭軟體的對談:企業軟體的粘性藏在客製化業務邏輯,不在漂亮畫面;Agent 也不會一夜之間把它抹平。
閱讀全文
Agent 越能干,你越容易放鬆警惕
依據 DeepMind 播客中 Nenad Tomasev 的說法:任務越複雜,智能體失敗率越高;「信任要贏來」並不代表可以省略核對。
閱讀全文
網頁也能「騙」你的智能體
依據 DeepMind 播客中 Nenad Tomasev 的說法:開放互聯網就是智能體的環境——隱藏指令、動態偽裝,以及為何需要縱深防禦。
閱讀全文
當一百萬個 Agent 想法都差不多
依據 DeepMind 播客中 Nenad Tomasev 的說法:同源模型造成認知單一文化——決策相關、故障相關,以及新的串通風險。
閱讀全文
中端模型為何突然能「做智能體」?
根據 Anthropic 發布 Claude Sonnet 5 的公開說明,用通俗說法解釋:旗艦級智能體能力,正在下沉到中端價位。
閱讀全文
「努力程度」比模型名字更重要
Anthropic 在 Sonnet 5 公告中公布的成本—性能曲線說明:與其只在旗艦與中端之間選邊,不如學會按任務調努力程度。
閱讀全文
為什麼更強的模型,往往也更「守規矩」?
Anthropic 關於 Sonnet 5 的安全說明提示一個有用的分拆:中端模型在日常智能體場景可以更安全,但高風險網安技能與旗艦仍有巨大差距。
閱讀全文
「智能成本趨近於零」為什麼說不通?
依據李飛飛與 David Rogier 在《矽谷女孩》的對談:當下熱議的多半是語言智能;把「智能成本趨近於零」說成定論,並不負責任。
閱讀全文
十年後,更值錢的兩類工作者
依據李飛飛與 David Rogier:未來職場或呈「杠鈴」結構——頂尖專家與高主動性通才;中等水平的手藝最容易被 AI 抹平。
閱讀全文
AI 會改寫輔導成本,不該改寫教育目標
依據李飛飛與 David Rogier:AI 讓一對一輔導成本驟降;學校真正該守住的,仍是培養人,而不是陷入禁 AI、防作弊的二元對立。
閱讀全文
AI 正變成公用事業,但用戶買的不是「智能」
依據薩姆·奧特曼在史丹佛的圓桌對話:早期電力賣的是夜間照明,不是「電」本身。AI 終將像水電一樣成為基礎設施——前提是找到普通人一聽就懂的價值承諾。
閱讀全文
企業 AI 落地的瓶頸,早就不是技術了
波士頓諮詢集團《AI at Work》近 1.2 萬人調研指出:真正卡住企業的,不再是大模型與工具,而是戰略、組織與人。
閱讀全文
戰略比工具更重要:為什麼方向差了二十個百分點
BCG《AI at Work》數據:有清晰戰略、工具有限,也比工具齊全卻沒方向更能拿到可衡量成果;蜜月期的新鮮感撐不久。
閱讀全文
AI 的「喜悅悖論」:更滿意,也更累
BCG《AI at Work》發現:工作滿意度上升與認知負荷上升同時發生;創造最多商業價值的企業,往往也是員工體驗最好的地方。
閱讀全文
AI 省下的時間,為什麼沒有變成企業價值
BCG 發現許多一線 AI 用戶每週能省出接近一個工作日,但多數人幾乎沒拿到指引——效率提升很容易在組織裏白白流失。
閱讀全文
人人都聽過 AI Agent,但治理還沒準備好
BCG《AI at Work》:Agent 認知與工作流整合上升很快,但人機協作規則與責任歸屬仍明顯落後。
閱讀全文
AI 的價值在「集體」,不在「私人秘書」
依據 Michael I. Jordan 在 Machine Learning Street Talk 的訪談:當下 AI 聚合數十億人的輸入,本應服務數十億人的需求。追逐全程陪侍的私人秘書,反而錯過更大的經濟問題。
閱讀全文
會寫流暢文字,不代表離通用智能只差一步
依據 Michael I. Jordan 在 Machine Learning Street Talk 的訪談:「第一步謬誤」把今日出色的演示,誤當成通用智能近在眼前。流暢的輸入輸出映射,還不是系統級思考。
閱讀全文
AI 真的「理解」世界嗎?還是只會模仿?
用日常語言談 AGI 時間表背後的硬問題:若今天的系統只是在複製資料裏的模式,單靠把模型做大,未必會帶來真正的理解。
閱讀全文
強化學習最接近真正智能,差的是什麼?
在各類 AI 範式中,強化學習最接近「透過互動學習」;但 Sutton 與 Rafiee 指出,仍有三個關鍵落差,使它尚未等同生成認知。
閱讀全文
AI 暗產出:為什麼 AI 改變了一切,卻在 GDP 裏看不見?
科技頭條都在說 AI 正在改變世界,官方生產力卻幾乎不動。就像索洛的電腦悖論——AI 創造的真實價值,可能永遠進不了傳統 GDP。
閱讀全文
新增型暗產出:那些以前根本不會做、現在天天在做的工作
文獻綜述從約兩千美元降到約兩美元時,我們不會只做同樣數量的工作——我們會做多得多。這些價值除了 token 帳單,幾乎不留痕跡。
閱讀全文
AI 不是突然變聰明,而是終於夠可靠
依據 OpenAI 後訓練負責人揚·杜布瓦公開分享的科普解讀:外界感受到的「一夜變強」,更像是可靠性跨過可用門檻,而不是智力曲線突然斷裂。
閱讀全文
為什麼這一代更強調「快一倍」,而不是刷分
依據揚·杜布瓦對 GPT 世代進度的公開說法:最值得自豪的產品成果,可能是整條延遲—性能曲線左移,而不是某一項炫技分數。
閱讀全文
AI 技術債為什麼會複合增長
依據 Anthropic《創辦人手冊》:一般技術債慢慢累積;沒有共享設計模型時,AI 生成的債務會漂移——常常要等真實用戶湧入才爆。
閱讀全文
Agent 的錢,其實花在「讀上下文」而不是「寫答案」
2026 年多機構研究顯示:Agentic Coding 的成本由輸入 Token 主導——平均每寫出 1 個輸出 Token,就要處理約 154 個輸入 Token。
閱讀全文
同一題跑兩次,帳單可以差三十倍
在 SWE-bench Verified 的 Agent 實驗中,Token 消耗不僅任務之間差距巨大,連同一任務重複運行也可能差數倍到數十倍。
閱讀全文
模型省不省錢,看行為習慣,不看題目難不難
在同一套 OpenHands 與 SWE-bench Verified 設定下,前沿模型之間的 Token 效率差距極大;即便篩成「全對」或「全錯」子集,消耗排名仍幾乎不變。
閱讀全文
人類覺得難不難,預測不了 Agent 要花多少錢
人類依解題時間標的難度,與 Agent 實際 Token 消耗幾乎弱相關;前沿模型對自身消耗的自預測也系統性低估,尤其是輸入 Token。
閱讀全文
大模型心裏在想什麼,終於能「讀成字」了
Anthropic 的自然語言自編碼器(NLA)把高維激活直接譯成可讀文字,無需標註,讓可解釋性更像「閱讀」而非解碼特徵清單。
閱讀全文
模型嘴上不說、心裏知道:評估意識能被查出來嗎?
未言說的評估意識是安全審計的核心痛點。Anthropic 的 NLA 能從激活中捕捉它,而不只依賴模型在文字裏承認什麼。
閱讀全文
押韻還沒寫完,第二行已經想好了
Anthropic NLA 的詩歌案例:模型會提前規劃押韻;改寫解釋還能因果性地改變接下來的輸出。
閱讀全文