https://web.archive.org/web/20260730024047/https://kt.dczhe.com/
K3 写的。
prompt 就一句话:做个高端 SaaS 落地页,风格参考 Arc 浏览器。没需求文档,没设计稿,没说按钮用圆角。
它自己生成了整件事。
产品名叫 Lumen。自己起的。slogan 是「让工作 Flow 起来」。自己写的。暖色奶油底加日落渐变,九个区段——Hero、功能卡片、用户评价、定价——一个不落。连六个虚构用户的评价都写好了,有头像有姓名有身份有引文,每个人说的话都不一样。
一整套 SaaS 营销官网。打开就能看。
Arc 的设计语言是出了名的极简、大留白、字距精确到像素。K3 抓到那个味道了。不是抄。是把冷灰黑白翻译成了暖色奶油底。这个翻译本身就是一个设计决策。
但盯五分钟就不行了。
阴影的柔和度差一点。渐变曲率偏硬。配色方案是好的,但每个颜色值都踩在最安全的位置——橙是标准橙,粉是标准粉,少了设计师花一个下午调出来的那种微妙偏移。Instrument Serif 斜体在 72px 下跟无衬线中文的咬合关系,它不懂。
不是烂。它就是不知道什么叫「刚好」。
跟真正的 Arc 摆在一起,差了一口气。
这口气是什么,我测完三题才搞明白。
K3 发布那天全网刷跑分。Aider、SWE-bench、KernelBench。我存了二十几张图,全删了。
不是跑分没用。我是独立开发者,只有一个标准——这东西能不能帮我把活干了。写功能、上网站、查 bug。别的虚的。
三道题。对应我最头疼的三种场景。
第一题,逻辑。WXYZMN 六个事件七个约束,Z 没发生,推剩下五个。题小,条件互相咬,一条推错全崩。我用过的模型好几个推到第三步开始自己编规则。K3 从 Z 没发生出发,逆否推 Y,等价推 M,蕴含推 X。七步,每步标了用哪条规则。然后做了件事我没要求的:推完,把七条条件逐一代回去验证。不是「答案应该是」,是「验证通过,无矛盾」。这习惯我自己写代码经常省。我带过的实习生有一半没有。
第二题,数学。a+b+c=abc,a²+b²+c²=ab+bc+ca+3,a≤b≤c,证解唯一。大部分模型要么暴力穷举,要么推着推着偷换概念。K3 设 x=b-a,y=c-b。我看它写这个的时候愣了。这个换元我自己想不到。第二个条件一卷,高次项全消,x²+xy+y²=3。x 和 y 只能是 0 或 1。只有 (1,1) 满足。代回去,1,2,3。不是猜的,证的。严丝合缝到你看完只想说——行,你数学比我好。佩服,但不太爽。就那种你养了条狗发现它微积分比你强的感觉。
两题过了,逻辑硬数学硬。但让我掏钱的是第三题。做题家多了去了,GPT 也能 Fable 也能。我要的是你能不能做一个真正能上线的东西。所以第三题我屁都没给,就一句话:做个网站。
你们开头看到了。能打开,能看,上线不丢人。
有个做 kernel 工程的哥们拿了早期访问。测的不是「写个排序算法」,是生产级 CUDA 内核。单 GPU,agent 自主 session,不限时。
最狠的一道题:把 Kimi 自家的 KDA 注意力加 MLA 加 MoE 整个 decode 步骤融合成尽可能少的内核。K3 拿了 18.09 倍加速,Fable 5 历史最佳 18.72。差不到 4%。
数字很漂亮。但他发现了一个细节。
K3 的 1M 版本和 256K 版本写了完全一样的 NSA 注意力算法。结构一样。块选择一样。正确性一样。但所有矩阵乘法跑在了普通 CUDA 核心上。不是张量核心。慢了 7 倍。
它的 trace 显示它知道应该用张量核心。甚至在自己计划里写了「selection on tensor cores = ~10-20 us」。
然后。没做。session 自己结束了。
知道怎么做,和把它做完,是两种能力。
我的网站一模一样。K3 知道什么是好的 SaaS 落地页,能分析 Arc 的设计语言、能搭建九区段结构、能发明品牌故事和定价策略。但在最微妙的细节上——阴影软到哪个程度刚好、颜色往哪个方向偏一点、Instrument Serif 斜体在 72px 下的字间距该调多少——做不到。不是不知道。是没做到。
AI 擅长连接闪电。把跨领域的已知知识组合起来。K3 的 CUDA 内核、逻辑推理、数学证明、那个九区段落地页——都是闪电。
但 AI 不擅长建造山峰。创造一套全新框架,价值需要几十年才被验证。十九世纪有个法国数学家叫伽罗瓦,十九岁在监狱里写的群论笔记,死后两百年才被完全理解。这种级别的创造,AI 做不到。
品味就是山峰。颜色往哪个方向偏一点,阴影软到哪个程度刚好,字间距多大才舒服——这些东西没有标准答案,没办法在一两次 benchmark 里验证对错。需要时间,需要审美,需要在无数个「差不多」里分辨出「刚好」。
Fable 5 在品味上比 K3 强一截。
但 2026 年 6 月 9 号,Anthropic 发布 Fable 5,跑分排第一。6 月 12 号,美国商务部一纸公文,出口管制令。要求停掉所有外国公民对 Fable 5 的访问。不管人在美国境内还是境外,连 Anthropic 自己的外籍工程师都算在内。
Anthropic 没办法只把非美国公民单独掐掉。一刀切,两个模型全球下线。
几亿人在用的东西。从收到公文到下线,一两个小时。
更黑色幽默的是 Anthropic 自己的立场。它一直是「最担心 AI 失控」的那家公司,CEO 一直主张民主国家应该联手把最先进的 AI 攥在自己一边。就在被封前两天还在呼吁政府加强监管。政府照做了。第一个挨刀的就是它自己。
这件事让我重新想了 K3 的意义。
之前我看 K3 看的是能力。逻辑硬不硬,数学强不强,能不能做个网站。
Fable 5 被封之后,我看的是别的东西。K3 是一家中国公司的模型,不受美国商务部出口管制。不管你喜欢不喜欢,开关不在美国政府手里。
我给自己画了张模型调度图。Fable 5 塔尖,最贵用得最少,只啃 K3 三轮搞不定的硬骨头。K3 中间,日常主力。往下更便宜的跑量,能省就省。跟 CPU 多级缓存一模一样。
但这张图还得加一个维度。不是能力维度。是控制权维度。
Fable 5 能力最强品味最好。但核心生产力全押在一个能被一纸公文关掉的闭源模型上,等于把饭碗交给外国政府的心情来决定。在别人的服务器上,你的使用权随时可以被收回。这次当着全世界的面演示了一遍。还会有第二次,第三次。
所以 K3 到底行不行。
行了。但不是每个维度都行。
它是第一个让我认真觉得日常可以靠它的模型。不是因为最强——是价格、能力、稳定性、控制权,四者之间踩到了很舒服的位置。比它强的你舍不得买,比它便宜的差得不是一星半点。不用担心号没了,也不用担心一纸公文。
这最后一点,比任何 benchmark 都重。
K3 再强,没有积累的人也利用不了它。反过来,你有代码片段、项目经验、领域判断和审美,「闪电」型 AI 会把它们连起来,让你一个人像一个团队。模型会变,工具会换,prompt 的写法每个月都在变。只有你的数据是你的。K3 不是护城河,你在 K3 之前搭建的东西才是。
不管 K3 多强,它替代不了你对自己业务的判断、对用户处境的理解、对「什么叫刚好」的直觉。AI 工具解决的是生产,但注意力、信任和钱怎么分配,是人决定的。
K3 做了个漂亮的网站,起了个漂亮的名字,编了六个用户的真心话。但打开链接的人会不会点那个「免费下载」的按钮——它不知道。它也不需要知道。
这个问题是你的。
官方演示我看了。千年隼很炸,荒野大镖客复刻很唬人。但别拿 teaser 去期待第一次打开的画面。我做出来的大概就是你做出来的水平。能用,能看,上线不丢人。
够了。
