先放链接。
https://kt.dczhe.com/
这个网站是 K3 写的。
这个是我当时给它的prompt
做个高端SaaS落地页,风格参考Arc浏览器官网。
真的只有这一句。
产品叫什么没说,做什么的也没说,没有什么“Hero区这里放一个渐变按钮,下面三张卡片”。
它自己搞了个Lumen。
“让工作 Flow 起来”也是它写的。
然后页面就这么出来了。
你看这背景,橙粉渐变,Hero、功能、评价、定价,一共九块。它甚至自己编了六个用户,名字、头像、身份、评价都有。
六段评价还不是换几个词重复。
这个地方我第一次看的时候确实有点意外。
因为以前让GPT4o或者Claude 3.5 Sonnet做个SaaS官网,我已经有点怕了。
十次里八次是紫蓝渐变,大圆角,三个feature card,中间一个Get Started,下面再塞三个假用户。
K3这次至少没给我那个。
它看得出来Arc那套设计思路大概是什么感觉,但没完全去照搬。
你要仔细看一会,这个网站有个很奇怪的地方。
不是丑。
丑反而好改。
就是差那么一点。
阴影软得不太对,渐变有点硬,有几块地方颜色太奇怪了。
我后来盯那个橙色盯了半天。
你说它不好看吗?好看。
但它就是那种你在色板上随手挑一个“高级橙”,大概率会挑出来的颜色。
设计师有时候调出来的颜色反而挺怪的。
带一点灰,或者往旁边歪一点,单拿出来甚至没那么好看,放进去倒顺了。
这个东西很难跟模型说。
“橙色再怪一点。”
它估计也不知道我要干嘛。
还有Instrument Serif那个标题。
72px 斜体,英文自己看挺漂亮,一跟中文摆起来我就觉得哪里咬得不对。
可能是字距。
可能不是。
反正后来自己改网页,时间基本都花在这些屁事上。
功能没花多少时间。
K3 发布那天我也跟着看跑分。
截了一堆图。
Aider、SWE-bench、KernelBench,手机里二十多张。
后来翻相册的时候我突然觉得我留这个干嘛,然后全删了。
因为那些数字我第二天就忘。
谁72点几,谁74点几,我最后还是得拿它写东西。
所以后来我就自己出题。
第一题是个逻辑题。
WXYZMN六件事,七个条件,告诉它Z没发生,让它把剩下几个推出来。
这种题不难,但很容易把模型弄露馅。
有些模型前面两步还老老实实,推到第三步突然自己加了一条规则,然后后面越算越自信。
不过K3没有。
Z往后推,哪一步逆否,哪一步等价,写得都挺清楚。
但我最后记住的不是它算对了。
是它算完以后又自己把答案塞回七个条件里检查了一遍。
我没叫它检查。
看到这儿我还有点尴尬。
因为我自己写东西经常“能跑就先这样”。
它比我有测试意识。
第二题是数学。
a+b+c=abc
a²+b²+c²=ab+bc+ca+3
a≤b≤c
证解唯一。
我本来以为它会开始硬算。
它上来写了:
x=b-a
y=c-b
我当时就有点不爽。
因为这个我自己想不到。
后面推到 x²+xy+y²=3,最后是 1、2、3。
没乱搞。
没偷改题目。
就是做出来了。
看完以后我也没什么感想。
行吧。
数学比我好。
挺烦。
有点像养了条狗,结果有一天发现它会做你不会的题。
其实这两题都不太决定我要不要用它。
我平时又不靠证明数学题挣钱。
所以最后才是那个网站。
一句话,给我做一个。
它能不能自己把缺的东西补起来。
这个才是我比较关心的。
结果就在最上面。
我觉得可以。
不是“AI来了,所有人失业”。
就是可以。
能上线。
不会让我因为页面太丑不敢把链接发出去。
这个标准其实已经挺高了。
后来我看到有人拿K3去做 CUDA kernel。
这就比我折腾网页狠多了。
其中一道,好像是把Kimi自己的 KDA attention、MLA、MoE decode揉到一起。
K3最后跑了18.09倍。
Fable5最好是 18.72。
这两个数我现在还能记得,主要是后面有个更好玩的事。
它有一版NSA attention,算法其实是对的。
块选择也对。
但矩阵乘法没上Tensor Core。
直接慢七倍。
然后别人去翻它的trace。
发现它自己计划里明明写了:
selection on tensor cores≈10–20us
它知道。
然后没做。
到这session自己结束了。
我看到这段的时候一下就想到Lumen。
它知道好的SaaS网站长什么样。
也知道Arc为什么舒服。
甚至能自己判断别照抄,换成暖色。
可做到一个程度以后,它就收手了。
大概它觉得已经行了。
我还觉得不行。
差不多是这个区别。
有一阵我特别喜欢让模型“继续优化”。
继续。
继续。
再优化。
然后发现也不是这么回事。
比如我说阴影再自然一点,它会换一个。
再高级一点,它又换一个。
再柔和一点,再换一个。
最后你会发现自己其实是在抽卡。
因为“高级一点”根本不是需求。
我自己都没告诉它到底哪不对。
这种时候AI也挺冤的。
但人做东西很多时候就是这样。
一个按钮往左挪两像素。
不行,挪回来一像素。
然后盯十秒。
行了。
为什么行了?
不知道。
本来测完这些,我对K3的感觉也就这样了。
够用,而且挺好用。
6月9号Anthropic发Fable 5。
几天之后因为美国商务部的限制,外国公民访问出了问题,最后模型直接下线。
我那时候觉得最魔幻的地方是,前两天大家还在测。
真的就前两天。
排行榜、API、coding agent,全在聊。
然后没了。
我以前选模型基本不考虑这种事。
谁最强用谁。
贵一点就少用。
便宜一点就多跑。
最多看看速度和上下文。
后来才发现还有个特别无聊但特别现实的问题:
这个东西会不会突然不给你用了。
这句话以前谁都知道。
所有闭源服务都可能改规则。
但我们所谓的了解和真看见一次,感觉还是不一样。
所以我现在不会把所有东西都压一个模型上。
也没搞什么特别复杂的模型路由。
难的东西丢最强的。
平时K3和Claude。
再简单的任务就用deepseek或者GLM。
我以前还特别爱收藏prompt。
什么卡帕西prompt或者是让模型深度思考的 system prompt,存了一堆。
现在回头看好多都没用了。
以前要写半页才能让模型老实检查一次。
现在模型自己就检查了。
工具这玩意换得太快。
真留得下来的还是那些老东西。
代码。
项目。
自己踩过的坑。
还有一些莫名其妙的偏好。
比如我现在一眼就知道那个Lumen页面某些地方不对,但让我把错误写成一个 prompt,我不同意。
最开始那个 Lumen,其实挺能说明问题的。
产品名是假的。
用户是假的。
用户评价也是假的。
连产品到底是什么,都是K3自己补的。
可它真的能把这一整套东西做得像模像样。
两三年前我估计会觉得这已经很吓人了。
现在我第一反应反而是去看:
这个按钮我会点吗?
如果真有这么个产品,我为什么要下载?
这六个人夸得挺真,可我信吗?
K3能把一个不存在的产品包装得像真的。
但这个产品到底该不该存在,它管不了。
官方demo我也看了。
千年隼很炸。
荒野大镖客那个也确实挺唬人的。
不过第一次用,别照着teaser想。
我自己一句话做出来的东西,就是开头那个链接。
大概就这个水平。
有些地方会让你直呼卧槽。
再多看一会儿,又开始想改。
然后自己接着改。
我觉得够用了。
如果文章中有任何问题,或者你有更好的建议,也欢迎通过以下方式联系我:
- 🌐 博客:blog.dczhe.com
- 🐦 X (Twitter):@D_CZhe
- 💬 Telegram 私信:@dczhe_bot
- 📧 邮箱:me@dczhe.com
- 😘 捐赠我:点击此处