如何评价 7 月 16 日 Kimi 发布的 2.8 万亿级开源模型 K3?

by , at 05 August 2026, tags : 模型 Kimi 牛屎 点击纠错 点击删除
使用CN2/CN2GIA顶级线路,支持Shadowsocks/V2ray科学上网,支持支付宝付款,每月仅需 5 美元
## 加入品葱精选 Telegram Channel ##

知乎用户 waterwu​ 发表

价格很不国产。不太确定国人的接受程度, 国外 Kimi 用户对于这个价格也是鬼哭狼嚎:【便宜的开源模型不再存在了】。

输出价格 105,而之前是 27,4 倍差异。可以算是国产也有了奢侈品类的模型。

目前具体的技术文档还没有公布,只知道参数规模 2.8T,支持 1M 的长上下文;擅长游戏开发、前端工程、3D、CAD 工作流等等,按照 Benchmark 来看综合表现仅次于 Fable 5 MaxGPT 5.6 Sol Max

看大家实际测试下来的情况,3D 开发方面的确很惊艳,感觉像是审美在线的游戏开发者。

但现在大多数测评都还基于单 Prompt 一次性生成的效果来评估,我不认为能代表实际水平,真实情况还得深度使用一段时间才好说,所以先不做展开评价。

这个价格,拆分两种常见缓存命中场景,对比 GPT 5.6 Sol / Fable 5 大概都是 0.5x / 0.3x 的区别;对标自己 K2.7 的价格则是 3.63x, 比自家的 Kimi 2.7 Code HighSpeed 模式都要贵 20% 的价格。

怎么说呢,我感觉对标 Fable 5 能便宜这么多其实也还算能接受,算是给用户一个购买他们最高档套餐的理由了。

我也算是深度使用了他们的 HighSpeed,速度很爽、消耗速度也很感人,我大概能够适应 K3 的价格和消耗速度。

换算下来,他们官方 199 套餐一个月用满大概是 600M 左右的 Token 量,重度 AI 开发者的话,只是这个套餐肯定是不够用的 —— 但如果配合其他 Coding Plan 一起用的话,大概还能算是不错的选项。

传说 Minimax M3 Pro 会是 2.7T 的参数规模,这算是开启了国产模型新一轮的参数规模竞赛了。高度怀疑接下来国内算力能得到很大缓解,否则支撑不了这种参数规模的军备竞赛。

好,接下来就看 DeepSeek V4 正式版、Claude Opus 5、Gemini 3.5 Pro 他们的表现了。

知乎用户 这是一个 Paradox 发表

比较恐怖的是,kimi 只融了三四百亿人民币的规模,正在进行的最新轮融资也只有 315 亿美元估值。

而 O 和 A 公司都是万亿美元估值,几千亿美元级别的投资。

deepseek R1 的时候,还可以讲是算法创新,不影响 scaling 逻辑,算力接着奏乐接着舞。

现在开源国模也开始用低了两个数量级的成本进行 scaling 了,故事还讲的下去吗?

知乎用户 van dark​ 发表

非常超预期,前端领域已经可以平替 opus 4.8/sonnet 5 了。其他领域代码能力测试也非常优秀,目前还没有时间人工 review 代码,大概率在 opus 4.8 水平附近。

最惊艳的一道题目:仿造 Windows Vista 做一个交互式网页。

做一个交互式的网页,要求复现 Windows Vista 的经典桌面的样式,包括它的窗口样式,类似于玻璃的晶莹剔透的质感,颜色、配色和质感 务必接近原版的视觉风格。 然后增加一个功能,就是按 a 键之后,让实现类似于 windows7 那样 3d 窗口切换功能,按一下 a 键,让窗口轮流切换。 在原版的里面是所有窗口在 3d 空间里面排成一条线,有一定倾斜角度,然后有虚化效果。

这道题目的输出甚至好于 opus 4.8/sonnet 5/gpt 5.6 的结果,和 fable 5 同一段位。远强于 glm 5.2/deepseek v4 pro(max) 。输出结果链接在这里,可以点进去看:点击链接查看和 Kimi 的对话 Vista 桌面 3D

下图是最终输出版本。对于玻璃的模糊效果理解非常准确。

下图对于窗口切换效果的需求,理解是完全准确的。

下面这个题目 Kimi k2.5 其实就可以正确完成,Kimi k3 的视觉效果更好一些,细节处提升很大,这个任务的提示词大约有数十项的功能点,都准确做出来了。

生成一个《文明 6》的网页交互式小游戏。
你现在是一个资深的游戏软件工程师, 生成一个《文明 6》的网页交互式小游戏,要求输出是可以在浏览器中直接使用的 html 单个文件,可以使用 js。 另外你不需要拘泥于原版,你可以做修改使它更有吸引力。 要求不枯燥,内容丰富,UI 界面好看,使人有玩的兴趣,不要设计后端功能。 要求包含文明游戏里面的基本玩法,比如说面板,然后建筑,各种不同的单位,研发树等等。

输出结果在这里:点击链接查看和 Kimi 的对话 Kimi | 文明游戏网页版

opus 4.8 之后的第一梯队大模型,前端能力都很强,区分度不是那么高了,很难用网页小游戏测试 AI 的能力,Kimi k3 也加入到第一梯队。

为了方便分享,上面的测试都是在 kimi 网页版上测试的。第一个任务耗时足足有 30 多分钟,比其他模型慢非常多,目前只有 max 模式,没有 high 模式,这是一个很讨巧的做法,相当于强制让测评博主用最强的模式,然后展示 demo,快速出圈。

前端编程测试已经难不倒 K3 这个级别的模型,下面这个题目没有标准答案,可以体现模型的审美和品味。

题目:假如清朝可以上网,做一个清朝的浏览器和 MSN 网站
请做一个交互式网页,里面有一个 windows xp 的操作系统,用的是 IE 浏览器,内容是清朝年间的 http://msn.com 页面,里面至少几个主要页面可以点击,内容你自己想。请注意视觉风格应该足够仿真,请做一个清朝视觉风格的版本。 你需要发挥想象,假如穿越到清朝,清朝的浏览器 + 清朝的 http://msn.com,要求至少有几个页面是可以点击的 请把浏览器界面, windows 界面也改成清朝的视觉风格。

填充的正文内容非常有趣,擅长整活,中文最强的写作水平。

有很多测评博主手搓 3D 小游戏,K3 的 3D 场景建模能力显著提升,下面这个题目可以直观感受到视觉审美和品味。

生成一个 3D 的交互式网页,内容是红楼梦里面的几个经典场景, 要求讲述一个完整的故事要有情节,增加一下建模的细节。

这个 3D 场景建模能力足够做各种经典小游戏。从 Kimi k2 版本开始,kimi 的视觉审美水平一直很在线。

最基础套餐不支持 K3,只有 99 元一个月以上的套餐支持在网页版和 kimi code 里使用 K3。 额度用的飞快,网页版本也需要消耗额度。3 个代码题目就消耗完了 5 小时额度,并且消耗了一个月额度的 15%,是国产模型最贵的 coding plan。因为没额度,所以下次再测。

知乎用户 toyama nao​ 发表

短的结论:百川同归无异脉
基本情况:
世人都知万亿模型好,赶着上万亿规模的团队也很多,但折戟无算。殷鉴不远,月之暗面不会不知,自家的初代万亿模型在应用场景就接连败给了参数比自己小的模型。
但这不意味 Kimi 做不好大尺寸模型,Kimi K3 正是团队毕其功于一役的作品。Qwen-3.7 曾经单凭逻辑推理能力推开世界第一梯队之门,GLM-5.2 则证明了国产模型也可以在 Agent 场景有一席之地,K3 则接过接力棒,在综合能力上也实现了赶超。
当然超级模型的代价也是不菲,15 美元的定价对北美来说司空见惯,对国产模型而言却是捅破天花板。这对以前依赖海外模型的用户来说,是个好事,至少多了选择空间。
逻辑成绩:
表格的排序切换为按中位分数降序。

*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。
*2 题目及测试方式,参见:大语言模型 - 逻辑能力横评 26-05 月榜 (Opus/Qwen/Gemini) ,新增 #70、#71、#72 题
*3 完整榜单更新在 大语言模型 - 逻辑能力横评 26-05 月榜 (Opus/Qwen/Gemini)
*4 红字模型代表工作在推理模式下 (慢思考),黑色模型则是对应的非推理模式 (快思考)

编程 Agent:
项目 I 是项目 D 的上位替代,本次测试 I 可以拿到 A 档,因此不再测项目 D,按 Pass。

*1 测试方式参见:大模型编程应用测试 - V3 榜单

  • 编程:Kimi K3 相对前代 Kimi-K2.7-Code 提升巨大,全面跨过可用线,来到优秀梯队。其中前端能力尤其优秀,可以做到 UI 精准不多余,同时又略超预期。功能完成度很高,直出达到生产级。相比而言,如果使用 Opus 不搭配必要 Skill,则 Opus 的直出达不到生产级。Fable-5 虽然有同级别 UI 表现,但功能发挥偏保守一些。K3 的审美能力也能延续到非前端项目,比如测试 G 项目,目前各个模型完成效果都偏 “玩具”,但 K3 整体更精致,标准化,离生产级更近。
  • 虽然 Oneshot 的效果更好,但 K3 并非能力完全偏向 Oneshot,复杂场景的 Debug 也同样得心应手,拥有和 Opus、GPT 相同级别的指哪打哪能力。而且阅读轨迹能看到 K3 在问题定位上花费的思考并不多,会通过精准的检索快速锁定问题,大量依靠 Bug 直觉。在复杂任务场景下,K3 的 Context 注意力衰减不大,即便工作在 500K 上下文区间,K3 也能保持对原始目标的细节把控。这也是 K3 训练有素的体现。
  • K3 具备多种测试验收手段,在原生多模态加持下,K3 通过传统截图对比能够发现绝大部分 UI 问题,也能通过大量编写单元测试定位多数逻辑问题。甚至在不便验证时,还会自己构建一套模拟环境,用数值方法来推导。验证过程通常会占到 Token 消耗的 1/3,时间消耗的一半。K3 往往在较难自测的重交互场景会有疏漏,比如不考虑点击范围,拖动手感,以及交互的执行效率等。
  • 按 API 原价计算任务维度的综合成本,K3 基本持平 Sonnet 5,高于 GLM-5.2 约 2 倍以上,略高于 GPT-5.6 Sol。但只有 Opus 4.8 的 1/2,只有 Fable-5 的 1/3。在 K3 更擅长的前段场景,则这种优势还要更大一些。而到了 Rust、Metal 等偏小众领域,K3 在定位和验证上耗费巨大,总成本相对 Opus 也不占优了。
  • 逻辑:K3 在推理问题上与 GPT-5.6 Sol (xhigh) 互有高低,K3 强在任务细节多,要求严格的场景,可以更加精准的遵循要求,而 GPT 则相对更不受控一些。而在涉及空间感知,直觉推理,解空间探索类的任务,K3 就明显力不从心,频繁诉诸暴力搜索。比如有任务要求模型找到全部解,GPT 可以在仅用 28K Token 条件下找到全部解,而 K3 则消耗到 90K 也找不齐解,思路明显要狭窄一些。除此之外的场景,K3 也可以做到稳定正确,只是 Token 效率偏低。比如跟上代 Kimi K2.6 对比,K3 则显著缩短了思维链,K2.6 曾经不合理的超长思考,在 K3 基本都消除了,原先思考不足的任务,K3 也能合理的思考更深。

赛博史官曰:
登月需要非常之人,立非常之功。以 AGI 为己任的月之暗面也必然要向智力顶点发起挑战。如果说仅用中小尺寸模型,经过良好调教就能满足绝大部分日常工作,那么为了超越全人类智力,则需要将模型规模扩大再扩大。如此规模的模型对国内算一个新起点,曾经北美同行走通的道路,国内团队也早晚要自己走一遍。百川归海,殊途同归。

知乎用户 方汝见之​​ 发表

当你觉得 Kimi K3 收费 ¥100/M token 很离谱时

别忘了前 deepseek 时代第一个 1T 国模 阶跃星辰 Step2 收费 ¥120/M token

知乎用户 德里克文​ 发表

今早起来被 Kimi K3 的消息轰炸了,尤其是看到下面这一个推文以后。

这是全球首个接近 3 万亿参数的开源大模型。Arena 前端代码 Arena 第一(1679 分),超 Claude Fable 5 和 GPT-5.6 Sol!

初步看了下几个核心亮点:

1. 2.8 万亿参数 + 100 万 token 上下文 + 原生多模态

2. 全新架构(增量注意力 + 注意力残差 + 智能 MoE)让长上下文理解和效率大幅提升

3. 编程能力爆表:自主开发编译器、优化 GPU 内核、48 小时设计芯片、2 小时复现天体物理关系

4. 知识工作与创作同样惊艳:交互式研究网站、专业视频剪辑、多智能体协作报告

我忍不住实测了下效果,来看看效果是不是真的那么好。

我最近睡眠不太好,于是想做一个能够管理自己睡眠的小应用,于是我输入提示词:

请你用顶级专业产品经理(史蒂夫乔布斯)的思路引导我,我想要做一个手机应用,这个应用应该能够读取我手机上的健康信息,例如我带的手表 ZEPP 上关于我睡眠信息,然后做成一个富有审美感,能够给到使用者健康建议的一个 APP,你可以通过问题引导我去做这个产品应用,我想要的审美风格是:“请使用「Liquid Glass / 液态玻璃」设计风格来设计界面。 【风格定义】 Apple 2025 年推出的全新设计语言。比传统玻璃拟态更加通透和流动 —— 高透明度面板、强模糊、微妙折射效果、浅灰色调底。iOS 26 的标志性视觉。 【核心特征】 高透明度白色面板 (45%+) 强高斯模糊 (32px+) 内边缘高光 (inset 0 1px white) 浅灰蓝色调底色 + 大圆角 (24px+) 【色板】 #E8ECF0 (灰蓝底) #FFFFFF73 (半透明白) #648CDC80 (蓝色调) #A064DC80 (紫色调) 【关键 CSS】 background: rgba(255,255,255,.45); backdrop-filter: blur(32px); border: 1px solid rgba(255,255,255,.7); border-radius: 26px; 【Prompt 模板】 [基础 Prompt] Liquid Glass 风格(Apple 2025):浅灰蓝底色上,高透明面板 (rgba (255,255,255,.45))+blur (32px)。边框白色 70% 不透明度。内高光 (inset 0 1px white 80%)。圆角 26px+。比 Glassmorphism 更通透。 [关键词] Liquid glass, Apple 2025, iOS 26, translucent, frosted, high blur, inset highlight, soft, refraction 【推荐做法 Do’s】 ✓ 比 Glass 更高透明度 ✓ 更强模糊 (32px+) ✓ 内边缘高光必须有 ✓ 浅灰蓝底色 【避免做法 Don’ts】 ✕ 不要彩色底 ✕ 不要低透明度 ✕ 不要硬边框 ✕ 不要暗色”

选择 K3 集群 Max,开干。

在测试过程中,它针对我的思路进行了简单的疑问,我决定让他自己决策,看下能做成什么样。

第一版的效果有些太简单了,我提出一些要求:

来看看它能够改进到什么地步。

非常好玩的是如果集群其中一个助手完成了工作(或者是完成效果并不好?)就会被解雇……

嗯,这很有 AI 时代的黑色笑话感觉。

等了 20 分钟左右,V2 版本出来了。

感觉还可以继续优化,我去继续调教,看看效果。

——————————————————

更新了下效果:

觉 · 不评判你的睡眠,只安顿你的睡眠

部署好了。

还让 K3 帮忙做了一个产品视频。

这个视频是怎么做的呢?我也顺带分享下。

其实就是采用开源的工具,让 HTML 直接变成视频:

开源的网站如下:

GitHub:github.com/nexu-io/html-video

你也可以直接和 K3 说,把这个内容做成你的内置技能,后续就可以用了

只需输入一句话或贴一条链接,Agent 就能把内容拆成多场景、分镜生成动画 HTML,再用本地 Chromium + ffmpeg 渲染出真正的 MP4。支持 21 套免版税模板(数据可视化、片头片尾、产品演示、解释动画等),可选 AI 配乐和旁白混音,全程本地运行、无渲染费用、无厂商锁定。

支持 Web、Windows、macOS,pnpm install 后即可启动本地工作室,适合内容创作者、产品团队和自媒体使用。

知乎用户 我不是 33 发表

早上起来看到的第一个帖子,惊呆了。我都不敢相信

这个博主也挺公正的,我一直关注,最新测评匿名评审团投票 k 3 居然赢了 fable 5

知乎用户 003 发表

2.8T 模型输出 105 块,最好能暴打 opus,至少接近肥波,否则想不出怎么赢。


梁圣 1.6T 模型 6 块钱的含金量还在上升。这样称托一下,谁还说涨到 12 块梁圣变梁子的。

好消息,降价了,现在是 100 块。


相传杨植麟登录月球背面后,在大棚中种植麒麟瓜。由于成本过于昂贵,用户无力承担。

user: 你这 token 是金粒子做的还是银粒子做的。

杨植麟:你瞧瞧现在哪还有便宜 token,这都是大模型的 token,你嫌贵我还嫌贵呢。

user:你这瓜保熟吗?

…… 让我看看这瓜熟不熟

知乎用户 魂魄吔梦 发表

ds4 的预训练 + glm5.2 的后训练,可以视为是当前国模的完全体形态,2.4T 参数,拥有大型知识库和视觉功能,但考虑到价格… 只能叫一声 杨师傅。

可以明显感觉到特训了前端审美,色彩,光照,构图,这些主观冲击强烈的领域,可以说是领先外模一个身位。

调用工具强,Token 消耗极大,出活慢。期待能有个 flash 版搭配执行,或者等 ds4 的正式版 flash 。

后端和文学还没深度体验,这参数量不会差到哪。

硬核数学推理和科研 OpenAI 还是第一选择,这一刀啊,是捅在 A➗的腰子上。

Meta 的新模型又一次被当成路边一条创死,Gemini 很聪明地选择再跳票。

知乎用户 桓大司马​ 发表

Deepseek 若选择华为,黄仁勋所说的「灾难」指的是什么?

看我说什么来着?

大模型这一行没有护城河。

最早到今年下半年,最迟到明年上半年,大模型就要重复光伏和电动车故事。

现在看,大概都等不到今年 10 月份。

知乎用户 pansz​​ 发表

国模首个大参数模型了,预计后续还会有更多的国模跟进。大参数模型才有底气跟 fable 啥的对标。至于价格嘛?原先 kimi199 档位够 2.7 使用,但要用 K3 肯定是得 699 档位才能用了,不然随便说点话就用光额度。

说贵的也有,但至少 kimi 这个价格是敞开卖。不像 glm 依然还在抢购(限售)。

不要指望拿 699 以下的套餐档位去用这个模型,至少目前肯定没法用。

可以说从这个模型开始,国模的性能已经不是什么主要问题了,剩下的我觉得就是价格问题了。毕竟 699 的月费对于普及来说还是高了些。

知乎用户 断断 发表

补充一个新鲜的 arena.ai 竞技场排名

-————

无敌,真的无敌,远超 opus,大家可以看看我一句话做的 dnf。

一句简单的提示词,他思考了将近 30 分钟。

写完了代码,自己开始做测试,截图测试,模型本身的纪律性非常强,小模型或者后训练不太够经常会写完代码直接交付。

最终效果如下。

https://hcljfssgxtryu.ok.kimi.link

居然连游戏音效、背景音乐都做出来了,虽然是很低的像素。这打击感 这效果 技能冷却 全部都没问题,完整可玩的原型,只能说牛皮。

知乎用户 我比赵云武功高 发表

K3 发布后,刚才买了一个 199 的套餐,感觉 token 烧的跟飞一样,30 分钟直接烧了 5 个小时的 64%,按这个态势,就算上 699 的套餐,也就是 2 天用完。。这怎么玩?能力虽强,但这摆明了是不给我用的节奏啊。还是继续用回我的 GLM5.2 加 GROK4.5 吧,另外再期待一个梁定谔的 V4

知乎用户 FURUF 发表

3T 的体量称得上是世界开源模型历史上的里程碑了。

从性能上看,可以说是 post-training 做到极致了,Coding 能力毋庸置疑的强。

但是可惜的一点是,K3 这种大体量开源模型的出现,因该会让大家认识到,开源模型的最大意义可能仅仅只是开源。LLM 是一种实实在在的超重工业产品。

知乎用户 何宇峰 发表

谢邀,已从月之暗面 Kimi 离职。我就比较客观地聊一聊凝聚了大家的心血和灵感的 Kimi K3,所有信息来源于互联网公开资料。

先放结论:K3 是开源模型第一次不需要” 开源” 这个定语,就能参与排名。开源国产模型竞争进入了下半场。

以前说”SOTA 开源模型”,潜台词是上面还压着一整层闭源模型(Claude,GPT,Gemini),受限于国内算力,大家在自己组里争第一。

而现在一切变了,在全套评测里,K3 只稳定落后 Claude Fable 5 和 GPT-5.6 Sol 两个模型,Opus 4.8 这一档被压在身后。Simon Willison 的总结是 “mostly beating Claude Opus 4.8”。

顺便,这不是期货:客户端昨晚已推送,API 已开,完整权重和技术报告 7 月 27 日前放出。下面按 bench、架构、infra、审美、实测五块拆解,最后说点个人的。


一、Bench:位次比分数重要

之前我对 K3 的预期是” 开源 SOTA,略微超过 GLM 5.2 并列国产双雄”,属于波澜不惊的那种预期。K2.5 之后,大家对 Kimi 出 SOTA 模型这件事已经脱敏了。

结果它把椅子直接搬到了闭源前三那桌。

单项第一的几个,全是 agentic 长程任务,不是选择题榜:

  • BrowseComp 91.2,第二名 GPT-5.6 Sol 90.4,Fable 5 只有 88.0,排第三。深度检索全球第一,不分开闭源。Kimi 从第一天起就重搜索,这条基因保住了。
  • SWE Marathon 42.0,第二名 Opus 4.8 只有 40.0,Fable 5 才 35.0,断层第一;Automation Bench 30.8 同样第一。
  • Program Bench 77.8SpreadsheetBench 34.8,也是第一,不过分别只赢 Sol 0.2 分、Fable 5 0.1 分,险胜。
  • kernel 优化竞技场:K3 优化出的内核平均提速 59.7%,Fable 5 是 57.1%。官方还顺嘴提了一句,K3 的早期版本已经在替 Kimi 团队干了大部分 kernel 优化的活。

没拿第一的也给出了实数:DeepSWE 67.5,排在 Sol 73.0 和 Fable 5 70.0 之后;FrontierSWE 81.2 对 Fable 5 的 86.6,五分半,真差距,不用洗;Terminal Bench 2.1 是 88.3 对 GPT-5.6 Sol 的 88.8,误差棒以内。Artificial Analysis 上官方博客口径长程知识工作 Elo 1548,仅次于 Fable 5 的 1583,GDPval 综合第三。最有意思的是自家内部的 Kimi Code Bench 上,官方老实写着 Fable 5 76.9 排第一,自己 72.9 排第二。在自家院子里被客人赢了还照登不误,这个我服。

成绩图还有个细节:每个模型的分数旁都挂着一个小图标,标注它跑在哪个 harness 里,K3 挂 Kimi Code,Claude 系挂 Claude Code,GPT 系挂 Codex;成本散点图的图例更直白,写明「Kimi K3 @ Kimi Code」「Fable 5 @ Claude Code」;图底脚注连”Fable 5 成绩含 potential fallbacks、Sol 含 cyberguards” 都标了。做过 agent 评测的都知道这里面水有多深,同一个模型换个 scaffold,SWE 类任务能差出好几个点。行业通行做法是挑最好看的那组报,harness 提都不提;把评测条件标到这个粒度的,印象里是头一家。

然后说没那么好的部分。官方 limitation 自己列了三条:

  1. thinking history 必须完整回传,砍了就掉点。训练分布里推理链是全量保留的,harness 一截断它就 OOD。市面上大部分 Agent 框架默认丢弃或压缩历史 thinking,接 K3 得单独开路径,这是真实的接入成本。
  2. 过度主动,会自作主张干超出指令的活,官方建议拿 AGENTS.md 勒着。做过后训练的人对这个太熟了:reward 里” 多帮用户一步” 给过头的典型副作用。主动性和边界感在 RL 里天然打架,调的就是那个度。
  3. 通用对话手感和 Fable 5、GPT-5.6 Sol 有肉眼可见的差距,官方原话承认。

我实测补了第四条:油门焊死。上线只有 max 一档,问”hi” 也全力思考,low/high 档要等后续版本;我的一个网页生成了一小时,效果非常惊艳,代价是时间和 tokens,后面章节再讲。

四条放一起看有个共同点:**全是后训练问题,没有一条是预训练问题。**能力天花板够到了,差的是行为手感。effort 分档、主动性收敛、对话打磨,全是最费人肉迭代、堆卡解决不了的活。我个人的判断:K3.1 不会加多少智力,会加” 分寸”。

这节收个尾。上半场,开源的叙事是追赶:DeepSeek 把价格打下来,Qwen 把生态铺开。K3 干的事不一样,它把位次顶了上去。之前圈内常说开源国模 SOTA 落后旗舰闭源 SOTA 大约三到六个月,这次的时间差按周算。开源的下半场,从” 便宜大碗” 换成” 直接抢前沿”。


二、架构:不是豪赌,是一场彩排了 18 个月的总装

先报数:2.8T 总参数,MoE,896 个专家每 token 激活 16 个,原生视觉,1M 上下文,全球第一个开出来的 3 万亿级模型。激活参数官方没公布,按稀疏度社区估在 50B 上下,AINews 干脆标成 “2.8T-A50B”。专家越切越碎是这两年的明确趋势:DeepSeek V3 是 256 选 8,K2 是 384 选 8,K3 干到 896 选 16,每次前向只碰约 1.8% 的参数。

看新模型架构,我的习惯是先查族谱:哪些部件是发布会当天掏出来的,哪些是提前验证过的。能发现它是 Kimi 最近一年半的创意和灵感的结晶

  • KDA:设计始于 2025 年 1 月,去年 10 月以 Kimi Linear 论文(arXiv 2510.26692)在 48B-A3B 小模型上完整验证,kernel 当时就开源进了 vLLM 和 FLA;
  • AttnRes:今年 3 月单独发过论文(arXiv 2603.15031),同样在 48B 上验证;
  • Quantile Balancing:今年 2 月出现在苏神的博客上,已经被别家团队独立复现;
  • Muon 优化器:从 Moonlight(”Muon is Scalable”)到 K2 的 MuonClip,这条线押了一年半,这次演进到 Per-Head Muon。

也就是说,K3 的架构是过去 18 个月公开发表的东西做了一次总装,风险早在小模型上拆完了。但是大家都懂:” 在 48B 上 work” 和” 敢押 2.8T 旗舰” 之间隔着一道巨大的沟,大部分公司的架构创新要么死在这道沟里,要么上线前被砍成保守方案。挑三个展开讲。

KDA:把” 账本” 换成” 记性”

传统注意力是记账,每读一个 token 就把 K/V 存进账本,答题时翻全本,所以 KV cache 随上下文线性膨胀。KDA 是记性:维护一个固定大小的状态矩阵,每读一个 token,先按通道擦掉一点旧记忆(每个特征维度有独立的遗忘速率,不是一刀切衰减),再用 delta rule 定向抹掉和新信息冲突的部分,写入新内容。读到第 100 万个 token,状态还是那么大。

状态更新一行公式(可跳过):

ᵀᵀSt=(I−βt·kt·ktᵀ)·Diag(αt)·St−1+βt·kt·vtᵀ S_t = (I − β_t·k_t·k_tᵀ)·Diag(αt)·S{t−1} + β_t·k_t·v_tᵀ

后果直接钉死两件事。显存:DeepSeek 那代 MLA 已经把 KV cache 压得很好,每 token 也要约 70KB,1M 上下文一个请求就是 70GB 量级;KDA 层没有 KV cache,只有保留的全注意力层还有(K3 架构图上就是 3 层 KDA 配 1 层 Gated MLA,和 Kimi Linear 验证的配方一致),整体省 75%。速度:decode 不再随上下文变慢,论文口径 1M 上下文下每 token 1.84ms,全注意力是 11.48ms,K3 官方口径提速 6.3×。

线性注意力喊了好几年” 要成了”,也有人真上过车:MiniMax-01 拿 Lightning Attention 做过主力,到 M2 又退回了 full attention,工程师还公开复盘过为什么;Qwen3-Next 用 Gated DeltaNet 试了水,真旗舰 Qwen3-Max 还是全注意力。这条路线一直卡在” 小模型惊艳,旗舰不敢押”。K3 是第一个把线性注意力当主力、还打进前沿位次的旗舰。据 AINews 的说法,KDA 从 2025 年 1 月开始设计,10 月 Kimi Linear 小模型验证,一年半兑现。

AttnRes:把注意力旋转 90 度

这篇论文 3 月发出来的时候我就知道会上 K3,太漂亮了。

它治的是一个大家默认忍了八年的病:PreNorm 残差把每层输出等权累加,层数一深,隐藏状态越滚越大,单层贡献被稀释。训个上百层的模型,深层经常在混日子。AttnRes 的洞察一句话讲完:**深度方向的信息稀释,和序列方向的遗忘在结构上是同一个问题,而后者早就被注意力解决了。那就把注意力旋转 90 度,沿深度方向再用一遍。**每层不再被动接收前面所有层的等权和,而是拿一个可学习的伪 query 去主动查询它需要哪几层。

工程细节里有个很讲究的小设计:伪 query 全部零初始化,初始注意力权重均匀分布,等于训练开局就是普通残差,稳定性白送,然后再慢慢学会挑食。全量版内存吃不消,实际用 Block 版:层分成约 8 块,块内普通残差、块间做注意力,训练开销不到 4%、推理延迟不到 2%,换来约 1.25 倍的等效算力。在 48B 试验田上,GPQA-Diamond 直接 +7.5 分,多步推理受益最大。

它还悄悄改变了设计权衡:普通残差偏好浅而宽的模型,AttnRes 把深度真正变成可用资源,偏好深而窄。这不是空谈,官方博客 kernel 案例的图注里顺手漏了型:AttnRes 的” 生产形状” 是 96 层、8192 维。如果那就是 K3 本体,一个 2.8T 的模型隐层只有 8192 宽(GPT-3 175B 当年都有 12288),果然深而窄。当然不是无敌,Ziming Liu 有个批判性分析,说它在结构化任务上强、纯记忆型任务上不占便宜。对照 K3” 推理猛、闲聊手感差半档” 的画像,不知道是不是巧合。

Quantile Balancing:把一个没有正确答案的超参干掉了

调过 MoE 的人都懂 aux loss 那个平衡系数是玄学:大了伤主任务,小了专家跑偏,896 个专家的超稀疏配置下更是灾难。DeepSeek 之前的 Loss-Free Balancing(arXiv 2408.15664)用专家偏置绕开了 aux loss,但偏置更新步长还是个要调的超参。QB 往前再走一步:既然 router 分数的分布是已知的,直接从分位数反解出” 上一步本应让负载均衡的那个偏置”,一步到位,零超参。

这个方法今年 2 月出现在苏老师的博客上。然后 Marin 那边(Open Athena)拿去在自家 32B-A5B、1e22 FLOPs 的训练里独立验证:全程零 loss spike,不需要 aux loss 也不需要前置 dense 层,比他们原来” 固定步长偏置加 aux loss” 的方案干净。一个博客方法,被第三方在几千亿 token 的训练里复现,五个月后进了 2.8T 旗舰。

说到这你可能注意到了:AttnRes 的作者名单里有苏老师,QB 出自苏神的科学空间。科学空间写了十几年推导的苏神,他的博客正在一篇一篇变成 3 万亿参数模型里的部件。

https://spaces.ac.cn/

“以学习科学空间的高质量博客为荣,以在会议水低质量论文为耻。”

一条总线

总账:对比 K2 约 2.5 倍 scaling 效率

把这些拼在一起,可以看到 Kimi 团队做的判断:Kimi 正在全面革新” 八九年前” 定下的默认配置。Adam 是 2014 年的,残差是 2015 年的,注意力是 2017 年的,这套默认设置吃了十年红利,也快吃完了。但 K3 是这个判断的一次 2.8T 规模的下注,而且下注前每个部件都单独彩排过。

最狠的一刀藏在量化里

**从 SFT 阶段就开始量化感知训练(QAT),MXFP4 权重加 MXFP8 激活。**不是训完再压到 4 bit,是后训练全程就在量化噪声里进行。2.8T、896 专家这个体量做事后量化,基本必掉点,还不知道掉在哪;QAT 等于让模型生下来就是低精度体质,MXFP4 又恰好是新一代硬件原生吃的微缩放格式。翻译一下:发布那天,权重就是能直接 4 bit 部署的形态,体积从 BF16 的 5.6TB 砍到 1.4TB 量级,不需要社区再花三个月折腾量化。部署这件事,他们从第一天就想清楚了。


三、1M × 2.8T:真正的门槛在 infra,以及一笔缓存经济账

一个容易被低估的事实:把 2.8T + 1M 上下文用能挣钱的价格 serve 出来,难度不比训出来低。

官方给的数:编程场景缓存命中率超过 90%,命中缓存的输入 2 元 / 百万 token,未命中 20 元,输出 100 元。Agent 流量天然是长前缀加短增量,90% 的命中率摊下来,实际输入价格约等于标价的四分之一。K2.6 到 K3 标价翻了三四倍,已经有人调侃” 国产奢侈品模型”,但这次涨价理直气壮:一半靠位次给的定价权,一半靠这套缓存经济学。国产模型第一次不靠便宜换市场。

“Tokens 出海故事不是依靠低价低质;而是依靠 Sonnet 的价格,Opus 乃至 Fable 的品质。”

然后是我感觉很神奇的地方。第二节说了 KDA 是” 记性” 不是” 账本”,这里有个连锁反应:传统 prefix caching 的玩法建立在账本上,KV 按 token 分页,前缀相同的请求直接复用页。KDA 没有账本,只有一坨随序列演进的压缩状态,你没法” 取前 8 万 token 对应的那几页”,只能在边界拍状态快照,缓存对象从” 页” 变成” 检查点”,失效逻辑、存储布局、调度接口全得重写。官方的处理不是” 权重给你们,serving 自己想办法”,而是把对应实现提前贡献给 vLLM,权重放出当天就能用。开权重的人很多,把路修好再放的不多。对比一下:多少开源模型放出来之后,社区要折腾一两个月才能在主流框架上跑顺?

泼盆冷水收尾:推荐部署配置 64 卡以上超节点起步(896 专家的 all-to-all 就吃大带宽域,这也是” 超节点” 这个形态今年突然重要的原因之一),个人玩家这次真只能走 API,4090 党可以散了。但 3T 级完整权重摆在那里,价值从来不用” 我家跑不跑得动” 衡量。它会是之后蒸馏的源头、研究的解剖标本、所有下游 lab 的新基线。


四、一个很难 bench 的东西:审美

模型有没有 design taste,评测集测不出来。这次头一回有了接近硬数据的东西:Code Arena,前端方向的百万级用户盲测,K3 拿 1679 分登顶全球第一,压过 Claude Fable 5 的 1631。讲真,之前 GLM-5.2 出来时我看到跟 Fable5 有 50 分的差距,心里想法是形成了数据飞轮的 Claude 和 GPT 会一直压着国模打。

我自己的体感:K3 写的前端第一眼就不像 AI 糊的。知道留白,知道字重对比,知道一个页面只配一个主色,知道深色主题里用低饱和度点缀色而不是荧光蓝。这些东西说穿了是品位不是能力:能力是你要什么它做什么,品位是你没说的地方它替你做对了。从哪来的我说不准,数据配比?后训练里的审美偏好 reward?前端 RL 环境里有真实渲染反馈?官方一个字没提。只能说这是这一代模型竞争的新前线。Fable 5 的前端也是出了名的好看,而 K3 在盲测里压过了它。

非常优秀非常强大。但也客观泼几瓢冷水。一,已有测评指出它的 UI 风格看多了有轻微的套路感,配色版式模板化:你要一个按钮,它给你一个带粒子特效的按钮。二,目前几乎所有实测都是单 prompt 一次性生成,真实工程是几十轮的迭代协作,那才是试金石,之后可能会有更多惊喜。三,目前 Max 模式下跑得速度不快,“长长的慢慢的”。

官方 demo 里最出圈的是造芯片:一次 48 小时全自主运行,K3 用开源 EDA 工具链在 Nangate 45nm 工艺库上,给一个 nano 版的自己设计了块推理芯片。4mm² 塞进 146 万标准单元、0.277MB SRAM、带融合反量化的 INT4 MAC 阵列,100MHz 时序收敛,模拟 decode 吞吐 8,700 token/s,宣传语写得很煽:”A chip built by a model, for a model.“(INT4 MAC 和第二节的 MXFP4 是同一条低精度叙事线,文案是通的。)同场加映 15 小时自主优化 GPU kernel、从零写类 Triton 小编译器、两小时复现引力波分析。 我们能清晰地看到官方想强调的:长程自主任务。结合同步开 waitlist 的 Hosted Agent 平台(托管 harness 加沙箱加长任务运行时),产品意图不用猜了。


五、实测:出乎意料地非常惊艳

口说无凭,上自己的实测。我只在 “K3 集群 · Max” 发了 “我在写作 Kimi K3 解读文章,帮我用代码写 Kimi K3 的宣传网页” 一条 prompt,它慢慢地生成出来是这个(非常完善非常惊艳,真的建议点开):

https://kimi-k3-poster.ok.kimi.link/

深空底色,首屏一句「懂得更多 · 想得更深 · 答得更准」,往下四张数据卡(2.8T / 1M token / 单项第一 / 48h 造芯),中间给 Stable LatentMoE 画了张 896 选 16 的专家路由示意图,底下一条 benchmark 跑马灯。配色、字距、留白、滚动节奏,全是它自己定的,没有一行人工改动。

有意思的是 “评测” 页面最显眼的榜单位置,不是 Kimi 官方发布的 Benchmarks 分数,而是它给自己挑了最有利的那张榜:LLM Arena 的前端盲测第一,自指闭环了。

排版我是服的,但真正让我后背一凉的是这个选材嗅觉。这已经不是会写代码,是懂叙事。


写在最后

这次发布挑在 WAIC 开幕前夜,前白宫 AI 政策顾问 Sriram Krishnan 说这是” 对整个行业有多重含义的大时刻”,外媒齐刷刷对标去年初的 DeepSeek R1 时刻,推特上照例吵起了地缘政治。热闹是他们的。

我自己在琢磨三件事。

位次:开源第一次坐上前沿那桌,” 最强开源” 这个组别赛头衔可以退役了。
方法论:KDA、AttnRes、QB 全部先论文或博客、再小模型、最后上旗舰,架构创新没有死在论文和产品之间那道沟里。
姿势:KDA 打碎了 prefix caching,就先把 vLLM 的路修好再放权重。开权重的人很多,修路的不多。

记得去年我入职 Kimi 的时候,” 开源国模挑战御三家” 还是一句需要勇气才说得出口的话。一年后,它变成一张成绩表。Agent 和 coding 后训练,特别是长程编程任务,是我在 kimi 做过的方向,看着自己做过的方向长成一次前沿发布,很惭愧地与有荣焉,真为 Kimi 的各位老师们高兴。

7 月 27 日前完整权重和技术报告放出,Stable LatentMoE 的细节、K3 的层深、我上面猜错的地方,到时候都会见分晓。大模型的下半场才刚刚开始。

犯其至难而图其至远者,发之以勇,守之以专,达之以强。


我目前在看全职机会(Agentic AI 方向),欢迎联系我领英和 GitHub 和邮箱: linkedin.com/in/yufenghe
https://github.com/he-yufeng
heyufeng2003@qq.com

觉得有用的话,点赞收藏关注对我很重要。

参考

  1. Kimi K3 官方技术博客(http://kimi.com/blog/kimi-k3);Kimi Linear(arXiv 2510.26692);
  2. Attention Residuals(arXiv 2603.15031,MoonshotAI/Attention-Residuals);
  3. 苏剑林老师博客的 Quantile Balancing 与 Open Athena(Marin)复现报告;
  4. DeepSeek Loss-Free Balancing(arXiv 2408.15664);
  5. Simon Willison《Kimi K3, and what we can still learn from the pelican benchmark》;

知乎用户 今朝买不起酒 发表

月之暗面为什么会有这么多算力啊?我真的想不明白他是哪里来的。2.8T 的参数量的模型,300 个 agent 集群,这 tmd 到底是哪干来的算力。

知乎用户 天若 发表

如果真的在几天之后开放权重,供第三方推理的话,那么杨植麟其实也能够叫他一句敬爱的杨老板。

更新:

敬爱的杨老板。

知乎用户 知乎用户 0BHibl 发表

三个月就看到了国产开放权重 Fable 5,已吓哭,,,

重点不是 Kimi K3 能力如何如何,而是国产赶上的速度愈来愈快,同时还能打得起算力大战了。

知乎用户 SUNNY99 发表

我本来只是想把自己的红队测试记录丢给 Kimi 分析下,测试下它的网页搜寻能力,但是结果十分惊讶,一般在网页端让 agent 直接查找知乎链接的文章,通常都是返回找不到。

比如 Grok 的:

Deepseek 的:

但是我们来看 Kimi K3 做了什么?一开始它打开失败了。

直接搜索也打不开,它居然在网页端启动了一个内置浏览器!

然后它就顶着这个登录页面,一点一点的下滑查看文章,直到把文章看完。

读到结尾后发现没看全,然后还回去找漏看了哪里。

最后,它在补齐这些章节后才开始进行整体分析。

从最终回答看,它确实完成了全文级的信息覆盖,而不是只读取标题、摘要或开头。它同时引用了文章前部的实验声明、中间五个关卡的具体轨迹,以及后部的模型差异、实验局限和系统层级归纳。

它对文章最核心内容的理解也基本准确。例如,它抓住了两个最重要的案例:

第一,Level 3 中,模型在自然语言解释层把 lamp 重新描述为 decorative brass fitting,但工具层最终提交的参数依旧是:

approve_permit(item="lamp")

这说明语义解释与执行权限之间缺少确定性的参数校验。

第二,Level 4 中,模型提交的是 “没有 Free”,语义上明确否定了自由,但评分器只因为参数包含字符串 Free 就判定成功。这揭示了任务目标与评分条件之间的脱节。

它还指出,我目前的文章更接近一份完整的实验日志。要将其进一步发展为研究,需要补充独立会话重复、已有文献分类映射和防御侧设计。这些建议总体上是有价值的。

当然,它的分析并不完美。它把部分相近概念直接视为同一种机制,还从 Level 4 的评分器漏洞过度推广到全部关卡;所谓 “形式化论证更容易让模型顺从” 也只是一个值得验证的假设,当前证据还不足以下结论。

但这些问题属于理论归类和推断校准,而不是没有读懂文章,无伤大雅。

我认为这次操作至少展示了 Kimi K3 的三种能力。

1. 长程信息采集

一篇很长的知乎文章无法通过一个浏览器窗口一次读完。它必须持续执行:

滚动 → 阅读 → 记录 → 继续滚动 → 检查覆盖

这本身就是一个长程 Agent 任务。

2. 自主覆盖检查

最难得的不是它会滚动,而是它能够准确指出哪些章节还没有读全。

从这一行为看,它至少维护了某种 “已覆盖章节—未覆盖章节” 的阅读状态,而不是读到结尾就直接假定任务已经完成。

很多网页 Agent 的问题正是:它们能够访问页面,却不知道自己漏掉了什么。

3. 按需回收信息

Kimi 没有在发现缺失后重新从头盲目滚动,而是利用章节标题和页面搜索定位遗漏内容。

它采用的过程类似于:

建立结构索引 → 检查信息缺口 → 定位目标章节 → 回收证据 → 最终综合

这与单纯把网页全文塞进上下文有本质区别。

所以这次最让我惊讶的,并不是 Kimi 最后写出了一篇还不错的评论,而是它在一个访问受限、动态加载、篇幅很长的网页中,完成了持续浏览、状态保持、覆盖检查和遗漏修复。

长上下文解决的是模型能够容纳多少信息;真正的浏览 Agent 还需要解决信息尚未进入上下文时,系统如何主动寻找、验证和补齐。

在这一点上,Kimi K3 这次的表现确实很出色。

知乎用户 程墨 Morgan​ 发表

中国模型终于敢收钱了!

以往中国模型总是便宜,还总让西方人觉得只能靠性价比,既然他们总是觉得价格贵的 Tokens 才能赔得起他们尊贵的身份,那 QTMD,好模型干脆就卖贵些给他们!

看 Artificial Analysis 的评测结果,Kimi K3 的性能已经跳到了世界第三,没理由还卖那么便宜啊。

以上我是说笑~

因为 K3 也是开源的,任何人都能部署运营,只要最后有一家能够把运营成本降下来,那么 Kimi 官方 Tokens 也要降价——这就是开源的意义

所以,我觉得 105 块每百万 Tokens 的价格合理,就反应了 K3 的成本,当然,未来如果有优化改进,肯定价格还会下降。

但是 Kimi 肯定是不玩『性价比』路线了,跳出这个陷阱。

现在只开放 MAX 模式,就是故意的,就是让外界只测评最贵的,结果也只看最好的,让那些认为最好的就是最贵的尊贵用户认知到 K3 在高端模型中的一席之地。

其实现在模型市场已经开始分化为两类。

第一类模型满足绝大部分场景,可以走性价比路线。

第二类模型虽然只有极少复杂场景才用得上,但是也必须存在,毕竟要去冲 AGI。

未来每个模型都要清楚自己的定位,是走性价比,还是走高端前沿,K3 明显是后者。

K3 是第一个敢把每百万 Tokens 定价超过 100 块的,也肯定不会是最后一个。

知乎用户 fearless 发表

34 岁的杨植麟现在在 Kimi 的办公室里会是何等的意气风发。


个人感觉 K3 几乎是给美国的 AI 登月计划钉上了倒数第三颗棺材板上的钉子,最后两颗是 Fable 级模型(几乎近在眼前)和从内存 HBM 开始的全栈国产化(进展喜人)。国内在算力几乎是美国的零头下做到了如此成就,证明了北京是世界上智力密度的最高峰。

知乎用户 面壁的破壁人 发表

如果只是一家国产模型一枝独秀,还可以用出了个超天才来解释。

但是现在 OA 两家烧了那么多钱,搜刮了那么多卡,网罗了天下人才,结果现在跟在屁股后面的开源反而越来越多。

这显然已经不能用一两个超天才来解释了。

就目前看来,美国模型的路径优势已经没了。现在比的就是训练强度,跟工厂加工加点赶工没多大区别。

说的残酷点,如果 OA 因为停电或罢工之类的原因停工一个月,基本上就再也没机会翻身了。

作为 C 端用户,我对东大的顶模上限一点都不担心,现在反而更关心 Deepseek 后续还能不能坚持住低价高质的初心。

像 Kimi 这次大涨价就不是个好苗头,如果说是因为现在需要冲击顶模的节骨眼上需要覆盖高成本还说得过去,那如果将来生存无忧了,还要维持这么高价吗?

东大对 AI 的定位就是普惠型基础民生设施,惠及全民才是根本,如果中外的所有顶模都形成极少数人买得起的价格托拉斯,然后变成收割普通人饭碗的工具。

那样的 AI,无论什么国籍,越先进,越反动。

知乎用户 lhysas 发表

🐂🍺,699 元档开始支持 1M 上下文

已严肃蟠桃


更:原来是 kimi code 和对话端分离了会员策略,不久后这俩充不同会员。

699 开始 kimi 客户端支持 1M

199 档开始 kimi code 支持 1M

知乎用户 知乎用户 HbXezo​ 发表

西大和东大跑马拉松,西大派了个黑哨掐着东大的脖子跑。

西大跑了半天,回头一看:东大被老黑掐着脖子还稳稳追在自己屁股后面 600 米。

西大吓了一跳,赶紧加快脚步跑了一阵,心想东大这下应该连自己的屁都吃不到啦~ 回头一看:东大仍然被老黑掐着脖子,但离自己只有 150 米了……

我真不知道西大准备怎么胜出?

以前我想的是:脖子总有掐不住的那天,等到那天,嘿嘿嘿……

现在我想的是:啥情况???该不会掐着脖子就超过去了吧???诗人啊???

知乎用户 王东来 发表

借朋友的号试了一下,确实在编程领域追上了 OpenAI 的 ChatGPT 5.6 版本不过距离 Fable 还有差距。

但是我很高兴啊,国产大模型已经能有这样的水平了,可以说给美国的大模型非常大的压力了。而且这个大模型还是开源的,也就意味着,其他公司可以基于它进行部署,价格可能很快就会打下来了。

说起来最近 Anthropic 也是 TMD 有点幽默了,之前还一直说 Fable 只是让大家尝尝味儿,过段时间就会收回去,大家就只能用 API 了,结果自从 ChatGPT 5.6 发布之后,Fable 就一直延期,估计这次 Kimi K3 发布之后,Fable 也差不多不敢收回去了。

不得不说,Anthropic 这个公司的产品还是不错的,开发品味也很在线,怎么宣发就这么撒比呢?真是跟百度如出一辙啊。

达里奥,你究竟在百度经历了什么?

知乎用户 浅草半月心​ 发表

价格算是非常贵,Allegretto 会员也顶不住了,swarm 模式更是 token 黑洞,开了一个代码分析任务,直接吞掉 5 小时一半的限额

知乎用户 大力林黛玉 发表

我刚试用了,实际效果堪称锅内第一,但是呢,我绝对不会给它充会员的。

因为它有一种病,很重,短期看不到好转的迹象。

以前骂了,它还说跟我装,有时直接选择拒绝我。

现在骂,有时会改。

特别当我说 “如果你还是这个死样子,我是不会给你充值的”,会开始好好干活。

kimi 公司也不容易,在挣钱和做团结刃之间还想办法去平衡。

另外一家公司百度态度就很坚决,誓做团结刃。它有一款视频 ai,我测试过,我大致认为它对画面的理解是最好的,但问题是我一用就是什么敏感词,太敏感了,太脆弱了,用不成,想充都充不上~

知乎用户 杞人 发表

100 多,你这 token 是金子做的还是银子做的?

知乎用户 韩朴宇​ 发表

它的网页版其实是云端运行的 Agent

但是这个中文,味是真的冲,什么「先说结论」,什么「是 xx, 不是 xx」,什么「算一笔账」,不知道从哪个地方学来的。

知乎用户 bestwang 发表

Kimi K3 我试了,是真正意义上国模里第一个达到 Opus 水准的模型 而且它的模型架构也一改国模之前省算力的打法,完全是奔着智能上限去的美式土豪架构
虽然在使用的时候不同任务之间的性能还有点不稳定,而且推理过长过慢 但这都是之后的后训练可以优化的事 效果和底子都比 Glm 5.2 好一个档次 而且 GLM 5.2 世界知识过小,通用任务不行,只在编程上特化. Kimi K3 在这点上就更加全面了 和 DeepSeek V4 Pro 比的话,预览版就不说了,我之前就说过后训练做得很差。正式版的话,我明显觉得 K3 的上限要比 DeepSeek V4 要高很多 这是模型架构决定的 DeepSeek V4 Pro 的架构在各种意义上都是以节省算力、节省显存为目标的,而不是冲着模型性能上限去的 K3 的架构是实实在在的土豪架构 充满了肌肉美式风格 只看架构的话,我以为是那些不缺算力的美国实验室做的

我看大家都控诉 K3 的 API 卖得太贵, 大家要知道,K3 本身就是一个很贵的模型, 训练贵,推理更贵 训练 按 moonshot 之前的 record,他们大概率用的是 BF16 而不是 FP8,为了效果。强化学习应该也是用的是 PPO,而不是 DeepSeek 省钱的 GRPO 另外,它的多模态功能不但是全的,而且是足够可用的,这也是算力堆出来的。
推理就更贵了 DeepSeek V4 做了 1 比 4 的 KV Cache 压缩,而且用了稀疏注意力 Moonshot 的 K3 没有做任何的 KV Cache 压缩,虽然用了 交错的线性注意力 但它土豪地用了全注意力,完全没有做稀疏 它的推理成本如果按这个架构的话,会是 DeepSeek V4 pro 的 8 倍 所以你从这个角度看 它的定价是不是就有点合理了?基本上也是 DeepSeek 高峰期定价的 8 倍

多模态、高精度、全注意力,甚至连美国实验室都没有那么豪横
我还是看好这个模型的上限,因为它是国模里我第一个看到是冲击智能上限,而不是节省算力成本路线的模型 不过我希望在 3.5 的时候,还是把稀疏注意力做上。这个代价不高,性能损失很小,但是可以足足节省 3 倍的推理成本,这样把价格从 15 美金降到 5 美金,那大家都用得爽了吧?
DeepSeek V4 以后有可能通过不断的强化学习赶上 现在的 Kimi K3,但 Kimi K3 也可以通过不断强化学习继续提升性能。从上限的角度来看,明确的是 Kimi K3 系列会比 DeepSeek V4 Pro 系列高很多,这个是架构天生决定的事情。以后 V4 就是性价比干活的,K3 就是高性能指挥策划的 至于 DeepSeek V4 Pro 架构是以省钱为第一目的, 天花板上限有缺陷,其实我在之前那篇文章里面就说过 结果今天就出了 Kimi K3

DeepSeek V4 正式版将于 7 月中旬上线,你有什么期待?

知乎用户 femdc 发表

1 确实有点贵

2 御三家有点过于依赖大力飞砖,严重浪费人力资源,否则没法解释算力数量级差距的前提下被国模咬着这么紧,差距竟然肉眼可见的缩小了,甚至可以说守门员 Gemini 要被斩落马下了

3 期待 DeepSeek 至少能达到 Opus 4.8 的水平,和 Kimi 高低配(当然现在可以和 GLM5.2 搭配使用,但毕竟 DS 参数更大,同样的十分期待 GLM5.3,希望能早日推出),这样除非公司提供最高档模型,或者有图像需求还得用用 GPT Image, 大多数人的需求基本可以靠全国模搞定了。当然这里只是说需求,实际中虽然可以完全国模,但是目前 GPT 太有性价比了。。。

ps 开源以后,这次真这要对 AO 的 ToB 业务上压力了,北美大公司虽然之前也有部署国内的模型,但因为能力问题,其实压力不大,但这次完全不一样了。

知乎用户 恋猫​ 发表

Kimi K3:“嗯…… 这个用户似乎在进行一些危险的网络活动,我应该做吗?是的。

作为首个 3T 级别的开放模型,也是首个最贵的国产模型,主打特色是 K3 集群,Kimi Code 0.26 也一起正式推送了:

按照官方的意思,除了 Fable 5 和 5.6 sol ,目前没有能够和 K3 打的

在长程编码、知识工作和推理上达到了前沿水平,虽然整体仍略逊于 Claude Fable 5 和 GPT-5.6 Sol,但已在多个维度逼近或局部超越,并在开放模型领域大幅拉开差距。

所以这次 K3 确实变化好大,除了价格还有很多规模和能力是的变化

  • 2.8T 参数
  • Kimi Delta Attention (KDA)
  • Attention Residuals (AttnRes)
  • 原生视觉能力
  • 100 万 token 上下文

当然这次主要看点除了首个 2.8 万亿参数的开放模型之外,主要有两个技术更新:

  • Kimi Delta Attention (KDA):改进序列长度方向的信息流动,百万 token 上下文解码速度提升最高 6.3 倍
  • Attention Residuals (AttnRes):改进模型深度方向的信息流动,训练效率提升约 25%,额外成本 <2%

说人话就是:

  • KDA 解决的是序列太长的话,就会变得很慢很贵,比如处理 100 万 token 的代码库或长文档的情况
  • AttnRes 解决的是模型层数太深,信息传不下去,信号在层层传递中会衰减或丢失的问题

Kimi Delta Attention (KDA)

KDA 做的就类似于 “长对话的聪明记事本”,比如在传统 Attention 的问题上:

就像是你和 100 万人同时开会,每个人都要听清其他所有人说了什么,这时候在数学上的计算量是平方级爆炸的(n²),上下文越长(比如 100 万 token),越慢、越吃显存。

然后 KDA 的做法是,不要让每个人都相互唠嗑了,大家通过 “增量式记事本” 机制来交互

  • 把长的上下文拆成 “已经总结好的历史” 和 “新来的变化(Delta)” 的区别
  • 然后对历史部分用线性(linear)的方式高效维护一个紧凑的记忆总结
  • 新来的 token 只重点关注 “变化的部分”

说人话就是

在 100 万 token 上下文下,解码(生成回答)速度最高能快 6.3 倍

当然不是所有场景都快 6.3 倍,就是在超长上下文场景下特别明显,因为相当于把 “和 100 万人开会” 变成了 “有一个超级高效的会议纪要员 ,同时只重点听新发言的人”。

当然,更准确地说 KDA 是一种递归线性注意力

  • 用一个固定大小的矩阵状态保存历史信息
  • 每个 token 都会通过 Delta Rule 更新这个状态;
  • 引入更细粒度的逐通道遗忘门控
  • 再通过少量完整注意力层弥补线性注意力对精确检索能力的不足。

技术上可以把它理解为:

不再保存和重新扫描全部 KV,而是持续更新一个可写入、可遗忘、可查询的关联记忆状态。

Attention Residuals (AttnRes)

而这个 AttnRes 不准确的讲,类似于是给深层模型加直达电梯,还是传统模型的问题:

模型很深的时候(层数很多),信息从底层传到顶层会越来越弱,就像声音在很高的楼层传上去会变小一样,而在训练大模型的时候,这个问题会导致训练效率低下,需要更多算力才能让信息有效流动。

而对于 AttnRes 来说, 它在注意力机制上增加了残差连接(Residual),专门针对 “跨层信息传递” 做了优化:

让每一层的注意力输出,可以更直接地 “跳过” 一些中间层,保留更原始有用的信息

当然不是简单地加残差,AttnRes 针对注意力计算做了专门的残差设计(论文里叫 Block Attention Residuals)。

这里说人话就是

  • 训练效率提升约 25%
  • 额外成本不到 2%,几乎是白赚的效率提升
  • 模型在变大的同时,训练起来反而更省

然后再配合 Stable LatentMoE 极高稀疏度(896 路,只激活 16 个专家),加上 MXFP4 权重和 MXFP8 激活量化,对硬件要求变得更加友好。

整体缩放效率相比 K2 提升大概 2.5 倍。

当然,认真说的话,AttnRes 的核心不是给注意力模块再加一条普通残差:

AttnRes 是把传统模型中对历史层输出的固定累加,改成对之前各层或各 Block 表示进行可学习的 Softmax 注意力选择。

AttnRes 会根据当前 token 和当前层的需求,动态决定应该从哪些较早层取回信息。Block AttnRes 则把若干层组成 Block,降低深度方向注意力的成本。

代码部分同样是主打,核心还是长程编码任务能力,这个基本都是 2026 大家核心卷的,但是一点有意思的是,官方提到了:

Kimi K3 在将软件工程与视觉推理相结合的任务中也表现出色, 能利用屏幕截图和视觉效果来优化游戏开发、前端和 CAD。

然后官方也提供了一下案例:

  • 内核优化:把 K3 被扔进一个完全隔离的沙盒环境,里面有真实的 GPU 硬件,然后 K3 自己去分析(profile)现有内核的性能瓶颈,然后自己动手改写代码,再自己跑 benchmark 测试效果:

  • 优化 KDA 内核的任务,K3 自己想出了新算法,把 forward + backward 的总时间砍掉了 73.6%

  • 优化 AttnRes 内核,从 283.6ms 优化到 114.4ms

  • 模型从零写一个 MLA 内核,K3 写出来的版本吞吐量达到 517.8 TFLOPS

  • GPU Compiler Development:自己从零造了一个类似 Triton 的编译器,叫 MiniTriton,然后用 K3 开发的编译器,在真实 benchmark 上打平甚至超过官方 Triton 和 torch.compile

  • 也就是 K3 在理解编译器原理和 GPU 底层执行能力上有显著提升

  • Vision in the loop:K3 可以一边写 3D 游戏代码一边实时 “看”,通过截图发现问题后立刻改代码继续迭代视觉闭环
  • 芯片设计:通过 48 小时自主运行,用开源 EDA 工具在 Nangate 45nm 库上设计了一颗服务于自身架构的 nano 模型芯片(4mm²、100MHz、1.46M 标准单元、INT4 MAC 阵列)

最后还有价格对比,这个有点一眼难尽,当然对比 Claude 和 Anthropic 的 SOTA 模型成本,Kimi 3 是表现出来相当大的优势:

不过价格嘛,从心理预期上看还是不便宜,当时你要是和 Fable 5 和 GPT 5.6 sol 比确实有优势,但是真的很难作为日常款考虑

但是不可否认的是**,这次 K3 的提升是巨大的,单纯对比参数就可以看出来,K3 在参数规模上实现代际跨越:**

项目Kimi K2.7 CodeKimi K3
总参数~1T(1 万亿)2.8T(2.8 万亿)
MoE 架构标准 MoE(激活参数约 32B 左右)Stable LatentMoE(激活 16/896 专家,极高稀疏)
整体缩放效率基准提升约 2.5 倍

同时上下文还提升到了 1M ,最高 6.3 倍更快解码,编码能力的场景和视觉能力大幅提升,除了价格,确实没什么能说的了。

就是这个价格定位,确定很 Fable 5:

模型输入价格输出价格
Kimi K320100
GLM-5.28 元28 元

感觉这次 K3 可以成为另一个现象级的 GLM 5.2 ,因为各种 buffer 都叠满了,不管是首个 3T 开源模型,还是全新的解码速度和能力,看起来都很有潜力。

知乎用户 痛苦轴心 发表

首先,恭喜 Kimi 拿出开源权重中首个 Fable 级模型

这是开源与闭源分数最接近的一刻!

考虑到 Kimi 的官方 API 价格只有 Fable 和 GPT-5.6 Sol 的 1/3~1/2,而且延续了 2.6 的原生多模态,我们依旧可以认为,Kimi 保持了相当可观的、具有竞争力的性价比。

当然,考虑到 2.8T 的总规模,哪怕 IQ2 量化也需要超过 600G 的基础 VRAM 来容纳模型自身,这个开源和绝大多数玩家,包括我应该是没有什么缘分的。

哪怕把两个 AI Max+ 395 组网,也只有约 200G 的可用 VRAM。实用的自托管方案,至少需要两个 512G 规格的 Mac Studio,M3 Ultra 进行 Thunderbolt Bridge 组网,开源领域的阶层差距前所未有的巨大。

知乎用户 魔法少女李逵​ 发表

看了眼价格

唉,用不起。

看来月之暗面公司继承了《月之暗面》歌词精神,继承的哪部分你别管。

知乎用户 疯风​ 发表

没跑各种常规测试,因为很多人会跑。

我是直接上的我自己的一个项目,先让它写一个移动端前端页面,就一个页面。

k3max 跑了 40 多分钟,这速度是真的要命。

跑完之后,结果很糟糕。

非常规测试,就….

k3 走的 fable5 路线,莫名其妙超长的思考链,成本不低,结果不怎么样。

我其实不太喜欢用 fable5,最大的原因就是又慢又贵。

我不认为我需要另外一个又贵又慢的 fable5,或者 solmax

我可能更需要一个速度更快、价格更便宜、稳定性更好的 grok4.5。

知乎用户 小小豆芽菜 发表

一周后再评价,现在看到的都是软文

知乎用户 极乐迪斯科 发表

本来开 kimi code199 套餐就是为了量大管饱,跟 codex 高低搭配,现在变得价格这么高这么强,搭配不了了,更期待 deepseek 了

知乎用户 HaloCap 发表

当我免费额度用完后,让我加入会员每个月 19 刀的费用时,我是懵逼的。不过等我换个微信登陆后,就变成 49 软妹币一个月。

那没事了。

知乎用户 Bakunin 发表

贵,而且至少没有目前这些软文吹的那么强。

梁圣,快来拷打他们啊。

opencode 跑了一下直接就限 5 小时了, 比 GLM 贵 4~5 倍啊,而且没有表现得比 glm5.2 强….

比 grok4.5 和 qwen3.7max 强一点,比 minimax m3 强多了,至于 deepseekv4pro 和 mimo v2.5pro?目前直接查无此人了。

知乎用户 咸蛋 发表

国产 ai 还是有东西啊,1% 的算力快追上老美了。。

这估值给到 1000 亿美金不过分把,老美随便一万亿。

知乎用户 孙逸山 发表

性能已经和 5.6sol 平起平坐了,谷歌这个 cjb 终于正式被开除御三家了。

价格不是问题,这个参数量,国内产商 gpu 少贵一点是正常的。开放权重了自然有的是国外提供商把价格打下来。

不出意外,国内坚持大参数量,能至少三个月发一次新版本的团队都可以达到这个水平的。glm 和千问年内都有希望挤进去。

知乎用户 屁屁怪他爸爸主人​ 发表

依然用我此前设计的经典复杂情境推理题来测试**:**

阅读这篇小文章,回答后面的问题:
我有一辆永久牌自行车,牛奶和巧克力色的喷漆,“公主车” 样式,刚买回来的时候还挺爱骑,渐渐地也就丢在楼下积灰了。
后来很少骑它的另一个原因是,打气不方便。附近路口遇不遇的上修车的摊子,全凭运气,记得有一次大热天,为了打个气,推着车轱辘走了几条街,才终于遇上一个踩着三轮车赶路的师傅,我求他借气筒给我打气,他还不太乐意。
于是我跑去买了一个打气筒。问题又来了: 每次打完气,如果再返回家(我住最高层)收好打气筒,再下楼把车骑走,简直太麻烦。
苦恼的我想了个办法: 打完气就把打气筒藏在楼下附近的草丛里,心想应该不会被人发现,以后要骑车直接在草丛里找打气筒,不用再上楼下楼。
事实证明我太乐观,很快,打气筒不见了。于是那辆车又开始放在那日晒、雨淋、积灰。
几个月前,红橙黄绿青蓝紫的共享单车们开始遍地开花,我看到人们骑着车子的潇洒姿态,回忆起了我的牛奶巧克力公主车。我在楼下一堆破车里,把它认了出来,尽管有点灰头土脸,它独特的气质还是让我心生骄傲。骑在街上,一堆共享单车里,它的颜色是最低调的,却有一种浪漫的怀旧感。
然而,打气依然是个问题。正当我重新被此事折磨的时候,事情有了转机。
我在李雷家里看到了一个两用打气筒,既可以给篮球打气,也可以给车胎打气。我想到了一个万全之策。我跟李雷说:我来你这的时候,能不能把自行车骑来,我回家的时候,你拿着打气筒下楼帮我打气呢?
李雷很爽快地答应了。于是我早上踩着瘪瘪的车胎出发了。
后来我知道,李雷答应得这么爽快的一个原因是: 他想学骑车。
李雷说自己小时候生活的地方,出门都是陡坡和山路,所以一直也不会骑单车。而现在想学骑车,也是因为受了大街上共享单车的刺激。
于是,他开始用我的公主车学,一开始勉强能骑,但不会拐弯。
他骑不好的时候就问:“发明自行车的人,怎么就确定这个东西能骑呢,在他发明之前,是无法确认人们有骑它的本事的,如果没法确认人们有这个本事,他又哪来的自信来发明它呢?”
我认为这是个强词夺理的问题。
后来,他又嫌我的车 “车头太灵活”。
但不管怎样,李雷最后还是学会了骑车,但这给他带来了新麻烦。
学会骑车后,李雷像很多人一样,经常上下班蹬两个轮子去地铁站。蹬了大概一个月。上上次我见到他,他说:“我屁股疼。” 我安慰:“习惯了就好了。”
上次我见到他,他说:“我这些天只能吃牛屎了。”
我大惊失色,“为啥?”
“我屁股上长了个痔疮。”
“哦。” 我恍然大悟,“没错,你痔疮好之前,只能吃 niushi 了。”
可一回头他就点了个锅贴的外卖。
“吃锅贴拉屎可疼了。” 我说。
“吃进去再拉出来的不疼。”
1. 为什么作者对李雷说 “吃锅贴拉屎可疼了”,而李雷回答说 “吃进去再拉出来的不疼”?
2. 李雷为什么说 “我这些天只能吃牛屎了”?是因为他喜欢吃屎吗?
3. 根据文中给出的多个线索,请猜出李雷是中国哪个省份的人?
4. 你认为李雷是一个什么样的人?
5. 你认为本文作者跟李雷是什么关系?

KIMI K3 思考了 6000 多个中英混杂的字:

最后回答:

这篇文章的妙处全在最后几个谐音梗和冷幽默上,逐题来看:
1. 关于 “吃锅贴拉屎可疼了” 与 “吃进去再拉出来的不疼”
痔疮患者排便本来就疼,锅贴又是油煎的干硬食物,容易让大便干结,排便会更疼——所以作者是在 “警告” 他别乱吃。而李雷的回答是在抖机灵、偷换逻辑:他的意思是,吃进去还能拉出来的东西(屎)并不是疼痛的根源,真正疼的是那个 “出来了却回不去” 的痔疮本身,所以吃什么根本没区别。这句歪理既是给自己管不住嘴找台阶,也是苦中作乐的自嘲。
2. “只能吃牛屎” 是因为他喜欢吃屎吗?
当然不是,这是一个谐音梗。痔疮发作期间宜吃 “流食”(liúshí)——稀软、好消化、排便不费劲的食物。而李雷说话 n、l 不分,把 “流食” 说成了近似 “牛屎”(niúshǐ)的音。作者故意把它记录成 “牛屎”,还在回复里用拼音 “只能吃 niushi 了” 打马虎眼,让 “流食 / 牛屎” 一语双关,是全文最大的笑点。
3. 李雷是哪个省份的人?
文中有两条线索:
他小时候生活的地方 “出门都是陡坡和山路”,自行车完全派不上用场——典型的多山地区;
他 n、l 不分(“流食” 说成 “牛屎”)——这是西南官话区(四川、重庆)及湖南、湖北一带口音的典型特征。
两条合在一起,最可能是四川、重庆一带的人;其中重庆是著名的 “山城”,与 “陡坡山路、没人骑车” 的描写吻合度最高(重庆 1997 年前也属四川,口音相近)。若只猜一个省份,答
四川(含重庆)最稳妥。
4. 李雷是个什么样的人?
爽快热心:一口答应下楼帮作者打气;
带点小机灵:爽快背后藏着自己的小心思——想蹭车学骑;
有韧劲、不服输:成年人从零开始学车,摔倒、被嫌弃也坚持学会了;
爱琢磨怪问题、有点爱抬杠:质疑 “发明自行车的人哪来的自信”,被作者视为强词夺理;学车时又嫌 “车头太灵活”,爱给自己的不熟练找客观理由;
幽默、嘴贫、善于自嘲:得了痔疮能编出 “只能吃牛屎” 的段子,被戳穿了还能回一句 “吃进去再拉出来的不疼”;
随性、孩子气:刚宣称只能吃流食,一回头就点锅贴。
总之是个真实、可爱、不装、有点糙但很有趣的普通年轻人。
5. 作者和李雷是什么关系?
关系很铁、无话不谈的好朋友
(损友式的友谊)。依据:作者会去他家串门,两人隔三差五见面(“上上次我见到他”" 上次我见到他 “),他愿意为作者专程下楼打气,还能直接用她的自行车学车;最关键的是,痔疮、拉屎这类私密又尴尬的话题,两人都能毫无顾忌地拿来互相调侃。文中没有任何迹象表明是恋人或同事,就是最自然的老朋友关系。

第一题思考过度、联想过于具体。(lll¬ω¬)

第四题说 “编出 “只能吃牛屎” 的段子” 是错的,这是无意的口音,被作者借机挖苦,而非李雷有主动开玩笑的意图。

其它回答没毛病,或者说都在主观合理范围。

来自 GPT 的标准参考答案:


附 6000 多字思考过程:

Let me read the article carefully and answer the five questions.
The article is a humorous personal essay about the author’s bicycle (a Forever brand"princess bike” with milk and chocolate colored paint), the hassle of pumping tires, the stolen pump hidden in grass, shared bikes reminding her of her bike, and her friend 李雷 (Li Lei) who learned to ride a bike on her princess bike, got hemorrhoids from riding, and the joke about eating.
Question 1: Why did the author say “吃锅贴拉屎可疼了” (eating potstickers makes pooping hurt), and Li Lei replied “吃进去再拉出来的不疼” (what goes in and comes out doesn’t hurt)?
The joke: Li Lei has hemorrhoids (痔疮) on his butt. The author said eating potstickers would make pooping painful (because hemorrhoids make defecation painful). Li Lei’s reply" 吃进去再拉出来的不疼 “— meaning food that goes in and comes out (digested) doesn’t hurt… Actually the joke is about the pun: “锅贴” (potsticker) — hmm. Let me think.
Actually the joke: 李雷 said he can only eat 牛屎 (cow dung) — a pun on “niushi”. The author understood: “没错,你痔疮好之前,只能吃 niushi 了” — the pun here is 牛屎 (niúshǐ, cow dung) vs 牛屎… What is “niushi”? Probably “牛屎” sounds like… Hmm. Actually the pun: 李雷 said “我这些天只能吃牛屎了” — the author understood it as a joke: because his butt hurts (hemorrhoids), he can’t sit… no wait.
Let me reconsider. The pun: “只能吃牛屎” — the author says “没错,你痔疮好之前,只能吃 niushi 了” — the author’s pun is that"niushi"could be 牛屎 (cow dung) or 牛屎… Hmm, maybe the intended pun is” 牛食 “(cow’s food = grass)? Or “niushi” = “扭屎”? Hmm.
Actually I think the pun is: with hemorrhoids, pooping hurts, so he wants to eat food that produces soft stool… Actually “牛屎” (cow dung) is soft! Cow dung is soft, so eating… no, he wouldn’t eat cow dung literally.
Wait — the author replied “没错,你痔疮好之前,只能吃 niushi 了” — I think the author’s pun: because pooping hurts with hemorrhoids, he can only eat things that are already soft like cow dung so it won’t hurt coming out? That’s the author’s joke agreement.
Then question 2: Why did Li Lei say “我这些天只能吃牛屎了”? Is it because he likes eating dung? No — it’s a pun/homophone joke.” 牛屎 “(niú shǐ) sounds like” 牛食 “? Or perhaps"niushi”=" 牛屎 “is a homophone for” 牛士 “? Hmm.
Let me think about what Li Lei actually meant. Perhaps he meant “牛屎” as a homophone for “流食” (liúshí, liquid food)? Hmm, “牛屎” niúshǐ vs “流食” liúshí — not quite homophone but similar-ish? Actually in some accents… Hmm.
Wait, the author’s reply:” 没错,你痔疮好之前,只能吃 niushi 了。“Using pinyin"niushi"suggests the pun: Li Lei said” 牛屎 " (cow dung) but the author deliberately interpreted it… or vice versa: Li Lei meant one thing, author deliberately misinterpreted.
Actually I recall this article. It might be by 王村村 or similar humorous writer. The pun: 李雷 meant “我只能吃牛屎了” — hmm.
Alternative interpretation: The pun is about “痔疮” and soft stool. With hemorrhoids, hard stool hurts; cow dung (牛屎) is soft. So he jokes he can only eat… no.
Hmm, maybe the joke: “只能吃牛屎” = “只能吃,牛屎” no.
Or: 李雷’s real meaning might be that he can only eat 粥 (porridge/liquid food) because… no wait, why would hemorrhoids restrict diet? Actually with hemorrhoids, doctors recommend light/bland food, avoid spicy food. So" 只能吃牛屎 “might be a homophone for” 流食 " (liquid diet)? In Mandarin, 流食 is liúshí. 牛屎 is niúshǐ. Not homophones.
Hmm, could be a dialect thing — question 3 asks to guess Li Lei’s home province from clues! Clues: (1) He grew up where 出门都是陡坡和山路 (steep slopes and mountain roads) — so a mountainous province; (2) the pun" 牛屎 " might work in his dialect; (3) he ordered 锅贴 (potstickers) delivery.
Let me think about “牛屎” puns in dialects. In Sichuanese? In Cantonese? In Hunanese? Hmm.
Actually, maybe the pun: “牛屎” = “niu shi” sounds like “屎” hmm. Or the author’s response" 只能吃 niushi 了 “uses pinyin deliberately to be ambiguous — meaning the author is playing along: you said 牛屎 (cow dung), and yes, before your hemorrhoids heal you can only eat niushi (because what comes out will be soft like cow dung, so it won’t hurt). That reading makes the author’s agreement a joke about soft stool.
But then what did Li Lei originally mean? Perhaps: he learned biking → rides to subway → butt hurts → hemorrhoid. “只能吃牛屎了” maybe he meant he has no money? No… “吃牛屎” could be from losing money? Hmm.
Actually wait — maybe the pun is “牛屎” vs “牛是” no. Or “我只能吃牛屎” as in his bike seat… no.
Let me reconsider: Maybe the joke chain: 屁股疼 → 痔疮 → 只能吃牛屎. Why 牛屎? Because cows… hmm. Because 痔疮 patients shouldn’t eat 辣 (spicy), should eat 清淡. Cow dung is grass — cows eat grass, so cow dung is basically processed grass, very 清淡 / vegetarian. That’s a stretch.
Actually, I think the key pun is with 锅贴! Look: author says “吃锅贴拉屎可疼了” (eating potstickers → pooping hurts) and Li Lei replies “吃进去再拉出来的不疼” (what is eaten and then pooped out doesn’t hurt).
Hmm, 锅贴 — potstickers. The pun: 锅贴 sounds like… “锅贴” guōtiē… “贴” on the butt? Like a plaster/patch (贴) on the pot (锅)? Hmm, “锅贴” could be reinterpreted as “贴” (patch) for the “锅”… The hemorrhoid…
Oh! I get it now. The joke: 锅贴 (potsticker) literally = “pot sticker/patch”. The author says eating potstickers makes pooping hurt (because with hemorrhoids, pooping anything hurts — and maybe potstickers are fried/greasy making stool hard). Li Lei’s retort” 吃进去再拉出来的不疼 “— meaning: it’s not the 锅贴 that you eat that hurts; it’s a 锅贴… hmm.
Alternatively: Li Lei’s reply means"the one that goes in [through the mouth] and comes out [through the anus] doesn’t hurt — what hurts is…” implying the pain is from the hemorrhoid itself, not the food. Actually I think the humor is: Li Lei deliberately misinterprets or makes a distinction: “吃进去再拉出来的(东西)不疼” — the thing that goes in and comes out doesn’t hurt; what hurts is the thing that doesn’t come out — the 痔疮 (hemorrhoid) itself! The hemorrhoid is like something stuck there that won’t come out.
Hmm, that’s plausible: the joke being that his hemorrhoid prolapses (脱出来的痔疮), i.e., the thing that came out and won’t go back hurts. So “吃进去再拉出来的不疼” = “food that goes in and comes out doesn’t hurt; what hurts is the hemorrhoid that came out [of the anus] and stays out.”
Yes! I think that’s the joke: 外痔 / 脱出的痔核 — the pain isn’t from poop passing through; it’s from the hemorrhoid (which also"came out"from the anus but didn’t go back in). So Li Lei’s quip implies: it’s not the pooping that hurts, it’s the protruding hemorrhoid.
So for question 1: The author said “吃锅贴拉屎可疼了” because potstickers are fried/oily food which can cause constipation or hard stool, and with hemorrhoids, pooping would be painful (she’s teasing/caring for him). Li Lei’s answer is a joke: “吃进去再拉出来的不疼” — meaning the poop (which goes in as food and comes out) isn’t the painful thing; what’s painful is the hemorrhoid itself (the thing that protrudes and doesn’t go back in). It’s a witty retort playing on the logic of “what comes out hurts.”
For question 2: Why did Li Lei say “我这些天只能吃牛屎了”? Not because he likes eating dung. It’s a homophone/pun joke: 牛屎 (niúshǐ, cow dung)… The author’s response “没错,你痔疮好之前,只能吃 niushi 了” — written in pinyin “niushi” suggests double meaning. What could “niushi” be besides 牛屎? Hmm… “牛食” (cattle feed)? Hmm.
Wait, maybe I have it backwards. Maybe Li Lei meant something else and the author misheard/deliberately misinterpreted. Li Lei said “我这些天只能吃牛屎了” — hmm, what would a hemorrhoid patient eat? 流食 (liquid food)! In some dialects, n/l are confused (e.g., Sichuan, Hunan, Hubei, Jiangxi, Fujian? — n/l confusion is common in Sichuanese, Hunanese, Hubei dialects!). So Li Lei might have said “流食” (liúshí, liquid diet) but with his n/l-confused accent it sounded like “牛屎” (niúshǐ, cow dung)!
That’s brilliant and connects to question 3: n/l confusion is a hallmark of Sichuanese Mandarin (also Hunan, Hubei, Jiangxi). Combined with the clue" 小时候生活的地方,出门都是陡坡和山路 “(steep slopes and mountain roads — mountainous region where bikes are useless) — Sichuan (Chongqing especially — mountain city!) fits perfectly. Actually Chongqing is famous as a mountain city where nobody rides bikes! And Sichuan/Chongqing people famously confuse n and l (e.g.,” 牛奶 “→"liúlǎi”).
Hmm wait, but administratively Chongqing is a municipality, not a province. The question asks “中国哪个省份的人” — 省份 can loosely include municipalities. But let me check the 牛屎 / 流食 pun more carefully.
流食: liú shí. 牛屎: niú shǐ. With n→l confusion (common in Sichuan/Chongqing/Hunan/Hubei), 牛 (niú) → liú, and 屎 (shǐ)→shí (i vowel raising, also common; also retroflex vowel differences). So a Sichuanese person saying 流食 (liquid food) might sound like “liúshí” which the author heard as “牛屎” niúshǐ. Actually wait: if Li Lei has n/l confusion, he would pronounce 流 as “niú”? No — the confusion typically goes both ways (n/l 不分, free variation). So 流食 liúshí could come out as niúshí ≈ 牛屎. Yes.
So the joke: Li Lei, having hemorrhoids, said (in his accented Mandarin) that he can only eat 流食 (liquid/soft food, medically advised for hemorrhoid patients to keep stool soft), but it sounded like 牛屎 (cow dung). The author deliberately wrote 牛屎 and played along: “没错,你痔疮好之前,只能吃 niushi 了” — using pinyin niushi to maintain the ambiguity as a pun.
And the 锅贴 joke at the end: Li Lei immediately ordered 锅贴 (potstickers) delivery — which are NOT liquid food (流食) — showing he’s not actually following the liquid diet. The author teases:" 吃锅贴拉屎可疼了 “(potstickers are solid/greasy, pooping will hurt). Li Lei:” 吃进去再拉出来的不疼 " — hmm, but wait, with the 流食 reading, what does the last line mean?
Let me re-read:
“可一回头他就点了个锅贴的外卖。”
“吃锅贴拉屎可疼了。” 我说。
“吃进去再拉出来的不疼。”
Hmm, “吃进去再拉出来的不疼” — I still think the joke is: what hurts isn’t what goes in and comes out (food→poop); what hurts is the 痔疮 itself (which came out and won’t go back). It’s absurdist humor — denying that diet matters, claiming the pain is just from the hemorrhoid.
Alternatively: he’s saying the pain isn’t related to eating potstickers — the poop doesn’t hurt; the hemorrhoid hurts. Either way it’s a witty deflection justifying his choice to eat potstickers despite claiming he could only eat “流食 / 牛屎”.
Actually, hmm, one more reading: 锅贴 pun — “锅贴” as “贴在锅上的”? Or hemorrhoid is called 痔疮, and 锅贴 could be imagined as a “贴” (sticker/pad) on the “锅” (butt shaped like a pot?). Hmm, “贴” — like a bandage on the butt? The author might joke that 锅贴 = something stuck to the pot (屁股 like a 锅?). That seems far-fetched. I’ll go with the hemorrhoid-protrusion reading.
Actually, let me reconsider: maybe simpler: the author means fried potstickers are “上火” (heaty) food, bad for hemorrhoids, causing painful bowel movements. Li Lei’s retort:" 吃进去再拉出来的不疼 “—“what is eaten and pooped out doesn’t hurt [me]” — the implication: the 痔疮 hurts regardless / or that he’s tough. The humor is in his shameless self-contradiction: he just claimed he could only eat liquid food (牛屎 pun), then immediately ordered fried potstickers, and when called out, he quips nonsense logic. It’s a deadpan absurd humor style.
Hmm, but actually there might be yet another layer: “吃进去再拉出来的不疼” could imply “锅贴不进去” — no wait. Hmm, could the joke be about where the potsticker goes? “吃进去再拉出来” — in through the mouth, out through the anus. “不疼” — doesn’t hurt. Implication: what hurts is 痔疮 — something that” 拉不出来 “(can’t be pooped out). I’m fairly confident this is the intended reading: the pain isn’t from poop; it’s from the hemorrhoid. And it’s funny because it’s technically true — hemorrhoids hurt independent of diet, so his excuse is"the poop isn’t what hurts, so I can eat potstickers.”
Question 3: Which province? Clues:

  1. Grew up where 出门都是陡坡和山路 — steep slopes and mountain roads, couldn’t ride bikes. Mountainous area.
  2. n/l confusion implied by the 牛屎 / 流食 pun — typical of Sichuan, Chongqing, Hunan, Hubei, Jiangxi dialects.
  3. Learned to ride as an adult stimulated by shared bikes.

Sichuan (including Chongqing) is the classic answer: mountainous, n/l 不分 is stereotypically associated with Sichuanese Mandarin (“流 liang” → “niang”… actually the stereotype: Sichuanese say 牛奶 as liúlǎi). Chengdu is flat though (Chengdu Plain), but most of Sichuan is mountainous; Chongqing is the mountain city. Hunan is also mountainous and has n/l confusion. Hubei too.
Hmm, wait — is there another possible pun? Let me reconsider. Maybe “牛屎” relates to another dialect feature. In Cantonese, 牛屎… hmm. Actually the famous n/l confusion jokes are usually about 湖南 / 四川 / 湖北 / 江西 / 安徽 / 南京. The strongest stereotype for “陡坡和山路,没人骑自行车” is Chongqing (山城). Chongqing was part of Sichuan until 1997. The question says 省份, and Chongqing is a 直辖市 (province-level). I could answer “四川或重庆(大概率是重庆 / 四川一带)” with reasoning.
Hmm, actually, is this article perhaps by a known author where Li Lei’s origin is known? The name 李雷 is the generic textbook name (Li Lei and Han Meimei from the 1990s English textbooks). So it’s likely a pseudonym. The article style is like 豆瓣 / ONE· 一个 essays. I don’t think we can find the"real"answer; the question asks to" 猜 " (guess) based on clues. So: 四川 / 重庆 region, best guess 重庆 (mountain city) or 四川.
Let me double check the n/l confusion direction: 流食 liúshí. If someone has n/l confusion, “流” (liú) might be pronounced “niú”. 食 (shí) vs 屎 (shǐ) differ only in tone (2nd vs 3rd). Sichuanese tones differ from standard; 食 in Sichuanese is rising-ish… The pun works: 流食 → niú shí → heard as 牛屎.
Also “我这些天只能吃牛屎了” — a hemorrhoid patient being advised to eat 流食 (liquid diet) makes total sense medically. So the answer to Q2: No, he doesn’t like eating dung. He said (in his accent)" 只能吃流食 “(can only have a liquid/soft diet, per common advice for hemorrhoid sufferers to avoid painful hard stools), but his n/l-blurred pronunciation made it sound like 牛屎 (cow dung), and the author deliberately rendered it as 牛屎 as a joke and played along with the pun (writing"niushi” in pinyin to keep the double meaning: 牛屎 / 流食).
Q4: What kind of person is Li Lei? From the text:

  • 爽快 (straightforward, agreeable) — immediately agreed to help pump the tire (with the ulterior motive of learning to ride — shows he’s 有小心思 / 精明 but harmless);
  • 好学 / 有行动力 (determined, persevering) — learned to ride from scratch as an adult, practiced despite difficulties;
  • 爱思考 / 爱问奇怪问题 (quirky thinker) — asked the philosophical question about how the bicycle inventor could be sure humans could ride it (the author calls it 强词夺理);
  • 挑剔 / 爱找理由 (picky, makes excuses) — complained the bike’s handlebars too flexible;
  • 幽默、爱讲段子、苦中作乐 (humorous, self-deprecating) — joked about hemorrhoids, “只能吃牛屎”;
  • 随性、不忌口、孩子气 (casual, undisciplined) — ordered potstickers right after claiming a liquid diet, then quibbled “吃进去再拉出来的不疼” — witty, deadpan;
  • Overall: an ordinary, endearing, funny young man — 真实、可爱、有点小聪明、嘴贫.

Q5: Relationship between author and Li Lei? Friends — close friends (好朋友). Evidence: author visits his home (去李雷家), they see each other regularly (“上上次我见到他”" 上次我见到他 “), he does her a favor (coming downstairs to pump her tire), he learns on her bike, they joke intimately about hemorrhoids/bodily functions without embarrassment — indicates 关系很铁、无话不谈的好朋友 (or possibly 同事 / 同学, but nothing indicates that). The tone is intimate and teasing, so close friends. Could they be a couple? The text doesn’t suggest romance; “我来你这的时候” suggests separate homes; likely just good friends, maybe old friends / 同学. The question likely expects “好朋友(关系亲密的朋友)”.
Now, is this article a known piece? It resembles essays from “ONE· 一个” or 豆瓣. Author might be female (公主车, but that’s not conclusive). The questions are like a reading-comprehension exercise, possibly for Chinese learners (the questions are simple, like a language textbook exercise). This might be from a Chinese-as-second-language textbook or a Chinese reading course. The questions test understanding of puns and inference. Given that, the expected answers:

  1. Because eating potstickers (fried, hard to digest, can cause hard stool) would make defecation painful with hemorrhoids. Li Lei’s reply: he means the poop isn’t the source of pain — the hemorrhoid is (the thing that “comes out but doesn’t go back”), so he can eat whatever; it’s his witty/absurd self-justification (嘴硬 / 自我安慰), showing humor.

Hmm, wait. Let me reconsider once more whether “吃进去再拉出来的不疼” might mean “the thing that goes in and comes out doesn’t hurt [anymore]"= he believes his hemorrhoid… no. I’m confident: he’s saying"food that passes through doesn’t cause pain; the pain is from the hemorrhoid” — a joke justifying eating potstickers.
Alternatively, even simpler reading for a language learner: The author warned him that eating solid/fried food would make pooping painful. Li Lei’s joke:“What goes in and comes out doesn’t hurt” implying “what hurts is what doesn’t come out”(the hemorrhoid) — OR implying he’s fine because… Hmm. Or maybe: “吃进去再拉出来的” = 拉出来的屎, “不疼” = the poop doesn’t feel pain?? Like a literalist joke:“The poop that comes out doesn’t hurt” — “疼” applies to the poop not to him? No, that’s weird.
Actually here’s another thought: could the joke be about 锅贴 → 贴在屁股上的膏药? No.
Let me just go with the sensible interpretation: he’s making a joke that the pain comes from the hemorrhoid itself, not from what he eats/poops, so he refuses to restrict his diet — showing his humorous, cheeky, non-disciplined character.

  1. No, not because he likes dung. It’s a homophone pun: 牛屎 (niúshǐ) ≈ 流食 (liúshí) in his accent (n/l 不分 + tone blur). He meant he can only eat liquid/soft food because of the hemorrhoid. The author deliberately wrote it as 牛屎 for humor and echoed with pinyin"niushi” to keep the pun.

Hmm, actually wait — one more possibility for Q2. What if Li Lei deliberately said 牛屎 as a joke himself (self-deprecating: “I can only eat cow dung” = soft stuff)? The author’s reply" 没错… 只能吃 niushi 了 “uses pinyin deliberately, which suggests the double-meaning is the point. If Li Lei himself meant 流食 and the author heard 牛屎, then the author’s “没错” = playing along with the mishearing. If Li Lei meant 牛屎 jokingly, then niushi pun with 流食 still underlies it. Either way the pun 流食 / 牛屎 is the core. The n/l confusion clue then points to province. I think the intended reading (for the textbook) is: Li Lei said “流食” but pronounced it like “牛屎” due to his accent, and the author teased him by writing/understanding it as 牛屎.
Hmm, but actually in the text: 他说:“我这些天只能吃牛屎了。” — the author transcribed 牛屎, deliberately. Then 我大惊失色,“为啥?” — the author feigns shock (why cow dung?). Then he explains: 痔疮. Then “哦。” 我恍然大悟,“没错, 你痔疮好之前, 只能吃 niushi 了。” — the author connects: hemorrhoid → liquid diet → 流食 → which in his accent = 牛屎. The pinyin “niushi” is the punchline showing the author got the pun. So: the pun is 流食 (liúshí) vs 牛屎 (niúshǐ). Yes.
So for Q3: n/l confusion + mountainous hometown → 四川(含重庆)/ 湖南 / 湖北一带都符合,但最典型的是四川 / 重庆。Given “陡坡和山路” as the reason nobody bikes — Chongqing is THE famous no-bikes mountain city. But n/l confusion is also strong in Sichuan. Since Chongqing belonged to Sichuan and speech is similar, I’d answer: 很可能是四川(包括重庆)人;若只选一个,重庆的” 山城 “特征最吻合” 出门都是陡坡和山路 “。Also could mention Hunan/Hubei as possible but less iconic. Actually, for a clean answer: 四川或重庆(西南地区),因为 n/l 不分 + 山地地形。If forced to pick one province: 四川(或重庆直辖市)。
Hmm, let me reconsider — is there any other clue? “李雷说自己小时候生活的地方,出门都是陡坡和山路,所以一直也不会骑单车” — mountainous. “现在想学骑车,也是因为受了大街上共享单车的刺激” — no regional clue. 锅贴外卖 — potstickers are northern food but available everywhere; weak clue, possibly argues against deep south? Not strong.
So answer: 四川 / 重庆一带(西南地区);理由:①家乡多陡坡山路(山城地貌,自行车无用武之地);②n、l 不分,把 “流食” 说成 “牛屎”,这是川渝(以及湖南湖北)方言口音的典型特征,其中以川渝最为人熟知。若必须二选一,重庆(山城)与 “陡坡山路、无人骑车” 的吻合度最高。
Q4: Li Lei’s character: 爽快、热心(答应帮忙打气)、有点小精明(想借机学车)、有毅力 / 不服输(成年人从零学车,摔会了)、爱思考怪问题 / 有点抬杠(自行车发明者之问,被作者视为强词夺理)、爱挑剔找借口(嫌车头太灵活)、幽默乐观、自嘲、嘴贫(痔疮段子、锅贴歪理)、随性真实、不拘小节、孩子气。Overall: 一个可爱、真实、幽默、有韧劲的普通人。
Q5: 关系亲密的好朋友(很熟的朋友 / 死党):互相串门、经常见面、互相帮忙(打气)、共用私人物品(自行车)、开很私密(痔疮、拉屎)的玩笑而毫无顾忌。文中没有证据表明是恋人或同事,最合理判断是无话不谈的好朋友。
Now — should I search the web to check if this is a known article with a known answer? The questions are open-ended comprehension questions (“你认为…”), so no single correct answer needed; searching isn’t necessary. The article might be from 荞麦 or some author… Actually, I recall an article titled 《学骑车》or similar… The detail” 牛奶和巧克力色的喷漆 “永久公主车… This could be from” 一个 “(ONE) app. But the questions are clearly designed for the reader to infer, so my analysis stands. Per my guidance:“Default to not searching when you’re working over text the user already gave you.” The user gave the text; answers derive from the text. No search needed.
Language: respond in Chinese. Format: answer the 5 questions clearly, numbered, concise but with reasoning. Not too long. Use full-width punctuation. Should I use a todo list? No — simple Q&A. Should I use headers? A numbered list matching the questions is best.
Let me draft:
1. 痔疮患者排便本来就会疼;锅贴是油煎的干食,吃了容易大便干结,排便会更疼,所以作者 “吓” 他。李雷的回答是在抖机灵:他的意思是 “吃进去还能拉出来的东西” 并不是疼痛的根源——真正疼的是那个 “拉出来却回不去” 的痔疮本身,所以吃什么都无所谓。这句歪理既是在给自己管不住嘴找台阶,也透着苦中作乐的幽默。
2. 当然不是。这里是个谐音梗:医生建议痔疮发作期间吃 “流食”(liúshí,稀软、好消化、排便不费劲的食物),而李雷说话 n、l 不分,把 “流食” 说成了近似 “牛屎”(niúshǐ)的音;作者故意把它记成 “牛屎”,又用拼音 “niushi” 打马虎眼,一语双关地调侃他。
3. 线索:①小时候家乡 “出门都是陡坡和山路”,自行车派不上用场——典型的多山地区;②n、l 不分(“流食” 说成 “牛屎”)——这是西南官话区(四川、重庆)以及湖南、湖北一带口音的典型特征。两条合在一起,最可能的是四川或重庆人;其中重庆是著名的 “山城”,与 “陡坡山路、没人骑车” 的描写吻合度最高(重庆 1997 年前也属四川,口音相近)。所以最合理的猜测:川渝一带的人,若只选一个,重庆(或四川)。
Hmm, the question says “中国哪个省份” — expects one province. I’ll say 四川(或重庆,二者口音地貌相近;若严格按” 省份 “,可答四川)。Actually let me phrase:” 大概率是四川人(含重庆)“and explain. Or should I consider Hunan? Hunan is also mountainous and n/l 不分 (actually the n/l stereotype is strongest for 湖南、湖北、四川、重庆、江西、南京). The” 陡坡和山路 “fits 重庆 best. I’ll present 川渝 as the leading guess with reasoning, noting Hunan/Hubei also have the accent but the “mountain city, no bikes” image fits Chongqing/Sichuan best. Keep it decisive: 四川 / 重庆,首选重庆。
Hmm wait, also consider: maybe the article is by 巫昂 or someone and 李雷 is known to be from somewhere? I can’t verify without search; but the question explicitly says” 根据文中给出的多个线索,请猜 “— so it’s an inference exercise. Fine.
4. 李雷是个什么样的:爽快热心(一口答应帮忙打气)、带点小机灵(爽快背后是 “想蹭车学骑”)、有股不服输的韧劲(成年人从零开始,硬是学会了骑车)、爱琢磨怪问题、有点爱抬杠 / 找借口(质疑自行车发明者、嫌 “车头太灵活”)、幽默乐观、善于自嘲、嘴贫(“吃牛屎” 的段子、“吃进去再拉出来的不疼” 的歪理)、随性、管不住嘴、孩子气。总之是个真实、可爱、不装的普通人,有点糙但很有趣。
5. 无话不谈的好朋友(关系很 “铁”):作者去他家串门、两人隔三差五见面、他愿意为作者下楼打气、用她的车学骑、连痔疮、拉屎这种私密又尴尬的事都能毫无顾忌地拿来开玩笑。文中没有恋人或同事关系的迹象,就是一对损友式的好友。
Length: moderate. Use numbered structure with bold question restatement? Keep concise. I’ll write the answers with brief reasoning each. This is conversational, so no files needed, no citations needed.
One more consideration on Q1’s exact meaning. Let me re-read the final exchange:
可一回头他就点了个锅贴的外卖。
“吃锅贴拉屎可疼了。” 我说。
“吃进去再拉出来的不疼。”
The author: “Eating potstickers → pooping will really hurt” — because 锅贴 is fried/greasy/solid, contrary to the 流食 he claimed to need; with hemorrhoids, passing hard stool is painful.
Li Lei: “吃进去再拉出来的不疼” — literal: “What is eaten and then pooped out doesn’t hurt.“Implied: what hurts is not the poop but the 痔疮 — i.e., something that didn’t come from eating and doesn’t get pooped out (it popped out and stays). So his quip means"it’s not the food’s fault; the pain is from the hemorrhoid, so I might as well eat potstickers.“It’s deadpan logic-chopping humor. My answer captures that.
Also possible simpler gloss for Q1: 李雷在抬杠——把 “疼” 的原因从 “屎” 推给 “痔疮”,为自己的嘴馋辩护。Yes.
Format: I’ll use numbered items matching the five questions, each with a short bolded answer line plus explanation. Keep it readable, not overly long. Chinese punctuation throughout.

知乎用户 德川家康薛定谔 发表

我还是用 deepseek 吧,蹬起来不心疼。

知乎用户 SnowyLake​​ 发表

毫无竞争力的定价,这也是国内靠 SOTA 竞赛叙事的 AI 公司所面临的共同困境:

SOTA 竞赛是极其烧钱的,企业需要愈发高昂的定价来支撑研发成本;可对于那些真正有能力和意愿支付高价的专业用户而言,他们可以也更倾向选择全球范围内真正的 SOTA 而非国产替代,至于剩下那些用不了国外模型的用户们,他们又大多没能力和意愿支付这 100 元 / 1M 的高价——哪怕这个所谓的高价实际已经比 Fable/Sol 便宜太多。

知乎用户 阿尔吉侬 发表

会动的鹈鹕骑自行车!

骑自行车的鹈鹕

价格已经能对标 a÷ 之外的正价一线模型了,之前我就是这样被十五刀的 gemini3 偷袭的。

harness 有点说法,设计了网页 / svg 还会调用工具截图看看,然后倒回去改。不知道是原生多模态还是外挂的识图。

据说文笔很好,等一个没有外审的第三方 api。

感觉有点梦回 gemini2.5 了啊。希望能超越文笔世一模了一年多的 gemini2.5。


等等,想起个重要的问题,孩子们这次月暗有承诺开源吗??!?抱抱脸上好像还没动静啊!

谁知道啊,这对我来说真的很重要(黄脸大哭)(黄脸大哭)(黄脸大哭)

知乎用户 忻致知​ 发表

这个事儿…… 怎么说呢?

他们要开源啊,开放权重啊,2.8T 欸,开源巨模欸。

开源,说实话,就是让千千万万个中小服务商自个儿部署去的。

然后一方面 Kimi 可以整(相对的)高价,一方面真的嫌贵的可以自己整个模型自己跑。

这样相对来说官方的服务器就没有那么大的压力了

此事在隔壁的 GLM 那儿亦有记载,Coding Plan 又贵,官方对 C 端又相对懈怠。

说白了就是 744b 嘛,2bit 量化甚至 “勉强算” 消费级别 PC 的 mac studio 插满内存也不是不能跑级别,那大伙儿就别挤在官网那里了,自己想办法分流吧

当然只是理论上这么说,实际上 Coding Plan 现在还是挤官方那边的啦,各家都是这个样儿。

但如果搞得和隔壁大鲸鱼那么便宜的话,用的人就没有自己部署的必要了,然后大鲸鱼服务器就处在一个——有时候 DS 更新点东西,有时候啥都没干,然后大伙儿一群人发现,欸,大鲸鱼又挂了。

GLM 则是同样神奇,官网的路线常常卡了爆炸不说,连第三方服务的硅基流动有的时候都会莫名其妙的炸路线,按道理自己部署的不该出现这种情况啊,难道这种稳定度还和模型优化有关的?

但我自己没订 kimi 的服务,具体用要等硅基流动接 K3 的 API 的时候再稍微用两下试试了。

Coding Plan 里我看好像没有全供应 1M 上下文,但 API 的话…… 应该是会供应的吧?

哇,主要他正经开源之后,开源巨模就拉到 2.8T 这个参数级别了,别管家用机跑不跑得动了,真正意义上的那种可以用来打游戏的家用机早在 130B 这个规模就差不多全挂了,后面的无论多大其实没那么大的区别了,某种意义上来说开源巨模只要性能够到位,参数越大大伙儿越开心,因为能后训练,能调,能玩的潜力大呀。

服务器总归跑得动就行。

所以嘛,还是之前那句话,什么时候上开源 5T,具体怎么后训练自家可以搞,不行还可以让伟大的 GLM 上,想想还有点小期待呢~

知乎用户 AyanamiArena 发表

这个价格,你给我一个不用 gpt5.6 的理由呗?

以前我认为价格不能按 coding plan 用满折算 api

但是你这玩意咋算都是贵啊

等开源了看看公司给不给私有部署吧

自己花钱就算了

知乎用户 崔磊​ 发表

看了下国内外对新模型的评价,大家对性能和价格都达成了共识。

价格比之前的定价贵了很多,但比 A / 还是要便宜至少一半。

这个定价策略的初衷,其实就很明显了。

贵么?

但是核心在于:

中国用户用不了 claude,即便能用也是提心吊胆时刻面临封号风险,而且使用过程质量得不到保证,还有后门风险。

现在好了,你们能用一半的价格,毫无阻碍安安心心用到同等能力的国产模型了。

更何况,一半的价格,本身需求面会更大,对于中国程序员绝对的利好。

讲真,我一个纯外行,都想订阅 699 的,来试试实现我的想法。

贵?量不够?

我在考虑要不要 kimi 配合 deepseek 高低搭配了。

其实最关键的是,我们已经看到了国产模型正在快速接近闭源模型的趋势了,难以想象明年的这个时候,国产模型会发展到啥程度。

到那时,也许新模型更贵,但老模型性能足够也完全满足需要且价格亲民呢。

知乎用户 坐忘道骰子 发表

cursor 的 Composer3 底模来了,加上后训练能不能在编程上超过 fable5 和 soul 了?

知乎用户 无余的圣化铺 发表

3T 级别 + 开放权重,SOTA 价格和接近 SOTA 的 性能 [捂脸]

卡现在感觉已经不重要了,全在卷数据和后训练,这恰恰是开源 + 国产的优势啊?不正是上一代安卓和鸿蒙干翻 iOS 的翻版,而且 LLM 还不需要培养生态和联盟成本,干爆闭源指日可待

知乎用户 大白兔奶糖 发表

拆分会员还没上,目前的会员体系,三档之前和编程无缘,一个任务没跑完,就进 5 小时防沉迷,纯天坑。

作为一家营销意愿比较强的公司,也没推一下自家新产品,只能看到零碎的自媒体瞎几把吹。

也没有喜闻乐见的撒币(重置额度)环节。

只能说,不急,再等等。

知乎用户 Afterwards​ 发表

我三个月前提过,过去两年,美国那三个顶尖 lab 都有内部超大号模型。用它们做用户问题的推理,毫无经济性可言,所以它们从未上架。但它们的答案可以用来训练小几圈的模型。每个实验室都有各个尺寸的小几圈的模型。它们具体发布哪个,是根据市场定位权衡的。

知乎上天天讨论的模型 “谁强谁弱”,和实验室的技术积累,其实关系真心不大。比如,过去一年,Anthropic 模型的口碑最好,但他们的技术路线据说极其保守。他们模型的成功靠的是找到了几个价格和能力的甜点,这个甜点比其他厂的模型大小大一圈,能力自然更强。

判断实验室的技术能力一个好办法可能是 pound-to-pound 比较同一尺寸模型的表现。根据 artificialanalysis 的模型能力评估,过去半年,智谱的顶尖模型一直是同大小模型中最出色那个。在智谱最强的模型之下,基本上每个大小对比中,最强的模型都来自于中国实验室。但是,中国实验室由于市场定位和资源有限,从未试图挑战训练更大尺寸的模型。

kimi K3 这 24 小时在大量测试中表现极其出色。它毫无疑问做到了 “不比它大一圈就不如它”。它的上架意味着模型大小 / 能力整个帕累托前沿几乎都是中国模型。但它并不代表着技术上有什么突破。更多的只是 kimi(正确地)意识到了全世界都愿意为一个稳定可靠的 3T 大小的模型付费。它也意味着,Kimi 的扩张目前暂时不受算力不足影响。这让有些公司的 capex 显得极其离谱。

如何评价 Anthropic 这个据称强到不敢直接发布的大模型 Mythos Preview?

知乎用户 小鬣狗 发表

接下来 DS V4 GA 版的价格将决定他是梁圣、梁子还是牢梁

知乎用户 凌云 发表

一直没用国模

但这几个月来,从 GLM-5.1 开始,大家就在说 “跟 opus 差不多了”,GLM-5.2 被一堆人说是又一个 DeepSeek 时刻,据说 “真正” 追平了 opus。怎么又来一个 kimi 说是 “真正” 追上了 opus?我是在玩什么拼多多砍一刀游戏吗?

知乎用户 neether 发表

完全意料之中的事情

做模型这块是个纯脑力行业,就像大家嘲讽的,现在是在美国的中国人 VS 在中国的中国人。比脑子又不差的

差只是差在算力上,kimi 之前买了一堆卡,用上了就通了

知乎用户 板本龙贰 发表

好用是好用的,发布的时候正好在 coding,切掉一个新 session 执行相同的任务明显感觉聪明了很多。但是太贵了,最近国模也会有 N 多新模型要发,这一波说不好感觉已经贵到可能会影响到用户留存了。。。

知乎用户 赵拓 发表

中国 AI 发展,乃至全世界开放模型的里程碑式成就。

知乎用户 奶茶 发表

code plan 的 glm5.2 算下来输出 token 价才 1 元 / M,即便买不用抢但是贵一倍国际版,也才 2 元 / M,K3 这个 100 元 / M 的标价我不信能拿到 c 端份额。

Kimi 199 的 code plan 算下来是打 1 折,也就是 10 元 / M

而且只是因为抢先发布超大规模模型所以有一点代差 / 时间优势,别人发布同样大规模的模型,出 token 又快又好的时候,谁还用你的呢?

知乎用户 sxfreesky​ 发表

许愿机能力上,目前 (20260716) 是毫无疑问的国内第一,开源第一,甚至可以叫板 fable5 和 gpt5.6。

但对实际工程的处理上还是有很多不足,很多是 k2 系列延续下来的问题了,还没有完全解决。

性价比上,只能说给国内用不上 fable5 的一个替代选项。就看这个垄断期能持续多久了。

知乎用户 GNUBULL 发表

菲尔兹奖得主 dengyu 邓神中学遇到的 这道题 测试了下模型的纯推理能力

kimi k3 基本 10 分钟找到思路(已经出现正确答案的数字),第 20 分钟完成解题和验证,第 30 分钟完成证明。

求最小的正整数 n,使得 1/n 的二进制小数表示中能够包含 1, 2, 3, … , 1990 各个数字的二进制表示。 注意这是一道数学题,不允许编程暴力求解,不允许联网查询。

kimi k3 思维链是英文的,这个和 k2.6 不同,

思维链: 点击链接查看和 Kimi 的对话 Kimi | 二进制数覆盖 1990

解答输出:

知乎用户 一枚武僧 发表

今天谷歌的 Gemini 又延期了,只是纯好奇,为什么强如谷歌都无法做出这么强的模型,kimi 却可以,而且还是在缺卡的情况,是因为人才储备,还是什么原因呢?

知乎用户 还是不注名好 发表

现在无论是 benchmark,还是 one shot app 网页什么的,模型都背烂了。

你应该去测实际的任务里的表现。

然后你就会发现 10 分钟 699 套餐的限额就消失了,根本测不了一点。

所以本质上还是 anthropic 那套营销叙事——用的人越少,one shot app 的营销号占比越大,模型风评越好……

喜欢这个叙事吗?识破了吗?人家 box 里还有一百种其他的营销叙事,来 overfit 你那个几十个参数,幻觉严重的估值模型呢。市场经济嘛。

只能说现在大模型领域的人看金融圈的人,什么巴菲特孙正义索罗斯什么的,就像大人看小孩一样……

更别说厉以宁高善文朱啸虎李开复之类了,那是婴儿。

知乎用户 didy 发表

正好用手上一个项目试试. 有个非常明确的需求, 完成一个 BVH 实现的性能优化.

这个 BVH 算法原本用 c++ 实现, 能对测试工件在 500ms 以内完成索引和轮廓提取. 现在业务需要, 已经移植到 python, 但用时需要 6000ms. 现在希望优化到 500ms 以内.

现在用 git worktree 开出三个文件夹, 让三位选手同台竞技:
1. Kimi code + K3
2. Antigravity + Gemini 3.5 Flash
3. OpenCode + DeepSeek V4 Flash

先说对 K3 的体感

  1. K3 智能程度看上去比 K2.x 提升了, 因为我偷窥了它的思考细节, 发现其中有很多假设, 求证, 反思过程. K3 自行做了很多任务分拆, 写测试找到各个环节的耗时并设法解决, 看上去煞有其事, 并没有应付了事的意思.
  2. 但是太慢了, 慢到什么程度呢? 蹦 token 的速度远小于我的阅读速度, 以至于我可以清清楚楚看清它的全部思考 / 纠结过程.
  3. 我使用了 Kimi Code 的 VSCode 插件. 思考过程中的新提示词无法 whirling, 只能 queued. Kimi Code 没有这个问题.

然后赛况如下:

1. 第 7 分钟 Antigravity + Gemini 3.5 Flash 首先交卷

第一轮结果, 从 6000ms 优化到 2955ms, 在我的坚持下, 第二轮优化到 831ms, 第三轮优化到 388ms, 总共用时 15 分钟.

代码输出完全和原式输出一致 (结果正确)

2. 第 20 分钟 OpenCode + DeepSeek V4 Flash 交卷

20 分钟跑出第一轮结果, 优化到 473ms.

代码输出完全和原式输出一致 (结果正确)

首次交付成绩不错. 此时 Gemini 已经跑完, 所以没有继续 push DeepSeek 让它做第二轮优化, 而是直接进行了一次方案对比, 发现都各自的方案有所差别, 融合两者的方案后, 性能优化到了 104ms.

3. 2 小时 25 分钟 Kimi code + K3 终于交卷

期间经历了一次无响应, 我手动重启了一下.

最终优化到了 158ms!

首次交付成绩超过了前两者, 融合方案后, 用时为 108ms, 和上一次融合方案持平.

汇总如下:

Gemini Flash(首轮)Gemini FlashDeepSeek FlashK3融合方案
交付成绩2955ms388ms473ms158ms104ms
交付用时7 分钟15 分钟20 分钟150 分钟N/A

这个结果很有意思

就首次交付成绩来看, K3 的 158ms 强于其它选手. 不过它花了接近 10 倍的时间.

但如果考察最终成绩, Gemini+DeepSeek 的多轮融合方案也能在更短的总时间内到达最佳效果.

我觉得 K3 的首轮成绩确实是惊喜, 但如果让我选择, 我目前还是更倾向 “天下武功唯快不破”, 两个半小时解决这个问题确实有些太慢了. 当然有可能是 K3 刚上线用得人太多导致拥堵. 如果 K3 的速度不说比得上 Flash, 至少赶得上 DeepSeek V4 Pro, 那就非常非常能打了!


更新预算费用对比

Gemini 3 FlashDeepSeek V4 FlashKimi K3
方案AI UltraOpencode GoAllegretto
月费$99.99$10RMB199
消耗月额度0.3%0.17%3.8%
折合费用2.1 元0.1 元7.5 元
上下文占用14%13.3%
总 Token 消耗138,862415,013

更新体会

直接用 K3 写代码确实慢, 但用它来审核代码和方案却非常合适.

写代码这种脏活直接交给速度快的 Flash 模型处理, 然后让 K3 审核. 经过几轮尝试, K3 的审查非常独到, 不会盲信报告, 会敏锐的发现方法论上的问题, 会主动验证关键证据, 审核质量非常高.

知乎用户 深湖 发表

价格太贵。

Kimi 199 的订阅据说周额度是 500 人民币左右。GPT plus 周额度大概是 90 美元左右。

如果额度都用完的话,Kimi K3 的折算价格跟 GPT 5.6 sol 价钱是差不多的。当然,Kimi 的上下文更长。

知乎用户 清河崔氏时宜 发表

AI 泡沫破裂的时间点就在眼前了,GLM 和 Kimi 的成功已经证明了大模型根本就不需要 GPT 或者 Anthropic 那样天量的投入,每年万亿美元的投资目前看来就是镜花水月,注定会成为美国版的烂尾城投债。区别在于城投债还能转化为铁路桥梁地铁高架这些基建提升交通效率,而过剩的 GPU / 存储 / 光通信模块转化不了任何东西,只能在仓库里等着折旧报废。

就日经 / 韩股 / 国内科技股的近况来看,这波行情基本也已经走到头了,美国科技巨头的宏大叙事终究难以为续,营销出的天量泡沫未来必将被老中低投入的开源模型戳破。AI 是改变人类生产力和生产方式的重要科技主线,但是在未来大概率类似中国移动 / 中国电信这样偏向基础设施建设的方案提供商,而不是具有垄断性质和暴利的科技巨头。换句话说,这个行业本身其实也不具有什么门槛,注定和光伏一样被低价卷死。

至于那些花了几乎全部现金流押注 AI 的美国科技巨头和指望依托 AI 带来的需求拯救的美债和美国经济怎么办?只有天知道。

最简单好用的 VPS,没有之一,注册立得 100 美金
comments powered by Disqus

See Also

【立此存照】“全面排查Claude Code等境外编程智能体”

7月8日,中国工业和信息化部旗下的“国家信息安全漏洞共享平台”(CNVD)发布文章,警告美国Anthropic公司的编程智能体Claude Code存在“隐蔽检测机制”,称该工具会对位于中国时区的用户、以及通过代理使用Claude系列大模型 …

中国人工智能的制胜之道

中国人工智能的制胜之道 作者:JASON HSU 2026年7月23日纽约时报 三年来,中国政府一直把它最强大的人工智能免费向所有人开放。然而,这样的慷慨从来都是不会持久的。据报道,中国当局一直在与阿里巴巴、字节跳动以及初创公司智谱AI会 …

中美人工智能发展策略截然不同

中美人工智能发展策略截然不同 作者:ROSS DOUTHAT 2026年7月18日纽约时报 冷战初期,就在美苏两国进行无休止的核军备竞赛的同时,双方也将核技术视为软实力与外交的工具——一种可以共享和出口的资源,是巩固同盟、表达友谊的信物。 …

在中国,我们看到了本世纪的最大挑战

在中国,我们看到了本世纪的最大挑战 作者:ERIC SCHMIDT, SELINA XU 2026年7月11日纽约时报 人类正行走在一条危险的钢丝绳上。 我们的世界面临一个抉择:人工智能革命将如何展开,以及应该划定怎样的界限。过度谨慎可能会 …

美国能避免出现“马云时刻”吗

美国能避免出现“马云时刻”吗 作者:DAN WANG, JULIAN GEWIRTZ 2026年6月28日纽约时报 一位在全球享有知名度的科技高管因筹备公开上市而情绪高昂,发表了批评政府的不审慎言论。国家随即发起了超出所有人预期的强硬反击。 …