📚 本文是 AI 工具完全指南 系列之一。想看 K3 和 GPT-6 Astra 正面刚编程的,看这篇 四模型 Cursor 复刻横评;想看国产 AI 助手日常怎么选的,看 豆包/Kimi/DeepSeek 实测

7 月底 Kimi K3 开源那天,Hugging Face 趋势榜半小时就被顶到第一——2.8 万亿参数,迄今最大的开源模型。但参数是参数,大多数人更关心的问题是:这东西我怎么用上?写代码到底行不行?和 Qwen3.8、GLM-5.3 这些同期旗舰比怎么选?

这篇文章就讲这三件事:注册上手、编程实测、横向选型。全程不需要翻墙,不需要海外信用卡。

30 秒速答

  • 怎么用:打开 kimi.com 注册登录,模型选 K3,基础聊天/文件上传/联网搜索全免费
  • 编程强在哪:1M token 上下文吃整个代码库;Terminal-Bench 2.1 88.3 分,开源第一梯队;长程工程任务(SWE-Marathon)领先 GLM-5.3 和 Qwen3.8
  • 短板:免费层高峰期可能排队;编程实测里前端审美不如 GPT-6 Astra;2.8 万亿参数注定与个人本地部署无缘
  • 和同行比:长程工程选 K3,前端选 Qwen3.8-Max,攻坚 debug 选 GLM-5.3
  • 想对比海外旗舰:GPT-6 Astra 国内上手走 环球巴士 镜像版 28.88 元/月起,优惠码 Tanqingbo 再 9 折

一、Kimi K3 是什么:把 2.8 万亿参数翻译成人话

先泼盆冷水:「2.8 万亿参数」不等于它比谁都强,参数规模和实际体验不是一回事。K3 真正值得关心的三个点:

  1. 1M token 上下文。这是 K2 系列 256K 的 4 倍,意味着你能把一整个软件项目、几十份 PDF 报告一次性丢给它,让它交叉分析。这是 K3 最实在的能力,后面实测会用到。
  2. 编程是主战场。K3 的训练方向就是软件工程和长周期任务,编程基准稳居开源第一梯队。
  3. 免费就能用。不是试用陷阱,是正经的免费层。

架构上稍微展开一句(不耐烦可跳过):K3 用的是 Stable LatentMoE 设计——896 个专家里每个 token 只激活 16 个,约 104B 激活参数。总参数决定它「知道多少」,激活参数决定它「跑多快」,这就是它能同时做到超大和可用的原因。

二、注册上手:三种入口,全免费

入口一:网页版 kimi.com(最快)

打开 kimi.com,手机号或微信登录,新建会话后在模型选择处选 K3——新建会话默认就是它。

第一次用建议拿个小任务试水:上传一份十页 PDF,让它列结构、关键数字和三个疑点。感受一下 1M 上下文处理长文档的体感。

入口二:手机 App

iOS/Android/鸿蒙应用商店搜「Kimi」,认准月之暗面官方出品。手机端适合拍照提问、传图传文件,复杂任务再转电脑。

入口三:Kimi Work 桌面客户端(非程序员最值得装)

这是月之暗面 2026 年 6 月推出的桌面 Agent,最新版已接入 K3,Windows 和 Mac 都有。它和网页版的本质区别:能直接读写你电脑上的本地文件、控制浏览器、定时执行任务、一键生成 Word/Excel/PPT——对标的是 Codex 和 Claude Desktop 这类桌面 Agent。

不写代码的人,Kimi Work 是最能感受到 K3 提升的地方:不用手动上传下载,交代一个目标它自己推进并产出成品文件。

免费额度说清楚

免费层(官方叫 Adagio)包含:基础聊天不限次、文件上传、联网搜索,注册全程不需要绑卡。这个覆盖面日常用完全够。

需要注意的两点:一是免费层在高峰期可能排队或限流,重度使用可以考虑会员;二是会员和 API 是两套独立体系,充了 API 不会解锁会员功能,别搞混。

三、编程实测:K3 vs 三个海外旗舰

这是我固定的测试题:克隆 VS Code 开源代码,做一个支持 Editor/Agents 双窗口切换的 Web AI 编程工具。同一句提示词,先后喂给四个模型:

模型 复刻结果 用时
Kimi K3 跑通核心功能,界面比较简陋 半个多小时
Claude Opus 5 还原度高,但跟 VS Code 太像,没自己想法
Claude Fable 5.1 完成度最高,逐文件审阅改动都做了
GPT-6 Astra 有自己的产品想法(自创 orbit 品牌),视觉最好 约 23 分钟

K3 的表现一句话概括:工程能力在线,审美差口气。核心功能它是真跑通了——文件树、编辑器、双窗口切换都能用,但界面确实糙,和 Astra 那种自带品牌设计的成品有肉眼可见的差距。

这和基准成绩是自洽的:K3 在 Terminal-Bench 2.1 拿 88.3(开源第一,仅次 GPT-5.6 Sol 的 88.8),DeepSWE 67.5、SWE-Marathon 48.1 都是同档领先——解决工程问题的硬实力没问题,缺的是前端审美这种「软实力」。前端视觉要求高的项目,目前还是 Astra 或 Qwen3.8-Max 更合适。

四个模型的完整实测过程和成品截图,看这篇:GPT-6 Astra 写代码实测。想在国内上手 Astra 对比着用的,环球巴士 镜像版 28.88 元/月起是最省事的入口,支付宝付完就能用,新用户首单 9 折,**优惠码 Tanqingbo**。

四、Kimi Code:程序员该怎么用 K3

上面是「网页里聊着写」,K3 还有专门给开发者的形态——Kimi Code,一个编程 Agent,有 CLI 和 VS Code 插件两种形态,直接对标 Claude Code。我另一篇 Claude Code 教程 里也提过,国产平替里最像样的就是它。

安装三步:

# macOS / Linux
curl -LsSf https://code.kimi.com/install.sh | bash

# Windows(PowerShell,需先装 Git for Windows)
Invoke-RestMethod https://code.kimi.com/install.ps1 | Invoke-Expression

装完重启终端,kimi 启动,然后:

  1. /login 用 Kimi 账号 OAuth 登录
  2. /model 选 K3(日常补全不必开最高档,大型重构再上 High/Max)
  3. **先 /plan**:让它先读仓库、列出要改哪些文件、风险在哪、怎么验证——确认计划后再放它动手

几个高频命令:@文件名 引用项目文件、!命令 执行 Shell、/compact 压缩长会话、/usage 看额度消耗。

安全提醒:别对生产仓库直接开 YOLO 模式(自动批准所有操作)。先在分支或副本里验证,K3 的改动质量总体可靠,但回滚成本永远高于确认成本。

五、K3 vs Qwen3.8-Max vs GLM-5.3:国产三旗舰怎么选

这三个模型正好代表了国产旗舰的三种路线,放一起看最清楚:

维度 Kimi K3(月之暗面) Qwen3.8-Max(阿里) GLM-5.3(智谱)
发布 7 月,2.8 万亿参数 8 月,2.4 万亿参数 8 月,7530 亿(同 5.2 基座后训练)
上下文 1M token 1M token 256K
Terminal-Bench 2.1 88.3 86.6 88.2
Terminal-Bench 3.0(更难) 17.4 29.0(0902 版) 28.3
最强项 长程工程、大上下文 前端(WebDev 榜 1691 登顶)、Agentic Index 全球第一 工程攻坚、网络安全
免费使用 kimi.com 免费层 通义千问 App/网页 智谱清言 App/网页
API 价格 ¥20/¥100 每百万 tokens $2/$6 每百万 tokens Flash 版 $0.15/$0.50

几个说明:

  • Qwen3.8-Max 的 0902 版(9 月 2 日刷新)在 Code Arena WebDev 盲测榜以 1691 分登顶,是首个登顶该榜的中国模型,前端能力目前国产最强。
  • GLM-5.3 是「同基座纯后训练」的典范:和 5.2 用同一个底座,只靠后训练把智能指数从 53 拉到 60,编程提升 50%——智谱管它叫「专为编程而生」,攻坚 debug 和多模块重构是它的主场。
  • 基准分数不同实验室口径不一,表格看趋势别抠小数点,三个模型的差距远小于它们和第二梯队的差距。

选型建议直接抄

  • 要读大代码库、跑长任务、批量分析文档 → K3(1M 上下文 + 长程工程最强)
  • 前端开发、要好看的成品 → Qwen3.8-Max
  • 死磕难 Bug、大型重构、安全相关 → GLM-5.3
  • 日常问答办公 → 三个都行,哪个顺手用哪个,反正都免费

六、避坑清单

  1. 旧会话别直接切 K3。历史上下文会污染效果,官方也建议开新会话。每个独立任务新开对话,上下文干净还省额度。
  2. 思考档位别无脑拉满。K3 始终运行思考模式,分 low/high/max 三档,短问题开 Max 纯属浪费时间和额度。日常 Low、跨文件任务再提高。
  3. 1M 上下文不是「全倒进去」。几十个不相关文件一锅炖,再大的窗口也白搭。给清楚范围和优先级,让它知道找什么。
  4. API 和会员是两套账。充 API 不解锁会员,订会员不给 API 折扣,按需选一边。
  5. 「开源」和「本地跑」是两回事。2.8 万亿参数 MXFP4 也要约 1.4TB 显存,普通用户网页/App 就是完整体验,别琢磨本地部署了。

写在最后

国产旗舰这一波的实感:基准分数上,K3、GLM-5.3 已经和 GPT-5.6 Sol 贴身,Qwen3.8-Max 在前端反超;工程能力的长板(K3 的长程任务、GLM 的攻坚)甚至能压海外同档一头。真正的差距剩在前端审美、Agent 生态和极端场景的稳定性上——而这些恰恰是迭代最快的部分。

对普通用户的建议就一句:都免费,都试试,让任务选模型。想横向体验海外旗舰做对比的,GPT-6 Astra 的上手指南在这里:GPT-6 Astra 国内使用与购买指南


相关阅读: