​ 这期内容是我对自己经常使用的免费ai工具做一个分享。本分享只分享ai工具自带的免费额度,不分享api,因为api经常不稳定,限速,很多制度不透明。以后打算每次这几个平台有更新,或者有新的平台出现,我会接着出第二期,第三期等。

这篇文章是我自己实测使用记录整理出来,五款平台的免费积分规则、每月能白嫖多少、免费模型怎么选,都分享给大家,基于自己的经验分享,不一定百分百准确,有不准的也希望大家指正。本次分享时间有效期2026年9月,因为ai工具不断争用户,活动一直在变。有更新我会及时同步。

免费额度积分

平台免费额度积分基本是这三种方式来的:

  • 注册或邀请赠送:一次性到账,通常 30 天左右有效,是新人第一个月的大头。
  • 每月登录:每月固定送一笔,当月有效,下月刷新。
  • 每日签到:每天一点,有效期跟随活动走,一般是 30 多天。

这些积分都有有效期,如果每月能领的积分或者当日积分都能用完,那么实际能最大使用的积分如下图。下面这张图是我按 2026 年 9 月实测整理的各平台对比。如果有新的好用的平台,欢迎大家推荐。

各平台每月免费可得积分对比(2026-09 实测口径)
各平台每月免费可得积分对比(2026-09 实测口径)

五款平台横向对比总览:

平台注册/邀请赠送每月登录每日签到新人首月老用户每月最经济模型
TraeWork2000 通用 + 2000 Work(31 天)500150(约 31 天)约 9000约 5000Seed-Code(多模态)、Deepseek-V4-Flash 正式版(文本)
WorkBuddy2000(30 天)500100(30 多天)约 5500约 3500GLM-5.3-Flash(多模态)、Deepseek-V4-Flash(文本)
千问办公2000(90 天,据公开信息)100(当天有效)约 5000每日 100标准模式 0.1X 倍率,极耐用
美团 CatPaw1000200无签到1200(次月起每月 200)200LongCat-2.0(免费)
OpenCode免费模型,无限额但有限速见下方模型排名

WorkBuddy:新人一个月 5500 分

​ WorkBuddy 走邀请链接注册送 2000 积分,按注册之日起 30 天内有效;每月登录送 500 积分,当月有效;每日签到 100 积分,一般跟活动走,有效期30 多天。

​ 老用户没有注册礼,靠登录加签到,每月有约 3500 积分。

​ WorkBuddy 官方一个月 4000 积分的套餐卖 99 元。按这个单价折算,5500 积分约等于每月 136 元。也就是说,新用户头一个月白拿的额度,比一个付费套餐还多;老用户每月也有约 87 元。

​ 模型方面,免费档是 hy3 和 Hy4 preview。想省着用,除免费模型外,多模态建议选 GLM-5.3-Flash,纯文本选 Deepseek-V4-Flash,这两款是目前性价比最高的。

TraeWork :新人首月 9000 分

​ TraeWork 是字节系 AI 原生 IDE Trae 在 2026 年 7 月上线积分体系后推出的 Work 模式玩法,免费额度给得最足。走邀请链接注册,一次性送 2000 通用积分和 2000 Work 专属积分,31 个自然日有效;每月登录送 500 积分,当月有效;每日签到 150 通用积分,一般跟活动走 31 天。

​ 新人首月约 9000 积分,老用户每月约 5000 积分,五家里排第一。

​ 模型上:多模态用 Seed-Code(注意它只在 Code 模式下显示),文本用 Deepseek-V4-Flash 正式版,最省钱。

千问办公:注册赠送 2000 积分

千问办公注册赠送 2000 积分(据公开信息有效期 90 天),每日登陆给 100 积分,当天有效。

标准模式按 0.1X 倍率消耗(使用模型是qwen3.8flash),非常耐用。按官方公开测算,1000 积分大约能完成 322 份 Word、556 份 PDF、100 份 PPT、45 份 Excel 或 119 份 HTML 报告。

如果你主要是文档处理、报告生成这类办公场景,千问办公的积分是最经花的。

OpenCode:有免费模型

OpenCode 有免费模型,但有速率限制,而且官方没有公布限制细则。

它的开发公司是 Anomaly Innovations(GitHub 上叫 anomalyco),总部在加拿大多伦多,软件面向全球用户,所以限速策略和地区相关。

我自己用下来,偶尔会碰到限速变慢,换个时间段或者换个地区网络节点,通常就缓过来了。当补充额度用,很合适。

OpenCode 免费模型

OpenCode 免费档可用的模型有 Muse Spark 1.3 Contributor、Nemotron 3 Ultra、MiMo-V2.5、Nemotron 3.5 Lightning、Ling 3.0 Flash Fin,另有一个匿名代号 Big Pickle(底层模型不确定)。排名整理如下:

排名模型判断
1Muse Spark 1.3 Contributor上限最高;如果免费端调用的是完整 1.3,只是 Contributor 数据条款/额度不同,它应是这组最强
2Nemotron 3 Ultra深度推理、代码审查、长任务强;但速度和免费端稳定性可能不如 Muse
3MiMo-V2.5多模态、长上下文、日常 Agent 很强;但注意不要把 MiMo-V2.5-Pro 的编程成绩直接套过来
4Nemotron 3.5 Lightning速度和批量执行优秀,适合简单修改、测试、工具调用;复杂工程明显低于 Ultra
5Ling 3.0 Flash Fin金融、表格、财务代码可用;通用软件工程不建议优先
不排名Big Pickle匿名代号,底层模型可能变化,没有稳定模型身份和公开编程基准

美团 CatPaw:注册送 1000,每月再送 200

​ 美团在 2026 年 7 月上线了全场景 AI Agent 平台 CatPaw。注册送 1000 积分,每月再给 200 积分,没有签到。

免费模型是 LongCat-2.0。每月 200 积分加上免费模型,轻度使用够了;它的强项是结合美团内部能力的日常办公和业务协作。

模型怎么选

排名整理自公开跑分和实测口碑,分文本模型多模态模型编程综合能力图片处理能力四张表,按梯队从高到低排,每个模型附一句话定位。

文本模型

模型梯队跑分依据实际体验口碑
GLM-5.3第一梯队Terminal-Bench 3.0 得 28.3 开源最佳、DeepSWE v1.1 66.9、Z.ai Code Bench High 档 31.4% 超 Opus 4.8 且 token 仅其 42%实测口碑最稳的开源一哥:体感较 5.2 提升 50%,token 效率实测占优,ZCode 实测顺畅
DeepSeek-V4-Flash 正式版第一梯队(性价比)Terminal-Bench 2.1 得 82.7(超 GLM-5.2)、DeepSWE 7.3→54.4、AA 智能指数 52性价比之王:缓存命中价极低,官方自认部分编程任务反超 V4-Pro
DeepSeek-V4-Pro 正式版官方跑分第一梯队/体验存疑Terminal-Bench 2.1 得 87.9(距 Fable 5 仅 0.1)、DeepSWE 62.7、CyberGym 83.3体验翻车:AA 仅 53 分未复现官方数据、Codex 实测 4100 万 tokens 后不推荐、前端远低预期、对官方 Harness 过拟合、缓存涨价最高 11 倍,建议观望
GLM-5.2第二梯队Terminal-Bench 2.1 得 81.0、SWE-bench Pro 62.1、FrontierSWE 仅落后 Opus 4.8 约 1%、Code Arena 全球可用模型第一稳定可靠的老旗舰,SuperCLUE 评定处于"高效能区"(快且好)
Hy4 preview第二梯队DeepSWE 28.0→64.3、Code Arena WebDev 榜第 5(开源第 3)、腾讯内部盲测 2.99/4 略高于 GLM-5.3 与 K3实测"不输 GLM-5.2、追 GLM-5.3";硬伤:过度思考(一题想半小时)、并发超时、价格偏高
LongCat-2.0第二梯队SWE-bench Pro 59.5%,专为真实 Agentic Coding 设计OpenRouter 全球调用量前三,是开发者的用脚投票
Kimi-K2.6第三梯队SWE-bench Verified 80.2%、LiveCodeBench 89.6%、自主编码 13 小时、300 子 Agent 蜂群成熟稳定的上一代开源标杆,被 SuperCLUE-XClaw 用于 KimiClaw 产品
Kimi-K2.7-Code第三梯队Kimi Code Bench v2 较 K2.6 提升 21.8% 至 62.0、思考 token 省 30%编程专精但绝对水平仍低于 GPT-5.5/Opus 4.8 同表成绩
GLM-5.1第三梯队曾刷新 SWE-bench Pro 全球最佳、首超 Opus 4.6、8 小时长程任务5 月中文汇总 84.2 分,至今仍是可靠选择
Nemotron 3 Ultra第三梯队PinchBench 91%、Terminal-Bench 2.0 领先、吞吐较 GLM-5.1-754B 高至 5.9 倍强项是长时 Agent 编排的吞吐与成本,非单项登顶
Nemotron 3.5 Lightning执行档30B-A3B 紧凑 MoE,为高批量低延迟调用优化比同级开源快至 4 倍,适合大规模执行/验证/工具调用
Ling 3.0 Flash Fin垂直档金融智能体基准(SpreadsheetBench、Finance Agent 等)有竞争力仅金融代码场景可用,通用智能指数 41,不适合通用编程
Hy3数据不足官方称"代码能力大幅提升",未公布具体分数SuperCLUE 评定处于高效能区,WorkBuddy 免费至 9 月底
DeepSeek-V4-Flash 预览版已被取代Terminal-Bench 61.8、DeepSWE 7.3被 0731 正式版全面碾压,不再建议使用
Big Pickle数据不明竞技场匿名代号仅网友推测为 MiniMax M2.5 别名(若属实对应 SWE-bench Verified 80.2),无官方确认

文本模型梯队
文本模型梯队

多模态模型

模型梯队跑分依据实际体验口碑
Kimi-K3上限第一梯队Code Arena 前端 1679 分全球第一(超 Fable 5)、Terminal-Bench 2.1 得 88.3体验分层:深度编程/长文档极强,但修复耗时是竞品 3.4 倍(12 分钟 vs 3.5 分钟)、贵(输出 100 元/M)、幻觉率 51%,日常轻任务不推荐
Qwen3.8-Max第一梯队Frontend Code Arena 第 4、Text Arena 第 5、自主完成 16 天真实软件工程16 天无人干预交付项目+幻觉控制断层领先,综合最省心的旗舰
MiniMax-M3第一梯队SWE-Bench Pro 59.0% 超 GPT-5.5 与 Gemini 3.1 Pro、接近 Opus 4.7自主运行近 12 小时复现获奖论文,工程闭环能力强
GLM-5.3-Flash第二梯队AA 智能指数 57 与 Opus 4.8 持平、全面超 GLM-5.2匿名测试期(Ox-Alpha"牛来")登顶 OpenRouter/OpenCode 创纪录,价格仅 GLM-5.3 的 1/10,性价比极高
Qwen3.7-Plus第二梯队Terminal Bench/SciCode 较上代提升约 9 分、媲美 Opus 4.6-Max11 小时自主闭环开发真实 APP,截图转代码能力强
Muse Spark 1.3 Contributor第二梯队底座 1.3 官方称编码超 GPT-5.6 Sol、AA 智能指数 62工具调用减 20%、token 省 25%;Contributor 为低价实验档(输入 $0.10/M)
Seed-2.1-Pro第二梯队TerminalBench 2.1 得 71.0、SciCode 59.8、Code Arena 1539 分第 8工程交付稳定,AiPy 测评联网/HTML 任务成功率全球第 5-6
Seed-Evolving第二梯队滚动映射 Seed-2.1-Pro 水平实测长程 Coding 质量比 2.1-Pro 更稳、仓库理解与受控修复更好
Seed-2.1-Turbo第三梯队官方称效果比肩 Pro、低成本低时延面向规模化生产场景,单任务深度不如 Pro
Kimi-K2.6第三梯队SWE-bench Verified 80.2%、内置 MoonViT视觉+代码兼修,K3 发布前是 KimiClaw 底层模型
GLM-5v-Turbo视觉编程专精设计稿还原/视觉代码生成/GUI 探查基准领先看图写代码专精选手,纯文本编程经 RL 保障不退化
MiMo-V2.5基础档官方称日常 Agent 任务比肩 V2.5-Pro编程主力应转其文本版 Pro(SWE-bench Pro 57.2、GDPVal-AA 1581 开源第一)

多模态模型梯队
多模态模型梯队

编程综合能力

模型类型综合梯队跑分依据实际体验口碑
Kimi-K3多模态第一梯队·上限最高Code Arena 前端 1679 分全球第一(超 Fable 5)、Terminal-Bench 2.1 得 88.3深度编程/长文档极强;但修复耗时是竞品 3.4 倍、幻觉率 51%、输出 100 元/M,日常轻任务不推荐
GLM-5.3纯文本第一梯队·开源综合最强Terminal-Bench 3.0 得 28.3 开源最佳、DeepSWE v1.1 66.9、Code Bench 31.4% 超 Opus 4.8 且 token 仅其 42%实测口碑最稳:体感较 5.2 提升 50%,token 效率占优,ZCode 实测顺畅
Qwen3.8-Max多模态第一梯队·最省心旗舰Frontend Code Arena 第 4、Text Arena 第 5自主完成 16 天真实软件工程,幻觉控制断层领先
DeepSeek-V4-Flash 正式版纯文本第一梯队·性价比之王Terminal-Bench 2.1 得 82.7、DeepSWE 7.3→54.4、AA 智能指数 52缓存命中成本极低,官方自认部分编程任务反超 V4-Pro
DeepSeek-V4-Pro 正式版纯文本第一梯队⚠️跑分强/体验存疑Terminal-Bench 2.1 得 87.9(距 Fable 5 仅 0.1)、DeepSWE 62.7、CyberGym 83.3AA 仅 53 分未复现官方数据、Codex 实测 4100 万 tokens 后不推荐、Harness 过拟合、缓存涨价最高 11 倍,建议观望
MiniMax-M3多模态第一梯队SWE-Bench Pro 59.0% 超 GPT-5.5 与 Gemini 3.1 Pro、接近 Opus 4.7自主运行近 12 小时复现获奖论文,工程闭环能力强
GLM-5.2纯文本第二梯队Terminal-Bench 2.1 得 81.0、SWE-bench Pro 62.1、FrontierSWE 仅差 Opus 4.8 约 1%稳定老旗舰,SuperCLUE 高效能区(快且好)
GLM-5.3-Flash多模态第二梯队·多模态性价比AA 智能指数 57 与 Opus 4.8 持平、官方称全面超 GLM-5.2匿名期 Ox-Alpha 登顶 OpenRouter/OpenCode 创纪录,价格仅 GLM-5.3 的 1/10
Hy4 preview纯文本第二梯队DeepSWE 28.0→64.3、Code Arena WebDev 第 5(开源第 3)、内部盲测 2.99/4实测"不输 5.2、追 5.3";硬伤:过度思考(一题想半小时)、并发偶发超时
Qwen3.7-Plus多模态第二梯队Terminal Bench/SciCode 较上代 +9 分、媲美 Opus 4.6-Max11 小时自主闭环开发真实 APP,截图转代码强
Seed-Evolving多模态第二梯队≈Seed-2.1-Pro 水平,周级滚动更新实测长程 Coding 比 2.1-Pro 更稳、仓库理解与受控修复更好
Seed-2.1-Pro多模态第二梯队TerminalBench 2.1 得 71.0、SciCode 59.8、Code Arena 1539 分第 8工程交付稳定,联网/HTML 任务成功率全球第 5-6
LongCat-2.0纯文本第二梯队SWE-bench Pro 59.5%,专为真实 Agentic Coding 设计OpenRouter 全球调用量前三,开发者的用脚投票
Kimi-K2.6多模态第三梯队SWE-bench Verified 80.2%、LiveCodeBench 89.6%成熟稳定的上一代开源标杆,自主编码 13 小时、300 子 Agent 蜂群
Kimi-K2.7-Code纯文本第三梯队Kimi Code Bench v2 较 K2.6 提升 21.8% 至 62.0、思考 token 省 30%编程特化,绝对水平仍低于 GPT-5.5/Opus 4.8 同表成绩
GLM-5.1纯文本第三梯队曾刷新 SWE-bench Pro 全球最佳、首超 Opus 4.68 小时长程任务,验证充分的老旗舰
Seed-2.1-Turbo多模态第三梯队官方称效果比肩 Pro、低成本低时延规模化生产场景够用,单任务深度不如 Pro
GLM-5v-Turbo多模态第三梯队·视觉编程专精设计稿还原/视觉代码生成/GUI 探查基准领先看图写代码专精,纯文本编程经 RL 保障不退化
Muse Spark 1.3 Contributor多模态第二梯队底座 1.3 编码超 GPT-5.6 Sol、AA 智能指数 62工具调用-20%、token 省 25%;Contributor 为低价实验档($0.10/M 输入),实际能力低于底座满血版
Nemotron 3 Ultra纯文本第三梯队PinchBench 91%、吞吐较 GLM-5.1-754B 高至 5.9 倍、成本-30%强在长时 Agent 编排的吞吐与成本,非单项登顶
MiMo-V2.5多模态第三梯队·基础档官方称日常 Agent 任务比肩 V2.5-Pro编程主力是其文本版 MiMo-V2.5-Pro(SWE-bench Pro 57.2、GDPVal-AA 1581 开源第一,未在本清单内)
Nemotron 3.5 Lightning纯文本执行档30B-A3B 紧凑 MoE,高批量低延迟优化比同级开源快至 4 倍,适合大规模执行/验证/工具调用
Ling 3.0 Flash Fin纯文本金融垂直档SpreadsheetBench、Finance Agent 等金融基准有竞争力通用智能指数仅 41,仅金融代码场景可用
Hy3纯文本数据不足官方称"代码能力大幅提升"未公布分数SuperCLUE 高效能区,WorkBuddy 免费至 9 月底
DeepSeek-V4-Flash 预览版纯文本已被取代Terminal-Bench 61.8、DeepSWE 7.3被 0731 正式版全面碾压,弃用
DeepSeek-V4-Pro 预览版纯文本已被取代Terminal-Bench 72.1、DeepSWE 12.8被 0813 正式版代际超越
Big Pickle纯文本数据不明竞技场匿名代号,无跑分仅网友推测为 MiniMax M2.5 别名(若属实对应 SWE-bench Verified 80.2),无官方确认

图片处理能力

模型图片输入视觉水平定位依据/数据
Kimi-K3✅ 原生视觉视力顶级但慢SVG 细节实测超 Fable 5、水波纹物理连贯;但复杂图表偏 OCR+推理,生成时间 2-3 倍
Qwen3.8-Max视觉第一梯队Vision Arena 全球第 2,教育解题/视频理解/三维创作全流程视觉生产力
Seed-2.1-Pro✅ 图+视频视觉第一梯队CharXiv-RQ、MeasureBench 等多项基准最高分,ERQA 空间理解最佳,TVBench/VideoMME 业界高分
Seed-Evolving✅ 图+视频+文档视觉第一梯队继承 2.1 系视觉能力,周级滚动增强图像理解/图文推理/视觉风险识别
Qwen3.7-Plus✅ 图+视频视觉第一梯队曾推动阿里进 Vision Arena 全球前五/中国第一,截图转代码、高级 OCR
GLM-5.3-Flash✅ 图+视频+文件第二梯队原生多模态,视觉编入编程闭环(观察界面→改进代码),处理 PPTX/PDF/DOCX/XLSX 版面
MiniMax-M3✅ 图+视频第二梯队OmniDocBench 超 Gemini 3.1 Pro,可操作电脑桌面
GLM-5v-Turbo✅ 图+视频+文件视觉编程专精设计稿还原/视觉代码生成/GUI 探查基准领先,“看图写代码"首选
MiMo-V2.5✅ 图+视频+音频第二梯队27 个模型中唯一全模态(含音频),长视频追踪与跨模态长程推理
Muse Spark 1.3 Contributor✅ 图+视频+PDF+音频第二梯队底座支持图像/视频/PDF/音频,1M 上下文
Kimi-K2.6✅ 图+视频第三梯队内置 MoonViT 编码器,可用但非主打
Seed-2.1-Turbo✅ 图+视频第三梯队保留图/视频输入,档位低于 Pro

日常多模态办公选 GLM-5.3-Flash,纯文本编程主力选 GLM-5.3 或 DeepSeek-V4-Flash 正式版,要上限和长程任务上 Kimi-K3 或 Qwen3.8-Max。排名数据整理自公开跑分与实测口碑,具体以各平台当前页面为准。

经验分享

  • 中度使用:上面五款任意挑一两款主力,免费积分完全够用,不用花钱。
  • 重度使用:多台设备加家人或者朋友的手机号分开注册,互相走邀请链接,双方都拿积分,再各自登录签到。

我现在是三台电脑每天签到,重度使用(编程和自媒体文字创作)完全覆盖,积分根本用不完。

积分规则和模型列表会随平台活动调整,文中数据基于 2026 年 9 月的实测与公开信息,具体以各平台当前页面为准。