<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>编程工具 on 码工瑞瑞的博客</title><link>https://blog.137027.xyz/tags/%E7%BC%96%E7%A8%8B%E5%B7%A5%E5%85%B7/</link><description>Recent content in 编程工具 on 码工瑞瑞的博客</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Mon, 07 Sep 2026 20:00:00 +0800</lastBuildDate><atom:link href="https://blog.137027.xyz/tags/%E7%BC%96%E7%A8%8B%E5%B7%A5%E5%85%B7/index.xml" rel="self" type="application/rss+xml"/><item><title>分享AI免费Work第一期</title><link>https://blog.137027.xyz/posts/free-ai-coding-credits-guide/</link><pubDate>Mon, 07 Sep 2026 20:00:00 +0800</pubDate><guid>https://blog.137027.xyz/posts/free-ai-coding-credits-guide/</guid><description>实测整理五款免费AI编程工具平台的积分规则：注册赠送、每月登录、每日签到，新人首月最高可得约 9000 积分，附文本/多模态模型选择梯队排行。</description><content:encoded><![CDATA[<p>​	这期内容是我对自己经常使用的免费ai工具做一个分享。本分享只分享ai工具自带的免费额度，不分享api，因为api经常不稳定，限速，很多制度不透明。以后打算每次这几个平台有更新，或者有新的平台出现，我会接着出第二期，第三期等。</p>
<p>这篇文章是我自己实测使用记录整理出来，五款平台的免费积分规则、每月能白嫖多少、免费模型怎么选，都分享给大家，基于自己的经验分享，不一定百分百准确，有不准的也希望大家指正。本次分享时间有效期2026年9月，因为ai工具不断争用户，活动一直在变。有更新我会及时同步。</p>
<h2 id="免费额度积分">免费额度积分</h2>
<p>平台免费额度积分基本是这三种方式来的：</p>
<ul>
<li><strong>注册或邀请赠送</strong>：一次性到账，通常 30 天左右有效，是新人第一个月的大头。</li>
<li><strong>每月登录</strong>：每月固定送一笔，当月有效，下月刷新。</li>
<li><strong>每日签到</strong>：每天一点，有效期跟随活动走，一般是 30 多天。</li>
</ul>
<p>这些积分都有有效期，如果每月能领的积分或者当日积分都能用完，那么实际能最大使用的积分如下图。下面这张图是我按 2026 年 9 月实测整理的各平台对比。如果有新的好用的平台，欢迎大家推荐。</p>
<p><figure style="text-align: center; margin: 1.5rem 0">
  <img alt="各平台每月免费可得积分对比（2026-09 实测口径）" loading="lazy" src="/posts/free-ai-coding-credits-guide/credits-chart.png">
  <figcaption style="font-size: 0.85rem; color: #888; margin-top: 0.5rem">
    各平台每月免费可得积分对比（2026-09 实测口径）
  </figcaption>
</figure></p>
<p>五款平台横向对比总览：</p>
<table>
  <thead>
      <tr>
          <th>平台</th>
          <th>注册/邀请赠送</th>
          <th>每月登录</th>
          <th>每日签到</th>
          <th>新人首月</th>
          <th>老用户每月</th>
          <th>最经济模型</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>TraeWork</td>
          <td>2000 通用 + 2000 Work（31 天）</td>
          <td>500</td>
          <td>150（约 31 天）</td>
          <td><strong>约 9000</strong></td>
          <td>约 5000</td>
          <td>Seed-Code（多模态）、Deepseek-V4-Flash 正式版（文本）</td>
      </tr>
      <tr>
          <td>WorkBuddy</td>
          <td>2000（30 天）</td>
          <td>500</td>
          <td>100（30 多天）</td>
          <td><strong>约 5500</strong></td>
          <td>约 3500</td>
          <td>GLM-5.3-Flash（多模态）、Deepseek-V4-Flash（文本）</td>
      </tr>
      <tr>
          <td>千问办公</td>
          <td>2000（90 天，据公开信息）</td>
          <td>—</td>
          <td>100（当天有效）</td>
          <td>约 5000</td>
          <td>每日 100</td>
          <td>标准模式 0.1X 倍率，极耐用</td>
      </tr>
      <tr>
          <td>美团 CatPaw</td>
          <td>1000</td>
          <td>200</td>
          <td>无签到</td>
          <td>1200（次月起每月 200）</td>
          <td>200</td>
          <td>LongCat-2.0（免费）</td>
      </tr>
      <tr>
          <td>OpenCode</td>
          <td>免费模型，无限额但有限速</td>
          <td>—</td>
          <td>—</td>
          <td>—</td>
          <td>—</td>
          <td>见下方模型排名</td>
      </tr>
  </tbody>
</table>
<h2 id="workbuddy新人一个月-5500-分">WorkBuddy：新人一个月 5500 分</h2>
<p>​	WorkBuddy 走邀请链接注册送 2000 积分，按注册之日起 30 天内有效；每月登录送 500 积分，当月有效；每日签到 100 积分，一般跟活动走，有效期30 多天。</p>
<p>​	老用户没有注册礼，靠登录加签到，每月有约 3500 积分。</p>
<p>​	WorkBuddy 官方一个月 4000 积分的套餐卖 99 元。按这个单价折算，5500 积分约等于每月 136 元。也就是说，新用户头一个月白拿的额度，比一个付费套餐还多；老用户每月也有约 87 元。</p>
<p>​	模型方面，免费档是 hy3 和 Hy4 preview。想省着用，除免费模型外，多模态建议选 GLM-5.3-Flash，纯文本选 Deepseek-V4-Flash，这两款是目前性价比最高的。</p>
<h2 id="traework-新人首月-9000-分">TraeWork ：新人首月 9000 分</h2>
<p>​	TraeWork 是字节系 AI 原生 IDE Trae 在 2026 年 7 月上线积分体系后推出的 Work 模式玩法，免费额度给得最足。走邀请链接注册，一次性送 2000 通用积分和 2000 Work 专属积分，<strong>31 个自然日有效</strong>；每月登录送 500 积分，当月有效；每日签到 150 通用积分，一般跟活动走 31 天。</p>
<p>​	新人首月约 9000 积分，老用户每月约 5000 积分，五家里排第一。</p>
<p>​	模型上：多模态用 Seed-Code（注意它只在 Code 模式下显示），文本用 Deepseek-V4-Flash 正式版，最省钱。</p>
<h2 id="千问办公注册赠送-2000-积分">千问办公：注册赠送 2000 积分</h2>
<p>千问办公注册赠送 2000 积分（据公开信息有效期 90 天），每日登陆给 100 积分，当天有效。</p>
<p>标准模式按 0.1X 倍率消耗（使用模型是qwen3.8flash），非常耐用。按官方公开测算，1000 积分大约能完成 322 份 Word、556 份 PDF、100 份 PPT、45 份 Excel 或 119 份 HTML 报告。</p>
<p>如果你主要是文档处理、报告生成这类办公场景，千问办公的积分是最经花的。</p>
<h2 id="opencode有免费模型">OpenCode：有免费模型</h2>
<p>OpenCode 有免费模型，但有速率限制，而且官方没有公布限制细则。</p>
<p>它的开发公司是 Anomaly Innovations（GitHub 上叫 anomalyco），总部在加拿大多伦多，软件面向全球用户，所以限速策略和地区相关。</p>
<p>我自己用下来，偶尔会碰到限速变慢，换个时间段或者换个地区网络节点，通常就缓过来了。当补充额度用，很合适。</p>
<h3 id="opencode-免费模型">OpenCode 免费模型</h3>
<p>OpenCode 免费档可用的模型有 <strong>Muse Spark 1.3 Contributor、Nemotron 3 Ultra、MiMo-V2.5、Nemotron 3.5 Lightning、Ling 3.0 Flash Fin</strong>，另有一个匿名代号 <strong>Big Pickle</strong>（底层模型不确定）。排名整理如下：</p>
<table>
  <thead>
      <tr>
          <th>排名</th>
          <th>模型</th>
          <th>判断</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>1</td>
          <td>Muse Spark 1.3 Contributor</td>
          <td>上限最高；如果免费端调用的是完整 1.3，只是 Contributor 数据条款/额度不同，它应是这组最强</td>
      </tr>
      <tr>
          <td>2</td>
          <td>Nemotron 3 Ultra</td>
          <td>深度推理、代码审查、长任务强；但速度和免费端稳定性可能不如 Muse</td>
      </tr>
      <tr>
          <td>3</td>
          <td>MiMo-V2.5</td>
          <td>多模态、长上下文、日常 Agent 很强；但注意不要把 MiMo-V2.5-Pro 的编程成绩直接套过来</td>
      </tr>
      <tr>
          <td>4</td>
          <td>Nemotron 3.5 Lightning</td>
          <td>速度和批量执行优秀，适合简单修改、测试、工具调用；复杂工程明显低于 Ultra</td>
      </tr>
      <tr>
          <td>5</td>
          <td>Ling 3.0 Flash Fin</td>
          <td>金融、表格、财务代码可用；通用软件工程不建议优先</td>
      </tr>
      <tr>
          <td>不排名</td>
          <td>Big Pickle</td>
          <td>匿名代号，底层模型可能变化，没有稳定模型身份和公开编程基准</td>
      </tr>
  </tbody>
</table>
<h2 id="美团-catpaw注册送-1000每月再送-200">美团 CatPaw：注册送 1000，每月再送 200</h2>
<p>​	美团在 2026 年 7 月上线了全场景 AI Agent 平台 CatPaw。注册送 1000 积分，每月再给 200 积分，没有签到。</p>
<p>免费模型是 LongCat-2.0。每月 200 积分加上免费模型，轻度使用够了；它的强项是结合美团内部能力的日常办公和业务协作。</p>
<h2 id="模型怎么选">模型怎么选</h2>
<p>排名整理自公开跑分和实测口碑，分<strong>文本模型</strong>、<strong>多模态模型</strong>、<strong>编程综合能力</strong>、<strong>图片处理能力</strong>四张表，按梯队从高到低排，每个模型附一句话定位。</p>
<h3 id="文本模型">文本模型</h3>
<table>
  <thead>
      <tr>
          <th>模型</th>
          <th>梯队</th>
          <th>跑分依据</th>
          <th>实际体验口碑</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>GLM-5.3</td>
          <td>第一梯队</td>
          <td>Terminal-Bench 3.0 得 28.3 开源最佳、DeepSWE v1.1 66.9、Z.ai Code Bench High 档 31.4% 超 Opus 4.8 且 token 仅其 42%</td>
          <td>实测口碑最稳的开源一哥：体感较 5.2 提升 50%，token 效率实测占优，ZCode 实测顺畅</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Flash 正式版</td>
          <td>第一梯队（性价比）</td>
          <td>Terminal-Bench 2.1 得 82.7（超 GLM-5.2）、DeepSWE 7.3→54.4、AA 智能指数 52</td>
          <td>性价比之王：缓存命中价极低，官方自认部分编程任务反超 V4-Pro</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Pro 正式版</td>
          <td>官方跑分第一梯队/体验存疑</td>
          <td>Terminal-Bench 2.1 得 87.9（距 Fable 5 仅 0.1）、DeepSWE 62.7、CyberGym 83.3</td>
          <td>体验翻车：AA 仅 53 分未复现官方数据、Codex 实测 4100 万 tokens 后不推荐、前端远低预期、对官方 Harness 过拟合、缓存涨价最高 11 倍，建议观望</td>
      </tr>
      <tr>
          <td>GLM-5.2</td>
          <td>第二梯队</td>
          <td>Terminal-Bench 2.1 得 81.0、SWE-bench Pro 62.1、FrontierSWE 仅落后 Opus 4.8 约 1%、Code Arena 全球可用模型第一</td>
          <td>稳定可靠的老旗舰，SuperCLUE 评定处于&quot;高效能区&quot;（快且好）</td>
      </tr>
      <tr>
          <td>Hy4 preview</td>
          <td>第二梯队</td>
          <td>DeepSWE 28.0→64.3、Code Arena WebDev 榜第 5（开源第 3）、腾讯内部盲测 2.99/4 略高于 GLM-5.3 与 K3</td>
          <td>实测&quot;不输 GLM-5.2、追 GLM-5.3&quot;；硬伤：过度思考（一题想半小时）、并发超时、价格偏高</td>
      </tr>
      <tr>
          <td>LongCat-2.0</td>
          <td>第二梯队</td>
          <td>SWE-bench Pro 59.5%，专为真实 Agentic Coding 设计</td>
          <td>OpenRouter 全球调用量前三，是开发者的用脚投票</td>
      </tr>
      <tr>
          <td>Kimi-K2.6</td>
          <td>第三梯队</td>
          <td>SWE-bench Verified 80.2%、LiveCodeBench 89.6%、自主编码 13 小时、300 子 Agent 蜂群</td>
          <td>成熟稳定的上一代开源标杆，被 SuperCLUE-XClaw 用于 KimiClaw 产品</td>
      </tr>
      <tr>
          <td>Kimi-K2.7-Code</td>
          <td>第三梯队</td>
          <td>Kimi Code Bench v2 较 K2.6 提升 21.8% 至 62.0、思考 token 省 30%</td>
          <td>编程专精但绝对水平仍低于 GPT-5.5/Opus 4.8 同表成绩</td>
      </tr>
      <tr>
          <td>GLM-5.1</td>
          <td>第三梯队</td>
          <td>曾刷新 SWE-bench Pro 全球最佳、首超 Opus 4.6、8 小时长程任务</td>
          <td>5 月中文汇总 84.2 分，至今仍是可靠选择</td>
      </tr>
      <tr>
          <td>Nemotron 3 Ultra</td>
          <td>第三梯队</td>
          <td>PinchBench 91%、Terminal-Bench 2.0 领先、吞吐较 GLM-5.1-754B 高至 5.9 倍</td>
          <td>强项是长时 Agent 编排的吞吐与成本，非单项登顶</td>
      </tr>
      <tr>
          <td>Nemotron 3.5 Lightning</td>
          <td>执行档</td>
          <td>30B-A3B 紧凑 MoE，为高批量低延迟调用优化</td>
          <td>比同级开源快至 4 倍，适合大规模执行/验证/工具调用</td>
      </tr>
      <tr>
          <td>Ling 3.0 Flash Fin</td>
          <td>垂直档</td>
          <td>金融智能体基准（SpreadsheetBench、Finance Agent 等）有竞争力</td>
          <td>仅金融代码场景可用，通用智能指数 41，不适合通用编程</td>
      </tr>
      <tr>
          <td>Hy3</td>
          <td>数据不足</td>
          <td>官方称&quot;代码能力大幅提升&quot;，未公布具体分数</td>
          <td>SuperCLUE 评定处于高效能区，WorkBuddy 免费至 9 月底</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Flash 预览版</td>
          <td>已被取代</td>
          <td>Terminal-Bench 61.8、DeepSWE 7.3</td>
          <td>被 0731 正式版全面碾压，不再建议使用</td>
      </tr>
      <tr>
          <td>Big Pickle</td>
          <td>数据不明</td>
          <td>竞技场匿名代号</td>
          <td>仅网友推测为 MiniMax M2.5 别名（若属实对应 SWE-bench Verified 80.2），无官方确认</td>
      </tr>
  </tbody>
</table>
<p><figure style="text-align: center; margin: 1.5rem 0">
  <img alt="文本模型梯队" loading="lazy" src="/posts/free-ai-coding-credits-guide/text-tier-chart.png">
  <figcaption style="font-size: 0.85rem; color: #888; margin-top: 0.5rem">
    文本模型梯队
  </figcaption>
</figure></p>
<h3 id="多模态模型">多模态模型</h3>
<table>
  <thead>
      <tr>
          <th>模型</th>
          <th>梯队</th>
          <th>跑分依据</th>
          <th>实际体验口碑</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Kimi-K3</td>
          <td>上限第一梯队</td>
          <td>Code Arena 前端 1679 分全球第一（超 Fable 5）、Terminal-Bench 2.1 得 88.3</td>
          <td>体验分层：深度编程/长文档极强，但修复耗时是竞品 3.4 倍（12 分钟 vs 3.5 分钟）、贵（输出 100 元/M）、幻觉率 51%，日常轻任务不推荐</td>
      </tr>
      <tr>
          <td>Qwen3.8-Max</td>
          <td>第一梯队</td>
          <td>Frontend Code Arena 第 4、Text Arena 第 5、自主完成 16 天真实软件工程</td>
          <td>16 天无人干预交付项目+幻觉控制断层领先，综合最省心的旗舰</td>
      </tr>
      <tr>
          <td>MiniMax-M3</td>
          <td>第一梯队</td>
          <td>SWE-Bench Pro 59.0% 超 GPT-5.5 与 Gemini 3.1 Pro、接近 Opus 4.7</td>
          <td>自主运行近 12 小时复现获奖论文，工程闭环能力强</td>
      </tr>
      <tr>
          <td>GLM-5.3-Flash</td>
          <td>第二梯队</td>
          <td>AA 智能指数 57 与 Opus 4.8 持平、全面超 GLM-5.2</td>
          <td>匿名测试期（Ox-Alpha&quot;牛来&quot;）登顶 OpenRouter/OpenCode 创纪录，价格仅 GLM-5.3 的 1/10，性价比极高</td>
      </tr>
      <tr>
          <td>Qwen3.7-Plus</td>
          <td>第二梯队</td>
          <td>Terminal Bench/SciCode 较上代提升约 9 分、媲美 Opus 4.6-Max</td>
          <td>11 小时自主闭环开发真实 APP，截图转代码能力强</td>
      </tr>
      <tr>
          <td>Muse Spark 1.3 Contributor</td>
          <td>第二梯队</td>
          <td>底座 1.3 官方称编码超 GPT-5.6 Sol、AA 智能指数 62</td>
          <td>工具调用减 20%、token 省 25%；Contributor 为低价实验档（输入 $0.10/M）</td>
      </tr>
      <tr>
          <td>Seed-2.1-Pro</td>
          <td>第二梯队</td>
          <td>TerminalBench 2.1 得 71.0、SciCode 59.8、Code Arena 1539 分第 8</td>
          <td>工程交付稳定，AiPy 测评联网/HTML 任务成功率全球第 5-6</td>
      </tr>
      <tr>
          <td>Seed-Evolving</td>
          <td>第二梯队</td>
          <td>滚动映射 Seed-2.1-Pro 水平</td>
          <td>实测长程 Coding 质量比 2.1-Pro 更稳、仓库理解与受控修复更好</td>
      </tr>
      <tr>
          <td>Seed-2.1-Turbo</td>
          <td>第三梯队</td>
          <td>官方称效果比肩 Pro、低成本低时延</td>
          <td>面向规模化生产场景，单任务深度不如 Pro</td>
      </tr>
      <tr>
          <td>Kimi-K2.6</td>
          <td>第三梯队</td>
          <td>SWE-bench Verified 80.2%、内置 MoonViT</td>
          <td>视觉+代码兼修，K3 发布前是 KimiClaw 底层模型</td>
      </tr>
      <tr>
          <td>GLM-5v-Turbo</td>
          <td>视觉编程专精</td>
          <td>设计稿还原/视觉代码生成/GUI 探查基准领先</td>
          <td>看图写代码专精选手，纯文本编程经 RL 保障不退化</td>
      </tr>
      <tr>
          <td>MiMo-V2.5</td>
          <td>基础档</td>
          <td>官方称日常 Agent 任务比肩 V2.5-Pro</td>
          <td>编程主力应转其文本版 Pro（SWE-bench Pro 57.2、GDPVal-AA 1581 开源第一）</td>
      </tr>
  </tbody>
</table>
<p><figure style="text-align: center; margin: 1.5rem 0">
  <img alt="多模态模型梯队" loading="lazy" src="/posts/free-ai-coding-credits-guide/multimodal-tier-chart.png">
  <figcaption style="font-size: 0.85rem; color: #888; margin-top: 0.5rem">
    多模态模型梯队
  </figcaption>
</figure></p>
<h3 id="编程综合能力">编程综合能力</h3>
<table>
  <thead>
      <tr>
          <th>模型</th>
          <th>类型</th>
          <th>综合梯队</th>
          <th>跑分依据</th>
          <th>实际体验口碑</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Kimi-K3</td>
          <td>多模态</td>
          <td>第一梯队·上限最高</td>
          <td>Code Arena 前端 1679 分全球第一（超 Fable 5）、Terminal-Bench 2.1 得 88.3</td>
          <td>深度编程/长文档极强；但修复耗时是竞品 3.4 倍、幻觉率 51%、输出 100 元/M，日常轻任务不推荐</td>
      </tr>
      <tr>
          <td>GLM-5.3</td>
          <td>纯文本</td>
          <td>第一梯队·开源综合最强</td>
          <td>Terminal-Bench 3.0 得 28.3 开源最佳、DeepSWE v1.1 66.9、Code Bench 31.4% 超 Opus 4.8 且 token 仅其 42%</td>
          <td>实测口碑最稳：体感较 5.2 提升 50%，token 效率占优，ZCode 实测顺畅</td>
      </tr>
      <tr>
          <td>Qwen3.8-Max</td>
          <td>多模态</td>
          <td>第一梯队·最省心旗舰</td>
          <td>Frontend Code Arena 第 4、Text Arena 第 5</td>
          <td>自主完成 16 天真实软件工程，幻觉控制断层领先</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Flash 正式版</td>
          <td>纯文本</td>
          <td>第一梯队·性价比之王</td>
          <td>Terminal-Bench 2.1 得 82.7、DeepSWE 7.3→54.4、AA 智能指数 52</td>
          <td>缓存命中成本极低，官方自认部分编程任务反超 V4-Pro</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Pro 正式版</td>
          <td>纯文本</td>
          <td>第一梯队⚠️跑分强/体验存疑</td>
          <td>Terminal-Bench 2.1 得 87.9（距 Fable 5 仅 0.1）、DeepSWE 62.7、CyberGym 83.3</td>
          <td>AA 仅 53 分未复现官方数据、Codex 实测 4100 万 tokens 后不推荐、Harness 过拟合、缓存涨价最高 11 倍，建议观望</td>
      </tr>
      <tr>
          <td>MiniMax-M3</td>
          <td>多模态</td>
          <td>第一梯队</td>
          <td>SWE-Bench Pro 59.0% 超 GPT-5.5 与 Gemini 3.1 Pro、接近 Opus 4.7</td>
          <td>自主运行近 12 小时复现获奖论文，工程闭环能力强</td>
      </tr>
      <tr>
          <td>GLM-5.2</td>
          <td>纯文本</td>
          <td>第二梯队</td>
          <td>Terminal-Bench 2.1 得 81.0、SWE-bench Pro 62.1、FrontierSWE 仅差 Opus 4.8 约 1%</td>
          <td>稳定老旗舰，SuperCLUE 高效能区（快且好）</td>
      </tr>
      <tr>
          <td>GLM-5.3-Flash</td>
          <td>多模态</td>
          <td>第二梯队·多模态性价比</td>
          <td>AA 智能指数 57 与 Opus 4.8 持平、官方称全面超 GLM-5.2</td>
          <td>匿名期 Ox-Alpha 登顶 OpenRouter/OpenCode 创纪录，价格仅 GLM-5.3 的 1/10</td>
      </tr>
      <tr>
          <td>Hy4 preview</td>
          <td>纯文本</td>
          <td>第二梯队</td>
          <td>DeepSWE 28.0→64.3、Code Arena WebDev 第 5（开源第 3）、内部盲测 2.99/4</td>
          <td>实测&quot;不输 5.2、追 5.3&quot;；硬伤：过度思考（一题想半小时）、并发偶发超时</td>
      </tr>
      <tr>
          <td>Qwen3.7-Plus</td>
          <td>多模态</td>
          <td>第二梯队</td>
          <td>Terminal Bench/SciCode 较上代 +9 分、媲美 Opus 4.6-Max</td>
          <td>11 小时自主闭环开发真实 APP，截图转代码强</td>
      </tr>
      <tr>
          <td>Seed-Evolving</td>
          <td>多模态</td>
          <td>第二梯队</td>
          <td>≈Seed-2.1-Pro 水平，周级滚动更新</td>
          <td>实测长程 Coding 比 2.1-Pro 更稳、仓库理解与受控修复更好</td>
      </tr>
      <tr>
          <td>Seed-2.1-Pro</td>
          <td>多模态</td>
          <td>第二梯队</td>
          <td>TerminalBench 2.1 得 71.0、SciCode 59.8、Code Arena 1539 分第 8</td>
          <td>工程交付稳定，联网/HTML 任务成功率全球第 5-6</td>
      </tr>
      <tr>
          <td>LongCat-2.0</td>
          <td>纯文本</td>
          <td>第二梯队</td>
          <td>SWE-bench Pro 59.5%，专为真实 Agentic Coding 设计</td>
          <td>OpenRouter 全球调用量前三，开发者的用脚投票</td>
      </tr>
      <tr>
          <td>Kimi-K2.6</td>
          <td>多模态</td>
          <td>第三梯队</td>
          <td>SWE-bench Verified 80.2%、LiveCodeBench 89.6%</td>
          <td>成熟稳定的上一代开源标杆，自主编码 13 小时、300 子 Agent 蜂群</td>
      </tr>
      <tr>
          <td>Kimi-K2.7-Code</td>
          <td>纯文本</td>
          <td>第三梯队</td>
          <td>Kimi Code Bench v2 较 K2.6 提升 21.8% 至 62.0、思考 token 省 30%</td>
          <td>编程特化，绝对水平仍低于 GPT-5.5/Opus 4.8 同表成绩</td>
      </tr>
      <tr>
          <td>GLM-5.1</td>
          <td>纯文本</td>
          <td>第三梯队</td>
          <td>曾刷新 SWE-bench Pro 全球最佳、首超 Opus 4.6</td>
          <td>8 小时长程任务，验证充分的老旗舰</td>
      </tr>
      <tr>
          <td>Seed-2.1-Turbo</td>
          <td>多模态</td>
          <td>第三梯队</td>
          <td>官方称效果比肩 Pro、低成本低时延</td>
          <td>规模化生产场景够用，单任务深度不如 Pro</td>
      </tr>
      <tr>
          <td>GLM-5v-Turbo</td>
          <td>多模态</td>
          <td>第三梯队·视觉编程专精</td>
          <td>设计稿还原/视觉代码生成/GUI 探查基准领先</td>
          <td>看图写代码专精，纯文本编程经 RL 保障不退化</td>
      </tr>
      <tr>
          <td>Muse Spark 1.3 Contributor</td>
          <td>多模态</td>
          <td>第二梯队</td>
          <td>底座 1.3 编码超 GPT-5.6 Sol、AA 智能指数 62</td>
          <td>工具调用-20%、token 省 25%；Contributor 为低价实验档（$0.10/M 输入），实际能力低于底座满血版</td>
      </tr>
      <tr>
          <td>Nemotron 3 Ultra</td>
          <td>纯文本</td>
          <td>第三梯队</td>
          <td>PinchBench 91%、吞吐较 GLM-5.1-754B 高至 5.9 倍、成本-30%</td>
          <td>强在长时 Agent 编排的吞吐与成本，非单项登顶</td>
      </tr>
      <tr>
          <td>MiMo-V2.5</td>
          <td>多模态</td>
          <td>第三梯队·基础档</td>
          <td>官方称日常 Agent 任务比肩 V2.5-Pro</td>
          <td>编程主力是其文本版 MiMo-V2.5-Pro（SWE-bench Pro 57.2、GDPVal-AA 1581 开源第一，未在本清单内）</td>
      </tr>
      <tr>
          <td>Nemotron 3.5 Lightning</td>
          <td>纯文本</td>
          <td>执行档</td>
          <td>30B-A3B 紧凑 MoE，高批量低延迟优化</td>
          <td>比同级开源快至 4 倍，适合大规模执行/验证/工具调用</td>
      </tr>
      <tr>
          <td>Ling 3.0 Flash Fin</td>
          <td>纯文本</td>
          <td>金融垂直档</td>
          <td>SpreadsheetBench、Finance Agent 等金融基准有竞争力</td>
          <td>通用智能指数仅 41，仅金融代码场景可用</td>
      </tr>
      <tr>
          <td>Hy3</td>
          <td>纯文本</td>
          <td>数据不足</td>
          <td>官方称&quot;代码能力大幅提升&quot;未公布分数</td>
          <td>SuperCLUE 高效能区，WorkBuddy 免费至 9 月底</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Flash 预览版</td>
          <td>纯文本</td>
          <td>已被取代</td>
          <td>Terminal-Bench 61.8、DeepSWE 7.3</td>
          <td>被 0731 正式版全面碾压，弃用</td>
      </tr>
      <tr>
          <td>DeepSeek-V4-Pro 预览版</td>
          <td>纯文本</td>
          <td>已被取代</td>
          <td>Terminal-Bench 72.1、DeepSWE 12.8</td>
          <td>被 0813 正式版代际超越</td>
      </tr>
      <tr>
          <td>Big Pickle</td>
          <td>纯文本</td>
          <td>数据不明</td>
          <td>竞技场匿名代号，无跑分</td>
          <td>仅网友推测为 MiniMax M2.5 别名（若属实对应 SWE-bench Verified 80.2），无官方确认</td>
      </tr>
  </tbody>
</table>
<h3 id="图片处理能力">图片处理能力</h3>
<table>
  <thead>
      <tr>
          <th>模型</th>
          <th>图片输入</th>
          <th>视觉水平定位</th>
          <th>依据/数据</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Kimi-K3</td>
          <td>✅ 原生视觉</td>
          <td>视力顶级但慢</td>
          <td>SVG 细节实测超 Fable 5、水波纹物理连贯；但复杂图表偏 OCR+推理，生成时间 2-3 倍</td>
      </tr>
      <tr>
          <td>Qwen3.8-Max</td>
          <td>✅</td>
          <td>视觉第一梯队</td>
          <td>Vision Arena 全球第 2，教育解题/视频理解/三维创作全流程视觉生产力</td>
      </tr>
      <tr>
          <td>Seed-2.1-Pro</td>
          <td>✅ 图+视频</td>
          <td>视觉第一梯队</td>
          <td>CharXiv-RQ、MeasureBench 等多项基准最高分，ERQA 空间理解最佳，TVBench/VideoMME 业界高分</td>
      </tr>
      <tr>
          <td>Seed-Evolving</td>
          <td>✅ 图+视频+文档</td>
          <td>视觉第一梯队</td>
          <td>继承 2.1 系视觉能力，周级滚动增强图像理解/图文推理/视觉风险识别</td>
      </tr>
      <tr>
          <td>Qwen3.7-Plus</td>
          <td>✅ 图+视频</td>
          <td>视觉第一梯队</td>
          <td>曾推动阿里进 Vision Arena 全球前五/中国第一，截图转代码、高级 OCR</td>
      </tr>
      <tr>
          <td>GLM-5.3-Flash</td>
          <td>✅ 图+视频+文件</td>
          <td>第二梯队</td>
          <td>原生多模态，视觉编入编程闭环（观察界面→改进代码），处理 PPTX/PDF/DOCX/XLSX 版面</td>
      </tr>
      <tr>
          <td>MiniMax-M3</td>
          <td>✅ 图+视频</td>
          <td>第二梯队</td>
          <td>OmniDocBench 超 Gemini 3.1 Pro，可操作电脑桌面</td>
      </tr>
      <tr>
          <td>GLM-5v-Turbo</td>
          <td>✅ 图+视频+文件</td>
          <td>视觉编程专精</td>
          <td>设计稿还原/视觉代码生成/GUI 探查基准领先，&ldquo;看图写代码&quot;首选</td>
      </tr>
      <tr>
          <td>MiMo-V2.5</td>
          <td>✅ 图+视频+音频</td>
          <td>第二梯队</td>
          <td>27 个模型中唯一全模态（含音频），长视频追踪与跨模态长程推理</td>
      </tr>
      <tr>
          <td>Muse Spark 1.3 Contributor</td>
          <td>✅ 图+视频+PDF+音频</td>
          <td>第二梯队</td>
          <td>底座支持图像/视频/PDF/音频，1M 上下文</td>
      </tr>
      <tr>
          <td>Kimi-K2.6</td>
          <td>✅ 图+视频</td>
          <td>第三梯队</td>
          <td>内置 MoonViT 编码器，可用但非主打</td>
      </tr>
      <tr>
          <td>Seed-2.1-Turbo</td>
          <td>✅ 图+视频</td>
          <td>第三梯队</td>
          <td>保留图/视频输入，档位低于 Pro</td>
      </tr>
  </tbody>
</table>
<p><strong>日常多模态办公选 GLM-5.3-Flash，纯文本编程主力选 GLM-5.3 或 DeepSeek-V4-Flash 正式版，要上限和长程任务上 Kimi-K3 或 Qwen3.8-Max</strong>。排名数据整理自公开跑分与实测口碑，具体以各平台当前页面为准。</p>
<h2 id="经验分享">经验分享</h2>
<ul>
<li><strong>中度使用</strong>：上面五款任意挑一两款主力，免费积分完全够用，不用花钱。</li>
<li><strong>重度使用</strong>：多台设备加家人或者朋友的手机号分开注册，互相走邀请链接，双方都拿积分，再各自登录签到。</li>
</ul>
<p>我现在是三台电脑每天签到，重度使用（编程和自媒体文字创作）完全覆盖，积分根本用不完。</p>
<p>积分规则和模型列表会随平台活动调整，文中数据基于 2026 年 9 月的实测与公开信息，具体以各平台当前页面为准。</p>
]]></content:encoded></item></channel></rss>