
今年不少公司的 AI 预算已经从 ChatGPT,扩展到了 Claude Code、Codex、GitHub Copilot。
开发团队一人一个账号,有些公司甚至同时买两三套。
钱花出去以后,一个很现实的问题来了:
到底有多少人在真正使用?
不是登录过一次,不是偶尔让 Copilot 补两行代码,而是真的把 AI 放进开发流程里。
再往下问一步:
这些 AI Coding 工具,到底给公司省了多少钱?
很多公司统计 AI 使用率的方法非常简单:
这三个数字只能说明一件事:公司采购了 AI。不能说明 AI 已经产生价值。
GitHub 今年公布的一组数据就很有意思。
在已经活跃使用 Copilot Business 和 Enterprise 的用户中,仍有 62.1% 的用户主要使用代码补全,并没有真正进入 Agent 工作流。
这也是企业统计 AI Coding ROI 时最容易踩的坑:
有人每天打开 Copilot,接受几个补全。
有人直接让 Claude Code 读取整个项目,修改代码、运行测试、修 Bug。
还有人把 Codex 接到 GitHub,让它独立处理任务。
三个人都可以算“活跃用户”。实际创造的价值完全不是一个级别。
所以企业第一步不应该统计:
有多少人开通 AI。
而应该统计:
有多少人真正把 AI 放进开发流程。
最简单的指标是:
周活跃率 = 每周真实使用人数 ÷ 已购买席位数
比如公司给开发团队买了 50 个 AI Coding 账号。
过去一周只有 18 个人真正调用过。
那真实周活跃率只有 36%。
这时候不要急着研究“AI提高了多少开发效率”。
先解决另外一个问题:
为什么剩下32个人不用?
不知道怎么用;
原来的开发习惯已经固定;
公司没有提供使用场景;
工具和现有 IDE、Git、内部环境没打通;
担心代码安全;
某些岗位本身就不需要。
对于长期几乎没有使用的席位,继续续费没有太大意义。

这是我觉得最容易被忽略的数据。
一个开发者每天调用几十次代码补全,和另一个开发者把完整 Issue 交给 Agent,不能放在一起统计。
可以把使用深度简单分成三个等级。
代码补全;
解释报错;
生成 SQL;
写正则;
补注释;
生成简单函数。
这是最基础的 AI Coding。有价值,但很难产生数量级上的效率变化。
重构模块;
生成单元测试;
修改多个文件;
分析代码库;
Review PR;
排查 Bug。
这时候 AI 已经不是“自动补全工具”,而是开发助手。
再往上一层:
把一个完整 Issue 交给 Claude Code 或 Codex;
让 Agent 自己读取代码;
修改多个文件;
执行命令;
运行测试;
发现错误继续修改;
最后提交结果。
这才是目前 AI Coding 真正拉开效率差距的地方。
Anthropic 对约 40 万次 Claude Code 会话的研究已经看到类似变化:使用场景正在从单纯 Debug,逐渐转向运行代码、部署、数据处理以及更完整的端到端任务。
所以企业内部最好不要只统计“使用次数”。还要统计:
多少任务真正交给了 Agent。
AI Coding ROI 最容易犯的另一个错误,是统计:“AI生成了多少行代码。”
这个数据基本没什么意义。
一个优秀的重构可能删掉2000行代码。
一个糟糕的AI生成任务可能多写5000行废代码。
真正应该看的,是开发结果。
比如:
PR平均完成时间有没有下降?
以前一个需求从开始开发到 PR Merge 需要3天,现在是不是变成2天?
Code Review时间有没有下降?
以前一个PR平均等8小时,现在是不是只需要4小时?
Bug修复时间有没有下降?
以前定位线上问题需要2小时,现在是不是40分钟可以找到原因?
测试覆盖有没有增加?
AI生成测试代码以后,开发者是不是愿意补更多测试?
返工率有没有上升?
这个指标非常重要。
开发速度提高30%,结果线上 Bug 增加50%,这个 AI ROI 很可能是负数。
GitHub目前给企业提供的 Copilot 使用指标里,也已经不只统计活跃人数,而是开始结合 Agent adoption、Acceptance Rate、PR Merge 数量以及 Median Time to Merge 等指标分析实际使用效果。
企业内部没必要把公式搞得特别复杂。
更建议用一个简单版本:
AI Coding ROI =(节省的人力成本 + 提前交付产生的价值 + 减少的返工成本 - AI总成本)÷ AI总成本
AI总成本也不能只算订阅费。
还应该包括:
Claude、OpenAI、GitHub等工具费用;
API和额外Credits;
员工培训时间;
内部部署和权限管理;
安全、审计以及IT管理成本。
这才是 AI ROI 统计最难的地方。
不要让员工自己填:
“Claude Code这个月帮我节省了30小时。”
这种数据主观性太强。
比较靠谱的方法,是挑选重复度比较高的开发任务做前后对比。
例如:
单元测试编写;
API接口开发;
Bug修复;
代码重构;
PR Review;
内部脚本开发。
连续统计一段时间:
以前平均需要多久;
引入AI以后平均需要多久;
代码质量有没有变化。
同类型任务累计几十次以后,差距就比较明显了。
不需要精确到分钟。
企业真正需要的是趋势。
不用做得特别复杂。
每个月看这几个数字就够了:
采购席位数 → 公司买了多少。
WAU / 月活跃用户 → 有多少人在真正用。
Agent任务占比 → 有多少人已经从代码补全进入Agent工作流。
PR Cycle Time → 开发速度有没有变化。
Bug / Rework Rate → 代码质量有没有变差。
AI Cost per Developer → 每个开发者平均花多少钱。
AI Cost per Completed Task → 完成一个有效开发任务,AI实际消耗多少钱。
连续看3个月,比单纯看Token数量有用得多。
现在还有一种情况越来越常见:
同一个开发团队同时买:
Claude Code;
Codex;
GitHub Copilot;
Cursor;
各种模型API。
结果年底一看账单,一堆几十美元、几百美元、几千美元的海外软件扣款。
谁在用、哪个项目用、哪个团队产生的费用,财务很难对应。
这种情况下,支付本身也应该成为AI成本管理的一部分。
我们自己的 MXK8 虚拟卡现在也有不少企业用户拿来管理 AI 和海外 SaaS 支出。
可以按照团队、项目、员工或者具体用途分配不同的虚拟卡和额度,OpenAI、Claude以及其他海外软件的费用分开管理,月底核对交易记录会清楚很多。
做 AI Coding ROI 时,这一点很实用。
至少你可以很快知道:
研发一组这个月花了多少;
Claude花了多少;
OpenAI花了多少;
哪些账号还在扣费;
哪些工具已经没人使用。
对于同时管理几十个甚至上百个海外软件账号的企业来说,比所有订阅挤在一张公司信用卡上好统计得多。
现在企业采购 AI Coding,已经过了“先买几个账号试试看”的阶段。Claude Code、Codex、Copilot能力越来越强,企业真正需要解决的问题变成:
怎么让员工真的用起来。
以及:
怎么证明这笔钱花得值。
买了多少席位,不重要。
生成了多少Token,也不重要。
真正应该看的只有三件事:
有没有人用。
有没有进入真实开发流程。
交付效率和代码质量到底有没有发生变化。
关于我们

