现状
一家在新加坡、马来、印尼运营的区域支付金融科技公司,多云布局(AWS + Azure)已涨到约 SGD 170 万/年,但没有 CFO 最终会要的纪律。工程名义上拥有费用;实际上没人拥有任何东西。未打标资源占账单 60%,预留实例覆盖率 6%,三个团队在不同账户里重复起共享服务因为跨团队可见性是零。
董事会要一个数字。工程顶回:“不破坏什么就砍不下来。“我们被找来做 8 周独立审视 + 执行。
我们做了什么
1. 给整个世界打标(第 1-3 周)
每一个资源都打上 team、environment、project、cost center。未打标资源限 14 天内归属,否则自动下架。我们每天发一份报表,让每个 team lead 看到自己的未打标清单和修复路径。第 3 周末未打标占比降到 4% 以下。
2. 系统性右调大小(第 3-5 周)
拉 90 天利用率数据,识别出两个云上约 140 台过度配置的实例和 30 多个闲置资源,下架或降级。工程团队在执行前对每条变更签收 —— 不在 on-call 里搞惊喜。
3. 预留容量策略(第 5-7 周)
把稳定生产负载的按需开销换成 1 年 + 3 年 RI(AWS)以及预留实例 + Savings Plans(Azure)混合。保守覆盖 —— 65% —— 留出空间等新基线稳定再扩。
4. 标签驱动的 chargeback(第 7-8 周)
做月度按团队对账单,让工程 lead 看到自己的账单,而不仅是全局数字。三个月后,两个团队主动下架自己都忘了的服务。
结果
- 云总费用比 FY24 基线降 -38%
- 年化节省 SGD 65 万,主要来自 RI 承诺 + 闲置资源回收
- 零因 FinOps 工作产生的生产事故
- 公司历史上第一次按时的按团队 chargeback 对账单
- 项目后季度回顾 RI 覆盖率 65% → 72%
我们学到了什么
标签卫生是 FinOps 的 70% —— 直到每一个资源有了主人,其他什么都推不动。可见的记分板(按团队 chargeback)是没预料到的解锁。工程团队一看到自己用自己的数字呈现的账单,就停止跟财务争辩。
工作能持续,因为我们留下的不只是一份更小的账单,是一套季度回顾的节奏 —— 客户自己的 FinOps 同事现在跑我们搭起来的回顾,我们每年回去做一次独立检查。