基础设施与扩容高并发系统的可观测性:真正能指导行动的日志、指标与链路追踪
请求 ID、写入 OpenSearch 的结构化日志、四个黄金信号、采样的链路追踪,以及与用户影响挂钩的告警:几分钟内定位慢的那一层所需的最小集合,外加压测和活动当天该怎么盯。
逐项对比计算、托管数据库、egress、备份和运维工时,附 37signals 的数据、留下或搬走的决策树,以及一份直到最后一步都保留回退路径的迁移计划。
Author
Anichur Rahaman

云账单上写着 9,400 美元。一家 40 人的线上零售公司的老板,在每月 3 号打开了它。去年 10 月是 6,100 美元,而流量只涨了三分之一,连一半都不到。其中一行“data transfer out”翻了一倍,涨到 1,150 美元,团队里没人说得清是哪个功能造成的。
她开始琢磨,整套系统搬到租来的服务器上会不会便宜些。网上一半人说会,另一半人说,公司就是这么搞出凌晨 3 点宕机、还找不到人接电话的。
两边都对,只是说的是不同的公司。云回迁(cloud repatriation)指把工作负载从公有云搬回自己租用或购买的服务器。负载稳定、数据量大、运维有人负责时,回迁划算;负载忽高忽低、团队很小,或者托管服务确实在干活时,留在云上更好。本文把这笔账拆到每一个科目,方便你给自己的店铺算一遍。
这个词涵盖一个很宽的范围。一头是彻底迁出,把自有硬件放进托管机房的机架(colocation)。另一头只搬那些费用高又稳定的部分,比如数据库或文件存储,放到独立服务器上,其余原地不动。大多数中小企业应当先考虑后一种。
记录最完整的案例是 37signals,也就是 Basecamp 和 HEY 背后的公司。据 The Register 2025 年 5 月的报道,它花了约 70 万美元购买 Dell 服务器,云账单每年减少约 200 万美元。随后它把约 18 PB 的存储从 Amazon S3 迁到 Pure Storage 阵列上,阵列花费约 150 万美元,预计每年再省 130 万美元。退出时 AWS 减免了约 25 万美元的 egress 费用,公司预计五年累计节省 1,000 万美元。其 CTO 表示,并不需要额外增加人手。
请细读这段。37signals 当时的年账单是 320 万美元,有多年的运维经验,需求平稳、可预测。数字是真的,但属于同时具备这三点的公司。想了解细节,可以读 The Register 的这篇报道。
更大的压力来自浪费,而不只是价格。Flexera《2026 年云状态报告》调查了 750 多位云决策者和使用者,估计云支出中有 29% 被浪费,这是五年来首次上升,AI 工作负载是原因之一。同一调查中,85% 的受访者把管控云支出列为主要挑战(Flexera 新闻稿)。在云内部就能消除的浪费,是最便宜的节省,而且排在任何迁移之前。
云账单和服务器租金之间的差距,大部分可以用四个成本来源解释。
数据流入云是免费的,流出到互联网要计费。AWS 的公开价目是每月前 100 GB 免费,之后前 10 TB 每 GB 0.09 美元,再往上阶梯递减。一家提供商品图片、发票 PDF 和 API 响应的店铺,不知不觉就会超过 8 TB。独立服务器的月租通常已含 20 TB 甚至更多流量。
一个在第二个可用区带备用副本的托管数据库,价格是底层裸算力的好几倍。你付的钱买的是自动故障切换(failover)、补丁更新和任意时间点恢复。团队里没人能做这些事时,这个价格公道;有人能做时,就偏贵了。
按最忙那天配置的实例,其余日子只跑到 15% 的负载。自动扩缩容只有在应用能干净地横向扩展时才管用。按峰值配置的固定服务器同样会闲置,但单价低得多。
GPU 实例、向量存储以及它们产生的流量,都按小时和 GB 计费。Flexera 正是把浪费的上升与这类负载联系在一起。实验放在云上做,随时可以关;稳定的推理负载则单独核价。
设想这样一家店:一个 Web 应用、后台任务进程、一个 PostgreSQL 数据库,每月约 8 TB 出站流量。数字都是为演示取的整数,不是报价。运维时间按每小时 75 美元计算。
| 科目(示例) | 超大规模云,按需付费 | 两台独立服务器,数据库另用两台 |
|---|---|---|
| 计算(应用与后台任务) | $900 | $230 |
| 数据库(主库 + 副本) | $1,100 托管 | $230 自管 |
| Egress,8 TB | $711 | $0(含在套餐内) |
| 备份与快照 | $190 | $60 异地对象存储 |
| 负载均衡、日志、监控 | $450 | $90 |
| 运维工时 | 25 小时 = $1,875 | 45 小时 = $3,375 |
| 每月合计 | $5,226 | $3,985 |
egress 这一行就是简单算术:8,000 GB 减去免费的 100 GB 得 7,900 GB,乘以 0.09 美元,等于 711 美元。每月节省 1,241 美元,约 24%,一年 14,892 美元。
先别急着庆祝,看最后一行。硬件和带宽从 3,351 美元降到 610 美元,但运维时间多了 20 小时。盈亏平衡点满足 610 + 75 × 工时 = 5,226,约为每月 61 小时。超过这个数,还是云更便宜。
再假设云上的计算和数据库拿到一年期承诺折扣 30%。云的总价降到 4,626 美元,差距缩小到 641 美元,盈亏平衡点降到约 54 小时。一次 200 工时的迁移成本 15,000 美元,按原来的差距约十二个月回本,按缩小后的差距则要长得多。

决定很少只取决于价格。按下面的顺序问四个问题,就能把大多数企业分流。
第一,负载是否稳定,账单是否大到值得动?月支出低于约 3,000 美元时,省下的钱抵不过多出来的精力。先清理浪费,再购买承诺用量。
第二,流量是否忽高忽低,或者真的遍布全球?一场让流量在一小时内涨十倍的闪购,正是弹性容量的用武之地。全年按峰值租服务器,比只在峰值那几个小时付云价更贵。系统如何消化这类尖峰,本系列的自动扩缩容一文里讲过。全球访问的大部分压力,可以靠固定源站前面的 CDN 来分担。
第三,补丁、备份和值班有没有人负责?没有明确的负责人,省下的钱就不是真的。这时应选择折中的托管方案。
第四,客户或监管方是否规定了数据存放地?如果是,答案是区域性或本国的服务商,那未必是你现在用的这家。

选择并不只有超大规模云和自建机架两种。
迁移成本多低,取决于可移植性。应用如果打包成容器加一个 compose 文件,像 StoreConsole 这样的自托管平台就是如此,下午就能在上述任何一种环境之间搬完。绑在专有队列和无服务器函数上的应用,则得先重写。
大型企业买家现在会问:数据存在哪里,谁能依法要求调取,以及能不能随时离开。这些是采购问题,答不上来的店铺会丢单。
监管也在降低离开的成本。根据欧盟《数据法案》(EU Data Act),过渡期内服务商只能收取切换所产生的直接成本,包括 egress 在内的切换费用将在 2027 年 1 月 12 日全部取消。如果你有欧盟客户或欧盟合同,这个日期应该写进计划。在欧盟之外,开始前就以书面形式申请免除退出费用,37signals 就是这么做的。
数据放在哪里,并不等于安全。在本国的服务器不比配置良好的云区域更安全,它回答的是法律问题,不是技术问题。
回迁不是周末的一次性操作,而是一连串小而可逆的步骤。下面每一步,直到最后一步之前都保留退路。

首先是运维能力:内核和数据库补丁、证书续期、磁盘写满告警、故障切换演练,现在全都归你。其次是监控,因为你原来依赖的云控制台不在了。一旦出现高危 CVE,安全补丁的期限是以天计的。至少安排两个人轮流值班,或者购买一层托管服务。
每月跟踪五个数字。一是含运维工时的基础设施总成本,因为不算人工的成本看上去会好看得多。二是每月运维工时,与盈亏平衡点对照。三是上一次恢复演练的恢复时间,以分钟计。四是补丁年龄,即已知最老的安全更新是多少天前打上的。五是主要客户所在区域的 p95 延迟,因为离开全球网络可能损失几毫秒。
如果运维工时越过平衡点,或者恢复演练失败,说明这次迁移并不划算,而这个结论值得你采取行动。
回到那位老板和她 9,400 美元的账单。按科目拆开后,她发现 egress 和托管数据库合计占账单的 40%,而 egress 的大头来自直接从源站输出的商品图片。
她先在前面加了一层 CDN,按这个设想,一周内 egress 就降了一半多。接着,她按 13 周的计划把稳定的数据库和后台任务搬到独立服务器,店铺前端的边缘层和大促当天的临时容量留在云上,并把恢复演练写进日历。账单变成了一份她能逐行解释的文件,下一次涨价,也能找到对应的原因。
Anichur Rahaman 是一名软件架构师,也是 StoreConsole 的创建者。他为成长型企业设计电商与 ERP 系统,专注于事件驱动架构、数据完整性和自托管部署。
About the Author
Anichur Rahaman
Continue Reading