美国医保网站 Healthcare.gov:为什么一个花了几亿美元、还有充足时间的政务网站,会在上线当天就崩掉?
没有人对整体负责的分工,等于把集成风险交给了上线那一天
美国医保网站 Healthcare.gov:巅峰期美国联邦医疗保险交易平台,承担让数千万人线上投保的公共任务,合同金额与公众关注度都是同类项目中最高的一档;终局是 2013 年 10 月上线即瘫痪,绝大多数用户无法完成注册,被作为大型 IT 项目集成失败的典型案例,承包商合同被终止。
美国联邦医疗保险交易平台,承担让数千万人线上投保的公共任务,合同金额与公众关注度都是同类项目中最高的一档
2013 年 10 月上线即瘫痪,绝大多数用户无法完成注册,被作为大型 IT 项目集成失败的典型案例,承包商合同被终止
5,722 票が参加
1 プラン · 1 知見
投稿会先进入待审,通过后才进入公开目录和站点地图。
根本的敗因の国民的公投
企業の命運を決定づけた致命的死穴に投票してください。
多家承包商各自开发、缺少统一集成责任
接口与数据标准不统一,集成风险在上线时才集中爆发
没有有权做技术决策的单一负责人
跨部门的方案争议无法及时裁决,问题被推迟到上线日
需求持续变动而验证不足
功能范围在开发过程中不断调整,压力测试与端到端验证被压缩
上线前的可用性验证不充分
没有按真实并发量做完整压测,容量问题在上线当天才暴露
年表:絶頂から終局へ
项目立项与开发
平台开工,多家承包商分别承接不同模块,需求在开发中多次调整
上线即瘫痪
开放注册当天系统无法承受访问量,绝大多数用户无法完成注册
紧急抢修
外部技术团队介入重组架构与发布流程,系统可用性逐步恢复
恢复与问责
平台在年底前基本可用,但承包商合同被终止,项目成为公共 IT 失败的典型案例
4大視点からの徹底回顧分析
発展の軌跡と最盛期の礎
项目由政府部门牵头、多家大型承包商分别承担不同模块,目标是让民众在线比价并完成投保,涉及身份核验、补贴计算与多家保险公司的数据对接巅峰期的成绩单是:美国联邦医疗保险交易平台,承担让数千万人线上投保的公共任务,合同金额与公众关注度都是同类项目中最高的一档。此时的它拥有渠道、品牌与资本的合力,看起来没有任何理由会输。
致命的転換点における戦略ミス
需求在开发过程中持续变动,多家承包商各自开发、接口没有统一标准,且项目缺乏一个有权限做技术决策的统一负责人,问题在上线前没有被完整验证底层架构的缺陷被增长掩盖了很多年,真正爆发时表现为线上事故、体验崩塌与迭代停滞,修复成本远高于当年重做的代价。
内部組織カルチャーと過信
技术决策长期被短期交付目标绑架,「先上线,以后再改」变成永久状态,没人对架构健康度负责。
破綻の連鎖と終焉
2013 年 10 月上线即瘫痪,绝大多数用户无法完成注册,被作为大型 IT 项目集成失败的典型案例,承包商合同被终止。美国医保网站 Healthcare.gov的结局不是某一次意外,而是上面这些判断在数年里不断叠加、又始终没有被纠正的必然结果。
ビジネスの実践的生存ルール
高額な失敗の代償から導き出された実践的教訓(DO & DON'T)
多方分工的项目,必须先指定一个对整体负责的人
集成问题不会消失,它只会等到上线那天一起出现。
- •为跨承包商的项目指定有实权的技术负责人
- •在上线前按真实并发量完成端到端压测
- •不要让需求在开发后期继续扩张
- •不要用分摊责任的方式代替集成责任
再生シミュレーター:もしあなたが当時のCEOなら、決定的な転換点でどう立て直すか?
歴史は変えられませんが、戦略思考は磨けます。過酷な事業整理と新たな勝負手を提示し、起業家や投資家による実現可能性投票で検証します。
先冻结需求做端到端压测,再恢复上线
介入すべき時点:2013 年 10 月 1 日上线当天出现大面积不可用时
- •冻结新增功能需求
- •停止由多家承包商各自发布版本
- •停止在没有整体负责人的情况下继续并行开发
- •指定对整体架构与发布负责的技术负责人
- •按真实并发量完成端到端压测并修复容量瓶颈
- •统一接口与数据标准后再逐步恢复上线
抢修期间资源集中投入容量与集成问题,功能交付以可用性通过为前提。
平台在较短时间内恢复可用,投保人能够在开放期内完成注册,避免项目成为公共 IT 失败的长期案例。
専門家による徹底見解
起業家、投資家、元社員、アナリストによる現場の分析
项目并不缺预算也不缺时间,缺的是一个能对整体负责的角色。多家承包商按各自合同完成模块,接口标准、版本节奏与数据口径都不统一,而这些接缝处的矛盾没有人在开发期有权限拍板,只能被一路推到上线。等到真实访问量到来,容量与集成问题同时爆发,抢修只能靠临时加入的外部团队从架构层面重组。
大型项目最难治理的不是代码,是责任边界。
失敗分析メモの書き出し · 美国医保网站 Healthcare.gov
为什么一个花了几亿美元、还有充足时间的政务网站,会在上线当天就崩掉?
# ビジネス失敗の回顧メモ:美国医保网站 Healthcare.gov > 为什么一个花了几亿美元、还有充足时间的政务网站,会在上线当天就崩掉? > 期間: 2010 - 2013 | 業界: ツール・インターネット > ピーク: 美国联邦医疗保险交易平台,承担让数千万人线上投保的公共任务,合同金额与公众关注度都是同类项目中最高的一档 > 終局: 2013 年 10 月上线即瘫痪,绝大多数用户无法完成注册,被作为大型 IT 项目集成失败的典型案例,承包商合同被终止 ## 概要 没有人对整体负责的分工,等于把集成风险交给了上线那一天。巅峰期美国联邦医疗保险交易平台,承担让数千万人线上投保的公共任务,合同金额与公众关注度都是同类项目中最高的一档;终局是 2013 年 10 月上线即瘫痪,绝大多数用户无法完成注册,被作为大型 IT 项目集成失败的典型案例,承包商合同被终止。 ## コミュニティ投票の主要死因 1. [プロダクト技術] 多家承包商各自开发、缺少统一集成责任 (1,882 票) 2. [組織マネジメント] 没有有权做技术决策的单一负责人 (1,581 票) 3. [戦略意思決定] 需求持续变动而验证不足 (1,280 票) ## 実行可能な教訓 ### 多方分工的项目,必须先指定一个对整体负责的人 > 集成问题不会消失,它只会等到上线那天一起出现。 - ✅ 推奨 (DOs): - 为跨承包商的项目指定有实权的技术负责人 - 在上线前按真实并发量完成端到端压测 - ❌ 禁止 (DON'Ts): - 不要让需求在开发后期继续扩张 - 不要用分摊责任的方式代替集成责任 ## 再生プラン ### 先冻结需求做端到端压测,再恢复上线 — 良略编辑部 介入時点: 2013 年 10 月 1 日上线当天出现大面积不可用时 - 断つべきもの: - 冻结新增功能需求 - 停止由多家承包商各自发布版本 - 停止在没有整体负责人的情况下继续并行开发 - 打開策: - 指定对整体架构与发布负责的技术负责人 - 按真实并发量完成端到端压测并修复容量瓶颈 - 统一接口与数据标准后再逐步恢复上线 - 期待される成果: 平台在较短时间内恢复可用,投保人能够在开放期内完成注册,避免项目成为公共 IT 失败的长期案例。 ## コミュニティの知見 ### 把一个系统拆给五家公司做,最难的部分不是每个模块,而是它们之间的接缝。 — 良略编辑部 (工程师) 项目并不缺预算也不缺时间,缺的是一个能对整体负责的角色。多家承包商按各自合同完成模块,接口标准、版本节奏与数据口径都不统一,而这些接缝处的矛盾没有人在开发期有权限拍板,只能被一路推到上线。等到真实访问量到来,容量与集成问题同时爆发,抢修只能靠临时加入的外部团队从架构层面重组。 - やり直せるなら打つべき一手 大型项目最难治理的不是代码,是责任边界。 --- 出典: 良略 · https://www.lianglue.com/c/healthcare-gov