SHEET 01 · HYBRID CLOUD CONTROL PLANE

混合云治理平台建设
账号、权限与成本分摊

煜企的企业混合云综合管理平台,把分散的云账号、资源、权限和运行数据纳入清晰的管理流程—— 帮助企业从"能开资源"走向"能持续管好资源"。 资源越多,越需要清楚的归属与规则;我们做的,就是让这套规则在多云环境里真正跑起来。

账号
主体与权限清单
资源
统一资源模型
策略
审批与变更边界
成本
费用分摊口径
SUPPORTED PROVIDERS / 可评估的云与基础设施
阿里云 ALIYUN 腾讯云 TENCENT 华为云 HUAWEI AWS AZURE GCP VMware vSphere OpenStack Kubernetes 天翼云 移动云 自建 IDC
RESOURCE CONTROL PLANE / 资源控制面 SYNC 00:03:12
BUS·W BUS·E 公有云 A · 华东 公有云 B · 华北 公有云 C · 华南 SaaS / CDN 私有云 / 信创 自建 IDC K8s / 边缘节点 统一控制面 OWNER · COST · POLICY CONTROL PLANE v4.2 0REGIONN 图例 / LEGEND 公有云接入 私有 / 本地 控制面
示例
纳管账号基线
待核对
无主资源口径
基线
标签合规口径
纳管完成 · ONBOARDED
SHEET 02 · WHY

上云不难,
难的是管得住

大多数企业的云不是"建"出来的,是几年里一点一点"长"出来的:一个项目一批账号、一次活动一批资源、 一个同事离职留下一批没人认领的实例。长到一定规模,四个问题会同时浮出水面。

BLIND 01
不知道资源在哪里

账号分散在多个云厂商与子公司,测试环境、临时环境、历史项目资源混在一起,没有一份能对齐的资产台账。

BLIND 02
不知道谁在使用

权限先给后收,子账号、AK/SK、临时凭据持续膨胀;没有归属人的资源,出问题也找不到对接人。

BLIND 03
不知道花在哪里

账单按账号出、业务按项目算,两边对不上;闲置实例、孤儿盘、空转负载均衡长期无人回收。

BLIND 04
不知道哪些变更能执行

谁能扩容、谁能删库、什么时间窗口能改,全靠口头约定;变更没有门禁,事故复盘没有留痕。

CRITICAL
资源越多,越需要清楚的归属与规则;
而不是更多的表格和更多的会议。

我们把这四件事变成平台里的四类固定能力:资源图谱回答"在哪"、 归属与权限回答"谁在用"、 成本拆分回答"花在哪"、 变更门禁回答"能不能做"。 从此管理动作不再依赖人的记忆,而是依赖系统里跑着的规则。

从太空俯瞰的地球夜景,象征跨地域资源分布
GLOBAL FOOTPRINT
资源可以分布在多朵云、多个地域之上,但"归属、成本、策略"必须只有一份答案——否则管理动作永远在追赶账本。
SHEET 03 · ARCHITECTURE

六层架构:
先纳管,再建模,后治理

平台不做"另一朵云",而是架在所有云之上的一层控制面。数据自下而上汇聚成统一资源模型, 策略自上而下下发到每一次变更——中间用自动化闭环,把"看见"变成"做到"。

LAYERED ARCHITECTURE / 分层架构
接入 建模 治理 执行 洞察 开放
L6交付与开放层把能力交到业务手里
统一控制台 移动端 / 企微通知 OpenAPI / SDK Webhook 订阅 ITSM / 工单对接 大屏与周月报

同一份数据多种出口:运维在控制台、管理者看报表、业务系统走 API、审批流进工单,避免"各查各的、各说各话"。

L5可观测与洞察层看得见,也说得清
监控告警 日志与链路追踪 成本分析优化 报表分析 容量与趋势预测 SLA 统计

指标、日志、账单三类数据打在同一套标签体系上,所以"这台机器贵不贵"和"这台机器稳不稳"可以在同一张表里回答。

L4自动化与调度引擎把规则变成动作
编排与作业平台 智能调度 弹性伸缩 故障自愈 定时与批量任务 变更回滚

策略触发后不是发一条通知,而是直接执行:扩容、回收、降配、切换、重启、回滚——每一步都有审计记录与回滚点。

L3治理与策略引擎平台的"规则大脑"
成本策略 权限与合规 资源生命周期 变更窗口与门禁 配额与预算 审批流

策略用声明式配置表达:谁 · 对什么资源 · 在什么条件 · 能做什么 · 需要谁批准。 规则一次定义,多云生效,不再靠人记住。

L2统一资源模型层CMDB · 资源图谱 · 归属
统一 CMDB 资源图谱 标签与归属体系 组织 / 成本中心 资产台账 变更留痕

这是整个平台最关键的一层:不管资源来自哪朵云,进来就被打上 归属人成本中心策略 三个标签,之后所有统计、告警、优化都以这套标签为准。

L1接入与纳管层多云 · 私有云 · 容器 · IDC
公有云 API 适配 私有云 / OpenStack VMware / 虚拟化 Kubernetes 集群 物理机与 IDC 存储 / 网络 / CDN SaaS 与账号目录

以只读凭据起步做盘点,逐步开放操作权限;支持跨账号、跨地域、跨订阅的统一拉取, 也支持通过 Agent 纳管无法直连的内网环境。

工程师在实验架前验证混合云接入方案
接入阶段在实验环境先行验证:凭据范围、拉取频率、字段映射,全部跑通后才进生产。

纳管一层要看清什么

IDENT资源唯一 ID 跨云可对齐
OWNER归属到人 / 到团队,无主资源列队认领
COST成本中心与项目编码,账单可拆分
STATE运行 / 闲置 / 待回收 / 已封存
POLICY适用策略集,变更时自动匹配门禁
TRACE谁在什么时候改了什么,全量留痕
归属成本策略
SHEET 04 · CAPABILITIES

八个模块,
一套数据打通

模块可以分阶段上,但底层共用同一套资源模型与标签体系——所以先上成本分析还是先上监控告警, 后续模块接进来时不需要重做一遍资产盘点。

多云统一纳管

公有云、私有云、容器、自建 IDC 进同一张资源表,跨账号跨地域统一视图,不再逐个控制台来回切。

  • 自动发现与增量同步,入账时效按约定流程测量
  • 资源拓扑关系自动生成,依赖一眼看清
  • 无主资源自动列队,推送认领
示例云与基础设施覆盖范围待确认

成本分析与优化

账单按成本中心、项目、环境、团队拆分到最小粒度,闲置、低利用率、规格错配自动识别并给出可执行建议。

  • 成本归因到资源,不只看账号总额
  • 预算与配额双阈值预警,超支前介入
  • 预留实例 / Savings Plan 组合测算
核对云支出前后对比

监控告警

指标、日志、事件统一接入,告警按归属自动分派到人;去重收敛后同一故障只通知一次,避免告警风暴。

  • S1/S2/S3 分级 + 升级策略,未响应自动上抛
  • 告警关联资源拓扑,定位时效按项目基线测量
  • 与变更记录联动,判断是否"刚改坏的"
核对无效告警量下降

自动化运维

常见处置动作沉淀为标准作业:扩容、重启、清理日志、回收磁盘、切换主备、批量打补丁,一键或自动触发。

  • 作业模板 + 参数化,重复操作不再手敲
  • 执行前校验、执行后复核,失败自动回滚
  • 高危动作二次确认 + 变更窗口限制
示例标准作业模板按范围整理

报表分析

面向不同角色出不同的表:给管理层看成本与趋势,给运维看可用率与故障,给业务看资源交付效率。

  • 周报 / 月报自动生成并推送
  • 同比环比与预算执行率一屏可见
  • 支持导出与 API 取数,接进自有 BI
示例报表模板按角色与口径确认

资源生命周期管理

从申请、审批、创建、变更、闲置、回收到归档,每一步有状态、有时限、有责任人,临时资源到点自动提醒或回收。

  • 申请即打标签,创建即入台账
  • 闲置判定规则可配(CPU/网络/连接数)
  • 回收前通知 + 快照保留,避免误删
按需生命周期状态按流程确认

智能调度

基于负载、成本、亲和性与合规约束做放置决策:把工作负载放到当下最合适的位置,而不是最熟悉的位置。

  • 峰谷时段自动伸缩与错峰调度
  • 跨云比价调度,同类规格选性价比最优
  • 数据亲和与地域合规约束优先
核对资源利用率提升

权限与合规治理

按角色授予最小权限,临时权限到期自动回收;高危操作走审批,所有动作留痕,为内审与合规评估提供记录。

  • 权限定期复核,僵尸账号自动识别
  • 策略基线扫描,配置偏离即告警
  • 全量操作审计,支持按人 / 资源回溯
核对高危操作可追溯
SHEET 05 · FINOPS

先看清钱花在哪里,
再谈降本

降本不是砍预算,而是把"不知道"的部分变成"可判断"的部分。平台把账单拆到资源级, 再按归属、环境、项目重新聚合——于是每一分钱都能找到对应的责任人和决策依据。

云支出趋势与构成 单位:万元 / 月 · 示例数据
140 130 120 110 100 90 80 万元 / 月 1月 4月 7月 10月 1月 4月 7月 10月 Y1 · 2025 Y2 · 2026 未优化基线(示例) 优化启动 · Y1·7月 示例 当前月
计算 · ECS / CVM / 节点示例
数据库与中间件示例
存储 · 对象 / 块 / 归档示例
网络 · 带宽 / NAT / CDN示例
可优化空间(闲置 / 错配)示例
27%

成本差额示意

01
闲置资源回收
低利用率只用于识别候选资源,不能直接作为删除依据。确认责任人、依赖、保留要求、备份和恢复验证后,再经授权审批释放。
按模型核对
02
规格降配与右调
基于约定 P95 观察窗口推荐目标规格,生成变更单,业务确认后自动执行。
按模型核对
03
预留实例组合测算
按稳定负载占比测算预留 / 节省计划的最优组合,避免过度承诺造成反向浪费。
按模型核对
04
存储分层与生命周期
冷数据自动下沉到低频 / 归档存储,快照按保留策略过期清理。
按模型核对
05
错峰与跨云调度
非实时批处理任务调度到低峰时段与低价区域,同类规格按实时比价选择。
按模型核对
成本分摊与账本核对场景
SHEET 06 · OBSERVABILITY

不是告警越多越好,
是每一条都有人接

告警的价值取决于三件事:该不该报、报给谁、有没有上下文。平台把告警和资源归属绑定, 收敛重复告警,并把相关信息一并塞进通知里——值班同学不用再翻三个系统才知道发生了什么。

NOC / 实时监控 LIVE STREAM
基线
可用性基线
示例
纳管账号口径
待核对
待处理告警示例
示例
S1 严重度示例
TIMESEVEVENTSOURCE
告警密度 · 周视图示例
周一 周二 周三 周四 周五 周六 周日 0 4 8 12 16 20 23
告警源 TOP 5 · 本周
华东-1 / K8s示例
华北-2 / 数据库示例
IDC-A / 对象存储示例
华南-3 / CDN示例
全球 / IAM示例
告警构成示例 · 收敛效果按项目测量;重复告警仅用于演示流程

告警分派与升级规则

S1 · 业务不可用目标按约定
S2 · 性能与容量目标按约定
S3 · 配置与合规流程按约定
成本 · 超预算负责人策略按约定
无归属资源周期按约定
NOC 监控中心多屏实景
告警响应从"谁看到谁处理"变成"规则决定谁处理",值班交接不再靠口头说明。

一条告警里带什么

资源全路径云/账号/地域/实例
归属与成本负责人·成本中心
近期变更示例观察窗口记录
关联拓扑上下游影响面
处置建议匹配历史作业
SHEET 07 · AUTOMATION

让规则自己跑起来,
而不只是写在文档里

监控发现问题,策略判断能不能动,编排决定怎么动,执行留下证据。整条链路闭环后, 夜里的告警不再需要把人叫起来点按钮。

自动化处置闭环 EVENT → ACTION → AUDIT
示例
执行量口径
实测
成功率按范围测量
实测
耗时按流程测量
按约定
回滚率按流程确认
感知 判定 编排 执行 复核 留痕 归档 监控/成本/合规事件 匹配策略·是否允许 作业模板与顺序 带回滚点执行 健康检查窗口按约定 写入审计链 进入知识库
policy.yamlAUTO-REMEDIATION
# 低利用率实例:先通知,按约定观察窗口后再调整
policy: idle-instance-rightsize
match:
resource_type: [ecs, cvm, node]
cpu_p95_observation_window: "threshold agreed per project"
owner: assigned
action:
- notify(owner, "按约定观察窗口后再调整")
- snapshot() → 回滚点
- resize(target=recommended)
- verify(health_check, verification_window)
- audit_log(change_id, operator)
EXECUTION LEDGER · 示例观察窗口
示例时间resize→示例示例资源 · 范围按流程确认按流程实测
示例时间notify→示例示例归属路径 · 项目确认按流程实测
示例时间snapshot→示例示例回滚点 · 项目验证按流程实测
示例时间restart→示例示例保护窗口 · 范围确认按范围
示例时间scale_up→示例示例发布路径 · 项目确认按流程实测
示例时间isolate→示例示例依赖冲突 · 项目验证按流程实测
负载感知伸缩

基于 P95 与预测曲线提前扩容,避免等到告警才动手;低峰自动缩容,不留空转。

示例基线预测窗口按约定自动
成本优先放置

同类规格跨可用区、跨云实时比价,在延迟与合规约束内选性价比最优。

节省按模型核对延迟阈值按约定比价
数据亲和调度

计算尽量靠近数据,减少跨地域流量;有地域合规要求的 workload 强制锁定区域。

同城优先合规锁定亲和
故障域打散

按机架 / 可用区 / 云厂商多维打散副本,单点云故障不影响整体可用。

故障域按架构确认反亲和打散
批处理错峰

非实时任务排队到低峰窗口执行,配合抢占式实例降低成本。

低峰窗口按约定抢占式错峰
容量预留与预测

大促、月度结算等可预期峰值提前预留,避免临时抢不到规格。

预留窗口按约定命中率实测预留
自动化脚本与作业编排
SHEET 08 · DELIVERY

六步走完,
每一步都有交付物

混合云管理平台不是买一套软件装上就完事,它改变的是管理流程。所以我们的交付以"产出物"为节点, 每个阶段结束你都能拿到可以用、可以验收、可以向外汇报的东西。

阶段周期按范围确认

盘点与调研

只读凭据接入全部云账号,跑一遍全量资源普查;同步梳理组织架构、项目编码与成本中心口径。

  • 《云资源现状盘点报告》
  • 账号 / 地域 / 资源清册
  • 无主与疑似闲置清单
阶段周期按范围确认

接入与建模

建立统一标签体系与资源模型,把异构资源映射到同一套字段;打通 CMDB、组织目录与工单系统。

  • 标签规范与强制策略
  • 统一 CMDB 数据模型
  • 资源拓扑图(首版)
阶段周期按范围确认

规则设定

与业务、财务、运维共同确定成本分摊规则、权限矩阵、变更窗口与告警分级,写进策略引擎。

  • 成本中心与分摊规则表
  • 角色权限矩阵
  • 变更门禁与审批流配置
阶段周期按范围确认

试点运行

选 1–2 个业务域先跑:验证告警分派是否准、成本报表是否对得上、自动化动作是否安全。

  • 试点域运行报告
  • 策略调优记录
  • 自动化作业首批上线
持续运营按约定

全面推广

全量账号纳管,报表体系与 OpenAPI 交付,接入自有 BI 与工单;同步完成团队带训。

  • 全量资源纳管完成
  • 报表体系 + API 文档
  • 管理员与值班培训
长期

持续运营

远程或驻场支持,按约定复盘成本与稳定性,随业务变化迭代策略;新云厂商、新资源类型持续适配。

  • 运营复盘报告按约定
  • 策略与模板迭代
  • 二级技术支持按约定
交付清单逐项核对与签字确认
每一步都可验收
阶段产出物在启动会上就写进计划表,阶段结束双方对照清单逐项确认;没完成的项不签字,不进入下一阶段。
SHEET 09 · TEAM

平台交付角色与能力核验

按确认的范围分配架构、集成、数据与运维责任,上线前验证厂商 API、版本、权限和运行约束。

示例
交付经验按项目核验
参考
项目数量不作事实声明
核验
资质按人员与项目核验
架
解决方案架构师
负责整体架构设计与选型评审,输出可落地的分层方案与迁移路径。
云
云平台集成负责人
核对选定厂商接口、授权范围、许可与支持条件;所需人员资质另行核验。
研
平台研发组
负责控制面、策略引擎、编排执行器与 OpenAPI,自研组件可控可改。
稳
SRE / 值班工程师
按约定提供二级支持,负责告警响应、故障处置与变更值守。
数
数据与成本分析师
负责账单建模、分摊口径与优化测算,输出可执行建议。
安
安全与合规顾问
权限基线、等保合规、审计留痕与数据边界方案。
工程师团队进行技术评审与方案讨论
架构 ×3 研发 ×8 SRE ×6
方案评审不是走过场:架构、研发、SRE、成本、安全五方同席,把"能不能落地"在会上就问完。
SHEET 10 · OUTCOME

企业获得可验收的管理流程

平台上线不是终点,而是把"资源归属、成本口径、变更规则"这三件事固定下来的起点。 预期的管理目标是:讨论云的时候,不再靠回忆和截图,而是打开同一张表。

一份对齐的资产台账

所有云账号的资源进同一张表,归属、状态、成本中心一目了然。审计、盘点、交接都不再临时拉人凑数。

核对资源可追溯

成本说得清、降得动

账单拆到项目和环境,谁花的多、为什么多、能不能少,都有数据;优化建议直接给到可执行变更单。

核对支出对比口径

权限发得出、收得回

按角色给最小权限,临时权限到期自动失效;僵尸账号与超期 AK 定期扫描,不再依赖人工清理。

核对超期权限数量

变更有门禁、有回滚

高危操作必须走审批,只能在允许的窗口执行;每一步留痕,出问题一键回到上一个稳定状态。

0无记录变更

值班睡得着

告警收敛效果按项目基线测量,该报的一条不少、不该报的不再打扰;夜间常见故障可按授权自动处置。

核对无效告警

汇报有依据

周报月报自动生成,成本趋势、可用率、资源交付效率直接引用,向上汇报不用临时做 PPT。

按流程月度汇报准备口径
上线前→上线后
资源清册靠各团队按约定自报,检查间隔内可能变旧
→
统一台账按约定流程同步,随时可供复核
账单按账号出,业务按项目算,两边对不上就开会扯
→
按标签自动分摊到项目 / 团队 / 环境,口径一次定好长期复用
权限先给后收,离职同事的账号可能还挂着生产权限
→
最小权限 + 到期自动回收,超期账号每周扫描并推送
故障靠人发现,告警一堆不知道先看哪条
→
分级分派到人,带拓扑与近期变更上下文,常见故障自动处理
要降本就统一砍配,砍完业务卡顿又加回来
→
按使用率逐台推荐规格,先回收闲置,再谈降配
示例反馈
“示例:以前讨论云成本,每个部门都有一份自己的表。统一视图可以帮助团队核对资源归属、成本口径与优化选项。”
企业信息中心负责人 示例角色 · 非客户背书
混合云平台验收口径示例
交付期客户与工程师团队共同讨论方案
FROM DELIVERY TO RUNNING TOGETHER
平台上线只是把工具交到运维团队手上,后面的策略调优、模板迭代、应急响应,我们和客户的工程师团队是坐在一起做的。
SHEET 11 · INDUSTRY SOFTWARE

做行业软件的团队,
环境本身就是生产力

对行业软件交付团队来说,云不只是成本项,更是交付链路的一环: 研发、测试、演示、交付、运维,每一段都要环境。环境给得快、收得干净,项目毛利就上去了。

MULTI-TENANT

多租户交付环境

每个客户一套隔离环境,带独立域名、配额与成本中心;交付后成本自动归到该项目,毛利算得准。

DEV / TEST

研发测试环境自助

开发按需申请标准环境,模板化创建;到点自动提醒回收,避免测试环境长期空转吃预算。

RELEASE

发布与回滚标准化

发布流程固化为作业模板,灰度、验证、回滚一步不落;版本与环境对应关系全程留痕。

DEMO / POC

演示与 POC 环境

售前演示环境按约定流程拉起、用完即销毁;POC 期间的资源消耗单独统计,售前成本可核算。

SHEET 12 · BY THE NUMBERS

项目验收的五类量化口径

逐项建立基线,约定统计周期、样本、责任人与验收阈值。本页不报告历史客户均值,也不保证固定改善幅度。

实测
云支出对比
按基线
无效告警变化
实测
资源利用率提升
实测
整体可用率
实测
新资源入账时延
SHEET 13 · SECURITY

管得多的前提,
是边界清楚

平台拿到的权限、数据存放的位置、操作留痕的范围,在方案阶段就明确写死,不做模糊承诺。

底层芯片与电路特写
BELOW THE SURFACE
管得住的边界,不是写在文档里,而是落在每一次写入与读取的判断里。
最小权限接入

默认只读凭据起步,按需逐项开放操作权限;凭据集中托管、定期轮换,不落地明文。

数据边界可控

支持私有化部署与数据不出域;采集范围与字段清单可审计,敏感字段默认脱敏。

全量操作审计

控制台与 API 的每一次动作记录操作人、时间、参数与结果,支持按人 / 资源 / 时间回溯。

合规基线扫描

对齐等保与行业规范的配置基线,偏离即告警并给出整改项,整改过程同样留痕。

SHEET 14 · FAQ

落地之前,
先问清楚

Q1已经有云厂商自带的控制台了,为什么还要这套平台?
云厂商控制台解决的是"我这朵云怎么用",平台解决的是"我所有的云怎么一起管"。 当你有两朵以上的云、多个账号、多个团队,资产的统一视图、成本口径的统一、权限与变更规则的统一, 就无法靠单个控制台完成。这不是替代关系,是在其上加一层治理。
Q2接入过程会不会影响现有业务?
不会。第一阶段只使用只读凭据做盘点与建模,不做任何写操作。 自动化动作在试点阶段逐条灰度,先在非生产环境验证,再放开执行范围,并且每条动作都带回滚点与执行窗口限制。
Q3数据存在哪里?支持私有化部署吗?
支持。控制面与数据存储可部署在客户自有环境内,采集到的元数据不出域; 若采用托管模式,数据存储在指定区域内,采集字段清单、保留周期与访问审计均在合同中明确。
Q4从启动到能用,需要多久?
推进节奏取决于账号规模、接口数量、权限审批与验收范围;阶段产出物与验收标准在启动前确认,不承诺固定工期。 规模特别大或历史遗留复杂的环境会适当延长,阶段产出物与验收标准不变。
Q5成本优化会不会把性能压下去?
优化顺序是有讲究的:先回收明确闲置的资源,再做规格右调,最后才动架构层。 每一条建议都基于双方确认的观察窗口和 P95 口径,且在业务侧确认后才执行;执行后按约定窗口观测,异常按回退条件处理。
Q6以后新增云厂商或新资源类型怎么办?
先评估厂商 API、资源模型、权限、兼容性与维护责任,再估算自定义适配器;交付周期以验证后的范围为准。
SCOPE REVIEW SHEET 15 · NEXT STEP

先做一次范围明确的资源盘点,
再决定要不要上平台

我们用只读凭据对你的云环境跑一遍全量普查,输出一份《资源现状盘点报告》:有多少资源、多少无归属、 多少疑似闲置、成本大致怎么分布。这份报告无论后续是否合作都归你,也是后续所有方案讨论的基线。

STEP 01
提交环境概况(云厂商 / 账号数量 / 规模)
STEP 02
签署保密协议,配置只读凭据
STEP 03
在约定复核窗口后出盘点报告 + 架构建议
页面说明

本页演示界面、场景与估算数值仅供参考;实际方案、指标及交付条件以项目确认文件为准。