AWS 成本运营

aws-cost-operations
分类通用
作者Agentic Awesome Skills 社区
许可MIT
评分4.60/5
使用13.2K

AWS 成本与运营

本技能通过集成 MCP 服务器,为 AWS 成本优化、监控、可观测性和卓越运营提供全面指导。

AWS 文档要求

在回答之前,请务必使用 MCP 工具(mcp__aws-mcp__*mcp__*awsdocs*__*)验证 AWS 相关事实。aws-mcp-setup 依赖项会自动加载 —— 如果 MCP 工具不可用,请引导用户完成该技能的设置流程。

集成 MCP 服务器

本插件提供 3 个 MCP 服务器:

内置服务器

#### 1. AWS Pricing MCP 服务器 (pricing)
用途:部署前成本估算与优化

  • 在部署资源前估算成本

  • 比较不同区域的定价

  • 计算总拥有成本 (TCO)

  • 评估不同服务选项的成本效益

#### 2. AWS Cost Explorer MCP 服务器 (costexp)
用途:详细的成本分析与报告

  • 分析历史支出模式

  • 识别成本异常和趋势

  • 预测未来成本

  • 按服务、区域或标签分析成本

#### 3. Amazon CloudWatch MCP 服务器 (cw)
用途:指标、警报和日志分析

  • 查询 CloudWatch 指标和日志

  • 创建并管理 CloudWatch 警报

  • 排查运营问题

  • 监控资源利用率

> 注意:以下服务器可通过 Full AWS MCP Server 单独获取(参见 aws-mcp-setup 技能),未包含在本插件中:
> - AWS Billing and Cost Management MCP —— 实时计费详情
> - CloudWatch Application Signals MCP —— APM 和 SLO
> - AWS Managed Prometheus MCP —— 容器 PromQL 查询
> - AWS CloudTrail MCP —— API 活动审计
> - AWS Well-Architected Security Assessment MCP —— 安全态势评估

何时使用此技能

在以下场景中使用此技能:

  • 优化 AWS 成本并降低支出

  • 部署前估算成本

  • 监控应用程序和基础设施性能

  • 设置可观测性和告警

  • 分析支出模式和趋势

  • 调查运营问题

  • 审计 AWS 活动和变更

  • 评估安全态势

  • 实现卓越运营

成本优化最佳实践

部署前成本估算

在部署前务必估算成本
1. 使用 AWS Pricing MCP 估算资源成本
2. 比较不同区域的定价
3. 评估替代服务选项
4. 计算预期月度成本
5. 规划扩容与增长

工作流示例

code
"估算在 us-east-1 区域运行 Lambda 函数的月度成本:调用量 100 万次,内存 512MB,执行时长 3 秒"

成本分析与优化

定期进行成本审查
1. 使用 Cost Explorer MCP 分析支出趋势
2. 识别成本异常和意外费用
3. 按服务、区域和环境审查成本
4. 对比实际支出与预算成本
5. 生成成本优化建议

成本优化策略

  • 对过度配置的资源进行规格调整(Right-size)

  • 使用合适的存储类(S3, EBS)

  • 为动态工作负载实施自动扩缩容

  • 利用 Savings Plans 和预留实例(Reserved Instances)

  • 删除未使用的资源和快照

  • 有效使用成本分配标签

预算监控

跟踪预算支出情况
1. 使用 Billing and Cost Management MCP 监控预算
2. 为阈值突破设置预算警报
3. 定期审查预算利用率
4. 根据趋势调整预算
5. 实施成本控制和治理

监控与可观测性最佳实践

CloudWatch 指标与警报

实施全面监控
1. 使用 CloudWatch MCP 查询指标和日志
2. 为关键指标设置警报:
- CPU 和内存利用率
- 错误率和延迟
- 队列深度和处理时间
- API 网关节流(Throttling)
- Lambda 错误和超时
3. 创建 CloudWatch 仪表板进行可视化
4. 使用 Log Insights 进行故障排查

常见警报场景

  • Lambda 错误率 > 1%

  • EC2 CPU 利用率 > 80%

  • API Gateway 4xx/5xx 错误激增

  • DynamoDB 请求被节流

  • ECS 任务失败

应用性能监控 (APM)

监控应用健康状况
1. 使用 CloudWatch Application Signals MCP 进行 APM
2. 跟踪服务水平目标 (SLOs)
3. 监控应用依赖关系
4. 识别性能瓶颈
5. 设置分布式追踪

容器与 Kubernetes 监控

针对容器化工作负载
1. 使用 AWS Managed Prometheus MCP 获取指标
2. 监控容器资源利用率
3. 跟踪 Pod 和节点健康状况
4. 创建 PromQL 查询以获取自定义指标
5. 为容器异常设置警报

审计与安全最佳实践

CloudTrail 活动分析

审计 AWS 活动
1. 使用 CloudTrail MCP 分析 API 活动
2. 跟踪谁对资源进行了更改
3. 调查安全事件
4. 监控可疑活动模式
5. 审计策略合规性

常见审计场景

  • “谁删除了这个 S3 存储桶?”

  • “显示过去 24 小时内所有 IAM 角色的更改”

  • “列出失败的登录尝试”

  • “查找特定用户的所有操作”

  • “跟踪安全组的修改”

安全评估

定期安全审查
1. 使用 Well-Architected Security Assessment MCP
2. 根据最佳实践评估安全态势
3. 识别安全漏洞和缺陷
4. 实施建议的安全改进
5. 记录安全合规情况

安全评估领域

  • 身份与访问管理 (IAM)

  • 检测性控制与监控

  • 基础设施保护

  • 数据保护与加密

  • 事件响应准备

高效使用 MCP 服务器

成本分析工作流

1. 部署前:使用 Pricing MCP 估算成本
2. 部署后:使用 Billing MCP 跟踪实际支出
3. 分析:使用 Cost Explorer MCP 进行详细成本分析
4. 优化:实施 Cost Explorer 提供的建议

监控工作流

1. 配置:配置 CloudWatch 指标和警报
2. 监控:使用 CloudWatch MCP 跟踪关键指标
3. 分析:使用 Application Signals 获取 APM 洞察
4. 排障:查询 CloudWatch Logs 以解决问题

安全工作流

1. 审计:使用 CloudTrail MCP 审查活动
2. 评估:使用 Well-Architected...
安全评估
3. 修复:实施安全建议
4. 监控:通过 CloudWatch 跟踪安全事件

MCP 使用最佳实践

1. 成本意识:在部署资源前检查定价
2. 主动监控:为关键指标设置警报
3. 定期审查:每周分析成本和性能
4. 审计追踪:审查 CloudTrail 日志以确保合规性
5. 安全至上:定期运行安全评估
6. 持续优化:根据成本和性能建议采取行动

卓越运营指南

成本优化

  • 全面打标签:使用一致的成本分配标签
  • 每月审查:分析支出趋势和异常情况
  • 合理配置规模:使资源与实际用量相匹配
  • 自动化:使用自动扩展(Auto-scaling)和调度
  • 预算监控:为成本超支设置警报

监控与警报

  • 关键指标:针对业务关键指标设置警报
  • 降低噪音:微调阈值以减少误报
  • 可操作的警报:确保警报包含明确的修复步骤
  • 仪表盘可视化:为关键利益相关者创建仪表盘
  • 日志保留:平衡成本与合规需求

安全与合规

  • 最小权限原则:授予所需的最小权限
  • 定期审计:审查 CloudTrail 日志以发现异常
  • 数据加密:对静态数据和传输中数据进行加密
  • 持续评估:频繁运行安全评估
  • 事件响应:制定安全事件处理流程

附加资源

有关详细的运营模式和最佳实践,请参考综合参考文档:

文件references/operations-patterns.md

该参考文档包括:

  • 成本优化策略

  • 监控与警报模式

  • 可观测性最佳实践

  • 安全与合规指南

  • 故障排除工作流

CloudWatch 警报参考

文件references/cloudwatch-alarms.md

以下服务的常见警报配置:

  • Lambda 函数

  • EC2 实例

  • RDS 数据库

  • DynamoDB 表

  • API Gateway

  • ECS 服务

  • Application Load Balancers (ALB)

局限性

  • 仅在任务与上游来源及本地项目上下文明确匹配时使用此技能。
  • 在应用更改前,请验证命令、生成的代码、依赖项、凭据以及外部服务的行为。
  • 不要将示例视为环境特定测试、安全审查或破坏性/高成本操作用户批准的替代方案。