AWS 成本运营
AWS 成本与运营
本技能通过集成 MCP 服务器,为 AWS 成本优化、监控、可观测性和卓越运营提供全面指导。
AWS 文档要求
在回答之前,请务必使用 MCP 工具(mcp__aws-mcp__* 或 mcp__*awsdocs*__*)验证 AWS 相关事实。aws-mcp-setup 依赖项会自动加载 —— 如果 MCP 工具不可用,请引导用户完成该技能的设置流程。
集成 MCP 服务器
本插件提供 3 个 MCP 服务器:
内置服务器
#### 1. AWS Pricing MCP 服务器 (pricing)
用途:部署前成本估算与优化
- 在部署资源前估算成本
- 比较不同区域的定价
- 计算总拥有成本 (TCO)
- 评估不同服务选项的成本效益
#### 2. AWS Cost Explorer MCP 服务器 (costexp)
用途:详细的成本分析与报告
- 分析历史支出模式
- 识别成本异常和趋势
- 预测未来成本
- 按服务、区域或标签分析成本
#### 3. Amazon CloudWatch MCP 服务器 (cw)
用途:指标、警报和日志分析
- 查询 CloudWatch 指标和日志
- 创建并管理 CloudWatch 警报
- 排查运营问题
- 监控资源利用率
> 注意:以下服务器可通过 Full AWS MCP Server 单独获取(参见 aws-mcp-setup 技能),未包含在本插件中:
> - AWS Billing and Cost Management MCP —— 实时计费详情
> - CloudWatch Application Signals MCP —— APM 和 SLO
> - AWS Managed Prometheus MCP —— 容器 PromQL 查询
> - AWS CloudTrail MCP —— API 活动审计
> - AWS Well-Architected Security Assessment MCP —— 安全态势评估
何时使用此技能
在以下场景中使用此技能:
- 优化 AWS 成本并降低支出
- 部署前估算成本
- 监控应用程序和基础设施性能
- 设置可观测性和告警
- 分析支出模式和趋势
- 调查运营问题
- 审计 AWS 活动和变更
- 评估安全态势
- 实现卓越运营
成本优化最佳实践
部署前成本估算
在部署前务必估算成本:
1. 使用 AWS Pricing MCP 估算资源成本
2. 比较不同区域的定价
3. 评估替代服务选项
4. 计算预期月度成本
5. 规划扩容与增长
工作流示例:
"估算在 us-east-1 区域运行 Lambda 函数的月度成本:调用量 100 万次,内存 512MB,执行时长 3 秒"成本分析与优化
定期进行成本审查:
1. 使用 Cost Explorer MCP 分析支出趋势
2. 识别成本异常和意外费用
3. 按服务、区域和环境审查成本
4. 对比实际支出与预算成本
5. 生成成本优化建议
成本优化策略:
- 对过度配置的资源进行规格调整(Right-size)
- 使用合适的存储类(S3, EBS)
- 为动态工作负载实施自动扩缩容
- 利用 Savings Plans 和预留实例(Reserved Instances)
- 删除未使用的资源和快照
- 有效使用成本分配标签
预算监控
跟踪预算支出情况:
1. 使用 Billing and Cost Management MCP 监控预算
2. 为阈值突破设置预算警报
3. 定期审查预算利用率
4. 根据趋势调整预算
5. 实施成本控制和治理
监控与可观测性最佳实践
CloudWatch 指标与警报
实施全面监控:
1. 使用 CloudWatch MCP 查询指标和日志
2. 为关键指标设置警报:
- CPU 和内存利用率
- 错误率和延迟
- 队列深度和处理时间
- API 网关节流(Throttling)
- Lambda 错误和超时
3. 创建 CloudWatch 仪表板进行可视化
4. 使用 Log Insights 进行故障排查
常见警报场景:
- Lambda 错误率 > 1%
- EC2 CPU 利用率 > 80%
- API Gateway 4xx/5xx 错误激增
- DynamoDB 请求被节流
- ECS 任务失败
应用性能监控 (APM)
监控应用健康状况:
1. 使用 CloudWatch Application Signals MCP 进行 APM
2. 跟踪服务水平目标 (SLOs)
3. 监控应用依赖关系
4. 识别性能瓶颈
5. 设置分布式追踪
容器与 Kubernetes 监控
针对容器化工作负载:
1. 使用 AWS Managed Prometheus MCP 获取指标
2. 监控容器资源利用率
3. 跟踪 Pod 和节点健康状况
4. 创建 PromQL 查询以获取自定义指标
5. 为容器异常设置警报
审计与安全最佳实践
CloudTrail 活动分析
审计 AWS 活动:
1. 使用 CloudTrail MCP 分析 API 活动
2. 跟踪谁对资源进行了更改
3. 调查安全事件
4. 监控可疑活动模式
5. 审计策略合规性
常见审计场景:
- “谁删除了这个 S3 存储桶?”
- “显示过去 24 小时内所有 IAM 角色的更改”
- “列出失败的登录尝试”
- “查找特定用户的所有操作”
- “跟踪安全组的修改”
安全评估
定期安全审查:
1. 使用 Well-Architected Security Assessment MCP
2. 根据最佳实践评估安全态势
3. 识别安全漏洞和缺陷
4. 实施建议的安全改进
5. 记录安全合规情况
安全评估领域:
- 身份与访问管理 (IAM)
- 检测性控制与监控
- 基础设施保护
- 数据保护与加密
- 事件响应准备
高效使用 MCP 服务器
成本分析工作流
1. 部署前:使用 Pricing MCP 估算成本
2. 部署后:使用 Billing MCP 跟踪实际支出
3. 分析:使用 Cost Explorer MCP 进行详细成本分析
4. 优化:实施 Cost Explorer 提供的建议
监控工作流
1. 配置:配置 CloudWatch 指标和警报
2. 监控:使用 CloudWatch MCP 跟踪关键指标
3. 分析:使用 Application Signals 获取 APM 洞察
4. 排障:查询 CloudWatch Logs 以解决问题
安全工作流
1. 审计:使用 CloudTrail MCP 审查活动
2. 评估:使用 Well-Architected...
安全评估
3. 修复:实施安全建议
4. 监控:通过 CloudWatch 跟踪安全事件
MCP 使用最佳实践
1. 成本意识:在部署资源前检查定价
2. 主动监控:为关键指标设置警报
3. 定期审查:每周分析成本和性能
4. 审计追踪:审查 CloudTrail 日志以确保合规性
5. 安全至上:定期运行安全评估
6. 持续优化:根据成本和性能建议采取行动
卓越运营指南
成本优化
- 全面打标签:使用一致的成本分配标签
- 每月审查:分析支出趋势和异常情况
- 合理配置规模:使资源与实际用量相匹配
- 自动化:使用自动扩展(Auto-scaling)和调度
- 预算监控:为成本超支设置警报
监控与警报
- 关键指标:针对业务关键指标设置警报
- 降低噪音:微调阈值以减少误报
- 可操作的警报:确保警报包含明确的修复步骤
- 仪表盘可视化:为关键利益相关者创建仪表盘
- 日志保留:平衡成本与合规需求
安全与合规
- 最小权限原则:授予所需的最小权限
- 定期审计:审查 CloudTrail 日志以发现异常
- 数据加密:对静态数据和传输中数据进行加密
- 持续评估:频繁运行安全评估
- 事件响应:制定安全事件处理流程
附加资源
有关详细的运营模式和最佳实践,请参考综合参考文档:
文件:references/operations-patterns.md
该参考文档包括:
- 成本优化策略
- 监控与警报模式
- 可观测性最佳实践
- 安全与合规指南
- 故障排除工作流
CloudWatch 警报参考
文件:references/cloudwatch-alarms.md
以下服务的常见警报配置:
- Lambda 函数
- EC2 实例
- RDS 数据库
- DynamoDB 表
- API Gateway
- ECS 服务
- Application Load Balancers (ALB)
局限性
- 仅在任务与上游来源及本地项目上下文明确匹配时使用此技能。
- 在应用更改前,请验证命令、生成的代码、依赖项、凭据以及外部服务的行为。
- 不要将示例视为环境特定测试、安全审查或破坏性/高成本操作用户批准的替代方案。