亚马逊AWS官方博客
从 0 到推理:用 AWS Spot GPU 打造一键自助的短时推理测试环境
摘要:在浏览器里点一下,就能在 Spot GPU 实例(H200 / B300)上拉起一套 SGLang 推理服务,跑完测试、收到飞书(Lark)通知,用完即拆。这是一个「低成本、一键、自助」的短时推理测试环境示例,面向不熟悉 AWS、又需要频繁做模型选型与性能验证的团队。
一、为什么要做这个:三大痛点
高性价比的开源大模型不断涌现。团队在正式采购或大规模投入 GPU 前,通常要先做一轮选型验证:把候选模型在目标机型上真实跑起来,测性能、比效果、给结论。缺少现成工具时,这件事会反复撞上同样的三堵墙。
痛点一:GPU 资源紧缺,而测试往往是短时、临时的需求
一次测试往往只需约 2 小时 GPU 时间,但一个 Capacity Block 预留通常要等上一天。为两小时的测试等一天,不划算。
本方案改用 Spot 容量,配一个 CDK 部署的容量轮询器(poller):每分钟扫描各区域 / 可用区,一有容量立即抢占启动,无需预留等待。
痛点二:业务 / LOB 用户不熟悉 AWS,走中台工单又慢
每次实验都走中台工单,会给本该自助的动作平添数天延迟。
本方案提供一个 React 自助门户:业务方不用懂 infra、也不用碰 AWS IAM——门户内置登录与授权,选好机型和部署方案、点一次,平台负责开机、部署并回报结果,全程不需要 AWS 账号或控制台。
痛点三:反复试验需要留痕与审计
同一个测试跑很多遍,需要留痕:跑了什么、何时跑的、结果如何。
本方案把每次预约与状态变更写入 DynamoDB,提供站内 History 页面,并把状态变更推送到飞书(Lark),产品内和聊天侧都可追溯。
二、解决方案总览
先说效果。借助它,一个不熟悉 AWS 的业务团队可以在一周内多次一键拉起实验环境,高频完成多轮推理实验,系统化采集性能指标、横向对比不同模型与部署方案,最终产出一份完整、可追溯的测试评估报告。原本要排队申请容量、开工单、手工搭环境的选型验证,被压缩成「浏览器点一下、用完即拆」。下面两张真实部署截图,分别是自助门户的一键操作,以及实验就绪后拿到的推理 endpoint 与飞书通知:
[图 1 自助门户:业务用户选好机型与部署方案,一键预约、在线监控,全程无需登录 AWS 控制台] |
[图 2 实验就绪:预约到达 ready 状态,直接给出可调用的推理 endpoint,并通过飞书通知同步结果] |
再看方案本身。流程很直接:用户在门户里选好机型与部署方案、填入访问白名单 IP,一键提交;平台随即抢占 Spot GPU 容量、启动实例并部署 SGLang 推理服务,就绪后把 endpoint 与飞书通知一并推送;用完点一下释放,成本随之停止。支撑这套体验的是三条主线,分别对应上面的三个痛点:
- Spot 容量 + 容量轮询器(快速路径):不去排队等 Capacity Block,而是用 Spot 容量加一个由 CDK 部署的轮询器,每分钟扫描区域 / 可用区,容量一出现就抢占启动,没有预留等待。
- React 自助门户(一键下单):业务用户在门户里选实例、选部署方案、一键提交,无需 AWS 技能。
- DynamoDB 记录 + History 页面 + 飞书通知(留痕 / 审计):每次预约与状态变更持久化到 DynamoDB,站内 History 页面可查,飞书(Lark)机器人在状态变更时推送消息。
三、解决方案架构
[图 3] |
平台是一个 AWS CDK 栈,控制面全部 Serverless:前端(React / Vite)托管在 S3、由 CloudFront 分发;API 经 CloudFront 转发到 API Gateway,由 Lambda 授权器做 Basic Auth;四个 Python Lambda(api / poller / deployer / orphan-cleaner)由 EventBridge 定时器协调,预约与状态全部落在 DynamoDB。数据面是多区域(us-east-1 / us-east-2 / us-west-2)的 EC2 Spot GPU:poller 每分钟扫描容量、抢到即启动,deployer 经 SSM 在实例上用 docker compose 拉起 SGLang 拓扑并做健康检查,orphan-cleaner 定时回收游离实例兜底成本。每次状态变更都会推送到飞书(Lark)。
3.1 部署方案以 docker compose 描述,便于测试期调参
每个部署方案都用一个 docker-compose 文件描述完整推理拓扑,这是测试期最方便的调参方式:模型路径、张量并行度(tp)、显存占用(mem-fraction-static)、CUDA Graph 批大小、EAGLE 投机解码、PD(prefill / decode)分离拓扑等全在一个 YAML 里,改一行、重启一次即可验证一组新参数,不用动平台代码。以 DeepSeek-V4-Flash 在 B300 上的 PD 分离方案为例:
# docker-compose-pd-v4flash-b300.yaml(节选)
services:
prefill-0:
image: lmsysorg/sglang:v0.5.17-cu130
command: >
python3 -m sglang.launch_server
--model-path /opt/dlami/nvme/models/deepseek-ai__DeepSeek-V4-Flash
--tp 2 --mem-fraction-static 0.85 --cuda-graph-max-bs 64
--disaggregation-mode prefill --disaggregation-bootstrap-port 9000
decode-0:
command: >
... --disaggregation-mode decode
--speculative-algorithm EAGLE --speculative-num-steps 3
router:
command: python3 -m sglang_router.launch_router --pd-disaggregation ...
平台内置多套开箱即用的方案,也支持在门户「方案管理」页自定义上传模板(填方案名、选机型、传 .yaml),重新部署即可生效——团队可按自己的模型和拓扑快速扩展新方案:
[图 4 方案管理:自定义上传 docker-compose 模板(选机型 + 传 .yaml),上传后重新部署即可生效] |
四、核心 AWS 能力:为什么用 Spot
算力侧的关键选择是用 Spot,而非其他容量方式。AWS 上获取 GPU 算力主要有三种,各有取舍:
- Spot(竞价实例):用 EC2 闲置容量,价格远低于按需、随开随用、无最短持有期,代价是可能被中断。
- Capacity Block(容量块预留):预约未来一段时间窗的整块 GPU,容量有保障,但通常要提前约、往往等到次日甚至更久。
- ODCR(按需容量预留):在指定可用区锁定按需容量,确保「要用时一定有」,只要预留存在就持续计费,适合长期稳定负载。
本方案的场景是一次只跑约 2 小时、可容忍中断的临时测试,Spot 最合适:Capacity Block 为两小时等一天不划算,ODCR 的持续计费对短时任务偏贵,而 Spot 随开随用、成本最低。配合 poller 每分钟抢容量、失败自动回收,恰好把「短、临时、高频」的选型验证做成低成本快速路径。
五、成本与资源防护
P5 / P6 这类 GPU 实例很烧钱,一台每小时数十美元。方案在设计时就重点防浪费,内置三重防护,避免「开了忘关」:
- 并发上限:H200 与 B300 各同时最多 1 台,从源头避免同机型重复拉起、多台并存。
- 飞书提醒:抢占、部署、就绪、失败、清理等每次关键状态变更都推送飞书,随时知道有没有实例在跑。
- 超时自动清理:部署超时或实例 idle 超时都会自动终止并回收,再加每 15 分钟的孤儿清道夫兜底,无需人工盯。
六、部署与运行
完整的部署步骤与运行方式(前置准备、CDK 部署、子网映射、上传前端、配置飞书 webhook、预约与释放等)请参考方案仓库
本仓库是一个 AWS 示例,以 MIT-0 许可证发布;作为示例(sample)提供,而非受支持的产品。
This repository is an AWS sample licensed under MIT-0. It is provided as a sample, not a supported product.
➡️ 下一步行动:
相关产品:
- Amazon CDK — 基础设施即代码框架
- Amazon DynamoDB — 无服务器分布式 NoSQL 数据库
- Amazon EC2 — 安全且可调整大小的计算容量
- AWS Lambda — 无需服务器即可运行代码
- Amazon CloudFront — 全球内容分发网络
相关文章:
- 750B MoE 模型从自建 RoCE 集群迁移至 AWS EFA:Prefill-Decode 分离推理的通信架构验证
- Claude Code 接入自建开源模型:企业私有化与降本实践
- 从IDC到云上GPU:基于 Amazon EKS 的大模型推理混合云弹性部署实践
- 基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优
- EKS 上的 GPU 工作负载:节点、网络与高性能存储的架构实践
*前述特定亚马逊云科技生成式人工智能相关的服务目前在亚马逊云科技海外区域可用。亚马逊云科技中国区域相关云服务由西云数据和光环新网运营,具体信息以中国区域官网为准。
本篇作者
AWS 架构师中心:云端创新的引领者探索 AWS 架构师中心,获取经实战验证的最佳实践与架构指南,助您高效构建安全、可靠的云上应用 |
![]() |





