亚马逊AWS官方博客

awschina

Author: awschina

MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

本文在亚马逊云科技中国区(宁夏)使用 llama.cpp 部署 Qwen3.6 系列大语言模型(27B Dense 和 35B-A3B MoE),对比了 Graviton4 ARM CPU、Intel x86 CPU 和 NVIDIA A10G GPU 三种硬件平台上 MTP (Multi-Token Prediction) 投机解码的实际加速效果,并给出了各芯片架构下的部署最佳实践。

使用 Pub/Sub 逻辑复制实现 Aurora PostgreSQL 大版本近零停机升级

Amazon Aurora PostgreSQL 大版本升级有多种方案可供选择。本文聚焦于手动蓝绿部署(Clone + 原生 Pub/Sub)方案,深入介绍如何利用 PostgreSQL 原生逻辑复制能力,以分钟级停机时间完成 Aurora PostgreSQL 大版本升级。
文中以 PostgreSQL 13 升级至 PostgreSQL 17 为例进行说明,相同步骤适用于其他 Aurora PostgreSQL 大版本升级组合(如 PG11→PG15、PG14→PG17 等)。本文还重点讲解针对高写入量表的并行订阅任务拆分技巧,以及完整的回滚保障机制。

基于 Amazon Bedrock 的 Apache SeaTunnel AI CLI 模型评测:从配置生成到真实执行

本文以 Apache SeaTunnel AI CLI 项目为基础,通过 Amazon Bedrock 的统一模型访问层,对 7 个模型完成 100 个 ETL 任务的分层评测:不仅衡量配置生成和静态校验结果,也在真实数据环境中验证执行。实验显示,模型在静态校验阶段的表现不能直接预测其真实执行成功率。本文的目标不是给出一份通用模型排行榜,而是提供一套面向 AI 辅助 ETL 的评测与选型方法:团队应结合自身任务复杂度、运行时成功率、错误修复能力和总体成本,持续选择并验证最适合自身数据环境的模型组合。

基于SGLang的大模型推理实践——从benchmark方法论到部署方案选型与调优

随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。在实际项目中,如何高效地在GPU集群上部署和优化大模型推理,已经成为AI基础设施团队面临的核心挑战之一。本文基于多个实际项目的经验积累,系统性地介绍大模型推理部署的方法论、部署方案选型、性能调优以及常见问题的解决方案。

在 Amazon EKS 上构建开源可观测性数据栈:VictoriaMetrics + Grafana Loki + Grafana Tempo

本文分享在 Amazon EKS 上自建开源可观测性数据栈的完整实战:用 VictoriaMetrics、Grafana Loki、Grafana Tempo 分别承载指标、日志与链路,数据存入 Amazon S3 与 EBS gp3,通过 IRSA 安全集成。借助 OpenTelemetry Operator 实现存量微服务零代码接入,并在 Grafana 中打通 trace、log、metrics 三向一键关联,自动生成服务拓扑,显著提升故障排查效率。