Amazon Web Services ブログ

Category: Analytics

Razor Group が AWS でモダンなデータレイクハウスを構築するまでの道のり

Razor Group は 250 以上のブランドを展開する欧州有数の EC アグリゲーターです。本記事では、同社が AWS 上に Apache Iceberg と Amazon S3 Tables を軸としたレイクハウスアーキテクチャを構築し、データプラットフォームを最適化した道のりを紹介します。段階的な移行アプローチ、アーキテクチャ上の意思決定、そしてインフラコスト 63% 削減やクエリ 65% 高速化といった測定可能な成果を取り上げます。

AWS Glue を使用して DynamoDB テーブルエクスポートをフィルタリング、変換、ロードする

この記事では、Amazon DynamoDB のフルまたはインクリメンタルテーブルエクスポートを 2 つ目の DynamoDB テーブルにロード(インポート)する方法を紹介します。何をロードするか、どの書き込みレートでロードするかを正確にコントロールでき、進捗を観察する機能も備えています。この技術は、最大限の制御が必要な大規模なデータマイグレーションや同期を推進するのに役立ちます。ここで説明するメカニズムは、オープンソースの Bulk Executor for DynamoDB のコマンドとして提供されています。これは、DynamoDB テーブルに対してバルクコマンドを実行するためのユーティリティセットです。このコマンドを使用することで、DynamoDB のエクスポート(済みデータ)を細かく制御しながらロードでき、アイテムを変換したり、データをフィルタリングしたり、コマンドのオプションの transform パラメータを使用して宛先テーブルに何を配置するかをカスタマイズしたりできます。

DuckDB で Amazon S3 Tables に格納された表形式データセットへのアクセスを効率化する

DuckDB は軽量なインメモリ SQL エンジンで、追加のサーバー運用なしに対話型のデータ分析を実現します。本記事では、Amazon SageMaker Lakehouse Iceberg REST エンドポイントと AWS Lake Formation のアクセス許可を利用して、AWS CloudShell 上の DuckDB から Amazon S3 Tables に格納された Iceberg テーブルにアクセスし、クエリを実行する手順を紹介します。

Amazon SageMaker Unified Studio のノートブックで、より速くインサイトに到達する

Amazon SageMaker Unified Studio のノートブックは、インフラ設定を簡素化し、インサイト獲得までの時間を短縮します。本記事では、Python と SQL のポリグロットプログラミング、複数エンジンでのデータアクセス、Athena Spark による分散プロファイリング、SageMaker Data Agent の AI 支援を活用し、単一のノートブック環境で住宅価格予測モデルを構築する流れを解説します。

AWS と DuckLabs: 分析の未来を共に築く

Amazon はオープンソース分析データベース DuckDB を開発するアムステルダム拠点の DuckLabs を買収する最終契約を締結しました。DuckDB は 1 テラバイト以下の日常的なクエリを圧倒的な速度で処理するアーキテクチャを持ち、データエンジニアリング、データサイエンス、分析、AI エージェントの分野で広く採用されています。オープンソースプロジェクトは引き続き独立した Foundation の下で MIT ライセンスで維持され、AWS は S3 や Redshift、Athena などのサービスと DuckDB の強みを組み合わせていきます。

Amazon S3 Tables による Amazon Redshift システムテーブルの長期保持

Amazon Redshift システムテーブルと Amazon S3 Tables の統合により、システムテーブルのログデータを Apache Iceberg 形式で自動的に保存し、7 日間の上限を超えて保持期間を設定できます。独自の ETL パイプラインやクラスターリソースを使わずに、長期的なコンプライアンス対応、監査、ウェアハウス横断の可観測性を実現します。本記事では、機能の仕組み、セットアップ手順、代表的なユースケースを解説します。