こんにちわ。データ部の長野です。 TVISION INSIGHTSのデータ部では、複雑なデータ抽出をする機会が多々あります。 今回は最近おこなった複雑なデータ抽出ロジックの1つ、 「『継続して○○した日数』とその最大値」 をSQLで求める方法を紹介します! ======= …
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 皆さんはSQLを書く際に、どの程度サブクエリを使っていますか? TVISION INSIGHTSのデータチームでは、RedShiftを使用した分析のために複雑なSQLを書く必要があり、サブクエリを多…
こんにちは。データサイエンティスト、兼データ基盤エンジニアのshobyです。 今回は、データ抽出業務を効率化するために、RedShiftにユーザー定義関数を追加する方法をご紹介します。 RedShiftのユーザー定義関数 RedShiftでは、SQLもしくはPythonを使用し、…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 今回は、RedShiftの制約について注意すべき点をご紹介します。 概要 RedShiftの制約は違反できる DataPipelineを使った実質的なPrimary Key制約の実現 RedShiftの制約は違反できる…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 今回は、RedShiftを長年運用していく中でディスク使用量が肥大化していく問題に対して、列圧縮タイプを見直し、ディスク費用を節約する方法をご紹介します。 概要 RedShiftのデー…
はじめに こんにちわ、データ部の長野です。 TVISIONでは、非エンジニア向けのデータ抽出環境として少し前からRedashを使用しています。 社内で少しずつRedashが浸透していく中で 色々と便利だけど、他の会社ではどう使っているのだろうか(使えそうな事例が…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 皆さんは、開発環境のRedShiftでテスト用に本番データを使用したい場合にどうやってデータを移していますか? 今回は、S3を用いて本番環境のRedShiftから、開発用のRedShiftにデー…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 皆さんはRedShiftで「アカウント追加お願いします!」「権限追加お願いします!」といった運用オペレーションを依頼されることはどの程度ありますか? 今回は、週に一度は権限周り…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 皆さんは、分析結果の信頼性をどのように保証していますか? 近年では、データの重要性が増した結果、データサイエンティストの出した分析結果を元に、大きな意思決定もされるよう…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 皆さんは社内でどのようなSQLコーディング規約を設けていますか? 多くのエンジニアが関わるシステムにコーディング規約が必要なように、多くのデータサイエンティストが関わる分…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 今回は、S3に存在する生ログファイルの分析に便利なAmazon AthenaをRedashと連携する方法をご紹介します。 RedashとAthenaを連携し、生ログファイルを検証するクエリを問題に備え…
こんにちは。データサイエンティスト兼、データ基盤エンジニアのshobyです。 皆さんは「S3の生ログデータを分析してくれ」と言われた場合、どうしていますか? ログ分析基盤に入っておらず、S3にしか存在しない生ログデータを分析するのは骨が折れる作業です…
初めまして。 データサイエンティスト兼、データ基盤エンジニアのshobyです。 突然ですが皆さんは、データウェアハウスに保存されたログデータの信頼性をどのようにチェックしていますか? 日々追加されるログデータが分析に耐えうる品質の物かをチェックす…