Databricks ブログ

ページ 62

レイクハウス用データクリーンルームの紹介

June 28, 2022 Matei Zaharia、Itai Weiss、Steve Mahoney、サチン・タクール、ダン・モリス、ジェイ・バンカリアによる投稿 in プラットフォーム

翻訳: Masahiko Kitamura オリジナル記事： Introducing Data Clean Rooms for the Lakehouse Lakehouseのデータクリーンルームを発表することで、企業はプライバシーを保護した方法で、顧客やパートナーとあらゆるクラウド上で簡単にコラボレーションできるようになります。データ・クリーン・ルームの参加者は、データのプライバシーを維持しながら、既存のデータを共有、結合し、データ上でPython、R、SQL、Java、Scalaなどあらゆる言語で複雑なワークロードを実行することができます。外部データの需要がかつてないほど高まる中、組織はデータ主導のイノベーションを促進するため、データを安全に交換し、外部データを利用する方法を模索している。歴史的に、組織はデータ共有ソリューションを活用してパートナーとデータを共有し、データのプライバシーを守るために相互信頼に依存してきた。しかし、一度共有されたデータの管理は放棄され、さまざまなプラットフォームでデータがパート

Databricks レイクハウスプラットフォームでのデータウェアハウスのモデリングと実装

June 24, 2022 ソハム・バット、Deepak Sekar による投稿 in プラットフォーム

レイクハウスは、データレイクとデータウェアハウスの長所を組み合わせた、新しいデータプラットフォームパラダイムです。多くのユースケースやデータプロダクトを格納できる、大規模なエンタープライズレベルのデータプラットフォームとして設計されています。データレイクとデータウェアハウスを統合した、単一のエンタープライズデータリポジトリとして使用することができます。データドメインリアルタイムストリーミングのユースケースデータマート異種データウェアハウスデータサイエンス機能ストア、データサイエンスサンドボックス部門別のセルフサービス型分析サンドボックスユースケースの多様性を考えると、レイクハウスのプロジェクトによって異なるデータ整理の原則やモデリングテクニックが適用されるかもしれません。技術的には、 Databricks レイクハウスプラットフォームは、多くの異なるデータモデリング形式をサポートすることができます。この記事では、レイクハウスの Bronze/Silver/Goldデータ編成原則の実装と、異なるデー

Delta Lake で Databricks にスタースキーマを実装するための簡単な 5 ステップ

May 20, 2022 Cary Moore、Lucas Bilbro、Brenner Heintz による投稿 in 製品

データウェアハウスの開発者の多くは、常に存在するスタースキーマに精通しています。1990 年代にラルフ・キンボールによって紹介されたスタースキーマは、ビジネスデータをディメンション（時間や商品など）とファクト（金額や数量のトランザクション）に非正規化するために使用されます。スタースキーマは、反復的なビジネス定義の重複を減らすことで、データの保存、履歴の維持、更新を効率的に行い、集計とフィルタリングを高速化します。ビジネスインテリジェンス（BI）アプリケーションをサポートするスタースキーマの一般的な実装は、慣例化し成功しているため、多くのデータモデルの設計者にとってその実装は極めて容易なものになっています。Databricks では、非常に多くのデータアプリケーションを作成しており、経験則によるベストプラクティスのアプローチ、成果につながることを保証する基本的な実装を常に探求しています。従来のデータウェアハウスと同様に、Delta Lake でもいくつかの簡単な経験則に従うことで、Delta スタースキーマの結

金融機関 TD Bank におけるクラウド化 - データ環境のモダナイゼーション事例

May 20, 2022 中井淳太、Jonathan Hollander による投稿 in Databricks ブログ

1955 年以来、TD Bank グループは、変化する世界において成功する自信を顧客とコミュニティに提供することを目指してきました。10 年が経過するごとに要求は厳しく、複雑さは増していますが、TD は一貫してこの課題に取り組んでいます。このブログでは、Databricks 金融サービス＆サステナビリティ部門 GTM グローバルヘッドのジュンタ・ナカイ（Junta Nakai）が、TD Bank エンタープライズデータテクノロジープラットフォーム部門 VP のジョナサン・ホランダー（Jonathan Hollander）氏に伺った TD における技術変革の事例をインタビュー形式でご紹介します。顧客体験の向上を支援するために分析機能を強化するよう設計された Delta Lake と Azure クラウドによる新しいモダンデータ資産への移行理由に焦点を当てています。...

J&J 社におけるデータの民主化によるサプライチェーン最適化の事例

April 25, 2022 Mrunal Saraiya による投稿 in 導入事例

本ブログは、ジョンソン・エンド・ジョンソン社の先端技術（データ、インテリジェントオートメーション、先端技術インキュベーション）部門シニアディレクター、 Mrunal Saraiya 氏の執筆によるゲストブログです。ジョンソン・エンド・ジョンソン（J&J）は、グローバルな消費財および医薬品プロバイダーの中核的企業として 150 年以上にわたり、世界中の企業、患者、医師、人々にサービスを提供しています。私たちは、生命を維持する医療機器やワクチンをはじめ、市販薬、処方箋薬（これらの創薬に必要なツールや資源）など、市場に送り出す全てのものを入手可能な状態にし、多様な商品の品質、保管、お客様へのタイムリーな配送の一貫性を保証しなければなりません。製品やサービスをどのように地域社会に提供するかは、私たちの事業戦略の中核をなすものです。特に、消費者が製品に効果的にアクセスして使用できるようにするために、製品の配送時間、場所の厳守、公正な販売価格の保証を重要視しています。市場のサプライチェーンには、以前から物流に関す

Delta Live Tables の一般提供開始を発表

April 5, 2022 Michael Armbrust、Awez Syed、ポール・ラッパス、エリカ・エーリ、Sam Steiny、リチャード・トムリンソン、アンドレアス・ノイマン、Mukul Murthy による投稿 in プラットフォーム

Databricks は本日、 Delta Live Tables（DLT）の Amazon AWS と Microsoft Azure クラウドにおける一般公開、および Google Cloud におけるパブリックプレビューの提供開始を発表しました。このブログでは、DLT が大手企業のデータエンジニアやアナリストをどのように支援し、本番環境に対応したストリーミングとバッチパイプラインの簡単な構築や、大規模なインフラストラクチャの自動管理、および、新世代のデータ、分析、AI アプリケーションの提供に役立つかについて解説します。レイクハウスにおけるシンプルなストリーミングとバッチ ETL ETL（抽出・変換・ロード）に対するストリーミング、バッチワークロードの処理は、分析、データサイエンス、機械学習ワークロードの基本的な取り組みです。企業が生み出す膨大なデータ量がこの傾向を加速させています。しかし、未加工の構造化されていないデータを、クリーンで文書化された信頼のおける情報に処理することは、ビジネスの知見を推進す

レイクハウスによるデータの民主化がアムジェンの医薬品開発・提供を加速

March 22, 2022 Jaison Dominic、Kerby Johnson による投稿 in 導入事例

この記事は、アムジェン（Amgen）社のプロダクトオーナー Jaison Dominic 氏と、ディスティングイッシュドソフトウェアエンジニア Kerby Johnson 氏によるゲスト執筆記事です。世界最大の独立系バイオテクノロジー企業であるアムジェンは、長い間、イノベーションの代名詞とされてきました。40 年にわたり、新しい医薬品製造プロセスを開拓し、命を救う医薬品を開発し、世界中の何百万人もの人々の生活にプラスの影響を及ぼしてきました。患者さんに最高のサービスを提供するという使命を果たし続けるために、私たちは最近、完全なデジタル変革という新たなイノベーションのジャーニーに乗り出しました。研究開発の生産性向上からサプライチェーンや商品化の最適化まで、ビジネス全体の成果を上げるためのデータ活用を再考する過程で、データチームが解決しようとしている問題の種類がここ数年で劇的に変化していることがすぐに明らかになりました。さらに、これらの問題は、もはやスキルセットや部門、機能によって隔離されているわけではありま

Databricks SQL の新機能「クエリプロファイル」でクエリを理解する

February 23, 2022 ビラル・アスラム、Lucas Cerdan による投稿 in 製品

Databricks SQL は、 Databricks のレイクハウスプラットフォームにおける SQL のデータウェアハウス機能とファーストクラスのサポートを提供します。これにより、アナリストは従来のクラウドデータウェアハウスよりもわずかなコストで新たな知見を迅速に発見し、共有できるようになります。このブログは、Databricks SQL に関するコンテンツシリーズの一部です。Databricks SQL の性能、使いやすさ、ガバナンスにおける重要な機能について解説します。以前のブログでは、Databricks SQL の強化された最新のユーザーエクスペリエンスについてご紹介しました。今回は、ユーザーがクエリとクエリの性能を理解するのに役立つ改善点について解説します。実行時のボトルネックを特定してクエリを高速化 Databricks SQL は、自動的なクエリの高速化に優れています。事実、2021年11月に世界記録を更新しました。しかし、こういった技術革新にもかかわらず、クエリが予期せず遅いとい

小売・リテール業界向けレイクハウスによる課題解決と生産性の向上

January 13, 2022 ロブ・サカー（Rob Saker）、デビッド・ルグランによる投稿 in データ戦略

小売業のビジネスは、早朝からフル稼働しています。配送トラックは店舗や家庭に商品を届けるために拠点を出発し、店舗では開店の準備やその日の需要に応じた在庫の確認などが行われます。このように年中無休で稼働する小売業界にも、ここ数年で大きな変化が起きています。世界的なパンデミックが小売業界に与えた影響は大きく、10 年分の変化が一度に起こったといっても過言ではない状況となっています。また、消費者の意識も大きく変容し、かつてないほどの迅速性と完全性を求めるようになっています。実店舗は依然として重要である一方で、オムニチャネルをうまく取り入れ、購買エクスペリエンスを向上させる必要がありました。そこで小売業界では、DX の実現に向けたテクノロジーへの投資を加速させてきました。そして現在は、いかに業務を最適化して生産性を向上させ、収益率を上げるかという課題に取り組んでいます。データブリックスは、世界のあらゆるチャネルや地域の大手小売業者との連携を通じてリテール業界の課題解決を支援しています。連携先には、Walgreens、C

データレイクハウスでコンピュータビジョンアプリケーションを実現する

December 16, 2021 パウロ・ボルヘス、Bala Amavasai、ブライアン・スミス（Bryan Smith）による投稿 in エンジニアリングのブログ

Original Blog : Enabling Computer Vision Applications With the Data Lakehouse 翻訳： junichi.maruyama ブログ「 Tackle Unseen Quality, Operations and Safety Challenges with Lakehouse...