Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional日本語版) - Databricks-Certified-Data-Engineer-Professional日本語 Exam Practice Test

データエンジニアが、ソースからのCDC(変更データキャプチャ)データを処理するために、Lakeflow宣言型パイプラインを設定しています。ソースイベントは順序どおりに到着しないことがあり、同じupdate_timestampで異なるupdate_sequence_idを持つ複数の更新が発生することがあります。
イベントが正しく順序付けられていることを確認するために、データ エンジニアは何をすべきでしょうか?
Correct Answer: C
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
データパイプラインは、構造化ストリーミングを使用してKafkaからDelta Lakeにデータを取り込みます。データはBronzeテーブルに保存され、Kafka_generatedのタイムスタンプ、キー、値が含まれます。パイプラインの導入から3か月後、データエンジニアリングチームは、特定の時間帯にレイテンシが発生していることに気付きました。
シニアデータエンジニアがDelta Tableのスキーマと取り込みロジックを更新し、Apache Sparkによって記録された現在のタイムスタンプとKafkaのトピックおよびパーティションを追加します。チームは、追加されたメタデータフィールドを使用して、一時的な処理遅延を診断する予定です。
この問題を診断する際に、チームはどのような制限に直面するでしょうか?
Correct Answer: E
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
データエンジニアは、display(df.collect()) から結果を出力する前に、多数の変換を含むインタラクティブノートブックで作業しています。ノートブックには、ワイド変換とクロス結合が含まれています。
データ エンジニアが次のエラーを受け取りました: 「Spark ドライバーが予期せず停止したため、再起動しています。ノートブックは自動的に再接続されます。」データ エンジニアはどのようなアクションを実行する必要がありますか?
Correct Answer: A
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
データアーキテクトは、様々なビジネス要件に合わせてデータを効率的に処理するためのDatabricksソリューションを設計しています。データエンジニアは、ストリーミングテーブルではなくマテリアライズドビューをどのようなシナリオで使用すべきでしょうか?
Correct Answer: D
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
ジュニアデータエンジニアの1人が、DataFrame dfを用いたグループ化された集計機能を備えたストリーミングデータパイプラインの開発を依頼されました。このパイプラインでは、重複しない5分間隔ごとに平均湿度と平均気温を計算する必要があります。イベントはデバイスごとに1分ごとに記録されます。
ストリーミング DataFrame df には次のスキーマがあります。
「device_id INT、event_time TIMESTAMP、temp FLOAT、humidity FLOAT」
コードブロック:

このタスクを完了するには、コード ブロック内の空白を正しく埋める応答を選択してください。
Correct Answer: A
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
本番環境データへの偶発的なコミットを防ぐため、シニアデータエンジニアは、すべての開発作業でDelta Lakeテーブルのクローンを参照するというポリシーを制定しました。ディープクローンとシャロークローンの両方をテストした後、シャロークローンを使用して開発テーブルを作成しました。最初のテーブル作成から数週間後、タイプ1の緩やかに変化するディメンション(SCD)として実装された複数のテーブルのクローンバージョンが動作しなくなりました。ソーステーブルのトランザクションログには、前日にバキュームが実行されたことが記録されています。
クローンされたテーブルが機能しなくなったのはなぜですか?
Correct Answer: B
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
データエンジニアは、ワークスペース内の既存のパイプライン設定をキャプチャし、それを使用してJSONファイルを作成し、バージョン管理して新しいパイプラインを作成する必要があります。データエンジニアは、Databricks CLIで構成されたWebターミナルにどのコマンドを入力すればよいでしょうか?
Correct Answer: D
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
Lakehouse内のDelta Lakeテーブル「customer_parsams」は、機械学習チームによる顧客離脱予測に使用されています。このテーブルには、複数の上流ソースから得られた顧客情報が含まれています。現在、データエンジニアリングチームは、上流データソースから得られた最新の有効な値でこのテーブルを毎晩上書きすることで、データを更新しています。
データエンジニアチームは、各更新が成功した直後に、テーブルの新しいバージョンと以前のバージョンとの差異を確認したいと考えています。現在の実装では、どの方法を使用できますか?
Correct Answer: C
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
夜間バッチジョブは、クラウドオブジェクトストレージコンテナからすべてのデータファイルを取り込むように設定されています。このコンテナには、YYYY/MM/DDというネストされたディレクトリ構造でレコードが保存されています。各日付のデータは、その日にソースシステムによって処理されたすべてのレコードを表します。一部のレコードはモデレーターの承認待ちのため、処理が遅れる場合があります。各エントリは製品に対するユーザーレビューを表し、以下のスキーマを持ちます。
user_id STRING、review_id BIGINT、product_id BIGINT、review_timestamp TIMESTAMP、review_text STRING 取り込みジョブは、ソースシステムと同一のスキーマを持つターゲットテーブル reviews_raw に、前日のすべてのデータを追加するように設定されています。パイプラインの次のステップは、reviews_raw に挿入されたすべての新規レコードを、データが完全に重複排除、検証、およびエンリッチされたテーブルに伝播するバッチ書き込みです。
このデータバッチを伝播するための計算コストを最小限に抑えるソリューションはどれですか?
Correct Answer: C
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
セキュリティ チームは、Databricks シークレット モジュールを利用して外部データベースに接続できるかどうかを調査しています。
すべてのPython変数を文字列で定義してコードをテストした後、パスワードをsecretsモジュールにアップロードし、現在アクティブなユーザーに適切な権限を設定します。その後、コードを以下のように変更します(他の変数はすべて変更しません)。

上記のコードが実行されると何が起こるかを説明している文はどれですか?
Correct Answer: B
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
シニアデータエンジニアが大規模なデータワークフローを計画しています。現在の課題は、大規模データセットの効果的な管理に不可欠な、スケーラブルなデータモデル構築の基盤となる考慮事項を特定することです。データエンジニアリングチームは、最新のデータプラットフォームを構築するためのスケーラブルなデータモデルを構成するコア機能を特定し、Delta Lakeを検討対象とする理由を示しました。シニアデータエンジニアは、有効でない推奨事項を特定する責任を負います。Delta Lakeを評価する際に、どの主要機能を無視してもよいでしょうか?
Correct Answer: C
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).
Databricksジョブは3つのタスクで構成されており、それぞれがDatabricksノートブックです。タスクAは他のタスクに依存しません。タスクBとCは並列実行され、それぞれがタスクAに対して順次依存関係を持ちます。
スケジュールされた実行中にタスク A が失敗した場合、この実行の結果を説明するステートメントはどれですか。
Correct Answer: A
Explanation: Only visible for ExamsLabs members. You can sign-up / login (it's free).