Associate Data Practitioner Practice Test
Associate Data Practitioner के लिए अपना आत्मविश्वास बढ़ाएँ। अवधारणाओं का अभ्यास करें, उत्तरों को समझें और हर सवाल के साथ अपना ज्ञान मज़बूत करें।
एक नमूना सवाल आज़माएँपरीक्षा का परिचय और विवरण
The Associate Data Practitioner exam is a comprehensive 44-question assessment designed to validate foundational competency in core data handling and analysis principles. This exam tests practical knowledge across the full data lifecycle, from acquisition and cleaning to analysis, visualization, and basic interpretation. It is intended for individuals beginning their data careers, such as junior data analysts, business intelligence specialists, operations staff who work with data, and professionals in adjacent roles seeking to formalize their data skills. Successful candidates will demonstrate they can reliably execute fundamental data tasks, understand essential terminology, and apply core methodologies under guidance. Passing this exam signifies a solid, practical foundation upon which to build more advanced specialization, proving to employers a commitment to data literacy and technical proficiency.
नमूना प्रश्न
अभ्यास कैसे काम करता है, यह जानने के लिए एक उत्तर चुनें और व्याख्या देखें।
A data visualization is most effective when it enables the viewer to quickly and accurately perceive the intended message. Arrange the following steps in the RECOMMENDED order for creating an effective data visualization. 1. Encode the data using visual marks (bars, lines, points) and channels (position, color, size). 2. Identify the key message or question the visualization must answer. 3. Select an appropriate chart type based on the data and the message. 4. Clean and prepare the dataset for visualization. 5. Remove clutter and non-essential elements to maximize data-ink ratio.
सही और लक्ष्य-उन्मुख कार्य प्रवाह यह है: सबसे पहले, उद्देश्य को परिभाषित करें (2: संदेश की पहचान करें)। आप बिना जानते हुए कि आप क्या संवाद करना चाहते हैं, प्रभावी ढंग से चार्ट या डिज़ाइन चुन नहीं सकते। इसके बाद, सही डेटा की पुष्टि करें (4: डेटा को तैयार करें)। गड़बड़ी में डेटा भी होता है, और यह विज़ुअल्स पर भी लागू होता है। फिर, अपने डेटा संरचना और संदेश के अनुसार एक उपयुक्त चार्ट प्रकार चुनें (3: चार्ट प्रकार चुनें)। इन चरणों के बाद ही डिज़ाइन को लागू करें जिसमें डेटा को विज़ुअली कोड करें (1: डेटा को कोड करें) और अंत में इसे स्पष्ट करने के लिए ग्राफ़जंक (5: गैर-जरूरी तत्वों को हटाएं) को हटाएं। डेटा तैयारी (बी, डी) से पहले उद्देश्य को परिभाषित करना (ए) अनावश्यक सफाई या गुमराह करने वाले चार्ट का कारण बन सकता है। चार्ट प्रकार (सी) चुनने से पहले डेटा को तैयार करना (डी) जल्दबाजी है।
Retail Sales Pipeline A retail company has a data pipeline that extracts sales transaction data from point-of-sale (POS) systems each night, transforms it (e.g., converts currencies, aggregates line items), and loads it into a central data warehouse for reporting. The pipeline is scheduled and orchestrated by a workflow management tool.
Which of the following patterns does this pipeline MOST closely exemplify?
स्थिति: रिटेल सेल्स पाइपलाइन
एक रिटेल कंपनी के पास एक डेटा पाइपलाइन है जो रात में पॉइंट ऑफ सेल (POS) सिस्टम से बिक्री लेनदेन डेटा को निकालता है, इसे बदल देता है (उदाहरण के लिए, मुद्रा को बदल देता है, लाइन आइटम को एकत्रित करता है), और इसे रिपोर्टिंग के लिए एक केंद्रीय डेटा वेयरहाउस में लोड करता है। पाइपलाइन को एक वर्कफ्लो प्रबंधन टूल द्वारा निर्धारित और निर्देशित किया जाता है।
यह स्केनरियो एक क्लासिक बैच ETL (Extract, Transform, Load) पैटर्न को वर्णित करता है। मुख्य संकेतक रात भर के निकास शेड्यूल (बैच अंतराल), विशिष्ट परिवर्तन चरण (मुद्रा परिवर्तन, एकत्रीकरण), और डेटा वेयरहाउस में लोड करना है जो रिपोर्टिंग के लिए है। इवेंट-ड्राइवन स्ट्रीमिंग (A) डेटा को जारी होने पर निरंतर रूप से प्रोसेस करता है, रात भर के बैचों में। चेंज डेटा कैप्चर (C) एक तकनीक है जो अक्सर एक पाइपलाइन के भीतर उपयोग की जाने वाली वृद्धि की परिवर्तनों की पहचान करने के लिए है, लेकिन यह स्केनरियो एक पूर्ण बैच निकास को वर्णित करता है। लैम्ब्डा आर्किटेक्चर (D) एक ही डेटा के लिए बैच और स्ट्रीमिंग पथों का संयोजन है, जो यहाँ उल्लिखित नहीं है। बैच ETL विश्वसनीय, निर्धारित रिपोर्टिंग पर ऐतिहासिक डेटा के लिए आवश्यक नहीं होने वाली sub-second लेटेंसी के लिए मूलभूत है।
Retail Sales Analysis A retail company wants to analyze weekly sales data from its 50 stores to identify trends and forecast demand. The dataset includes columns for Store_ID, Week_Ending_Date, Total_Sales, Number_of_Transactions, and Average_Transaction_Value. Preliminary analysis shows the Total_Sales data is right-skewed, with a few weeks of very high promotional sales.
Based on the scenario, which TWO actions should the data practitioner take to best prepare the Total_Sales variable for use in a linear regression model aiming to forecast sales? (Select TWO).
स्थिति: रिटेल बिक्री विश्लेषण
एक रिटेल कंपनी अपने 50 स्टोरों से सप्ताहान्त की बिक्री डेटा का विश्लेषण करना चाहती है ताकि वह प्रवृत्तियों की पहचान कर सके और मांग का अनुमान लगा सके। डेटासेट में स्तंभ हैं Store_ID, Week_Ending_Date, Total_Sales, Number_of_Transactions, और Average_Transaction_Value। प्रारंभिक विश्लेषण से पता चलता है कि Total_Sales डेटा दाहिनी ओर झुका हुआ है, जिसमें कुछ सप्ताह बहुत अधिक प्रचार बिक्री के साथ हैं।
इस स्थिति के आधार पर, डेटा प्रथमिक को किसी भी रेखीय पुनरावृत्ति मॉडल में बिक्री का अनुमान लगाने के लिए Total_Sales चर को उपयुक्त बनाने के लिए क्या दो कार्रवाइयाँ करनी चाहिए? (चुनें दो)।
रेखीय पुनरावृत्ति मॉडल में बिक्री का अनुमान लगाने के लिए Total_Sales चर को उपयुक्त बनाने के लिए डेटा प्रथमिक को निम्नलिखित दो कार्रवाइयाँ करनी चाहिए:
(A) लॉगारिथमिक परिवर्तन: यह एक मानक तकनीक है जो दाहिनी ओर झुकाव को कम करने के लिए उपयोग की जाती है, जिससे डेटा अधिक संगत और अक्सर रेखीय मॉडल के लिए अधिक उपयुक्त हो जाता है।
(C) विंसराइज़िंग: यह तकनीक अत्यधिक मानों को (उदाहरण के लिए, 95वें प्रतिशतिल के साथ) सीमित करती है जिससे डेटा का प्रभाव कम हो जाता है और डेटा को हटाने के बिना मॉडल को स्थिर बनाया जा सकता है।
(B) मिन-मैक्स स्केलिंग: यह तकनीक डेटा के दायरे को बदल देती है लेकिन इसकी वितरण को नहीं, इसलिए यह असमानता या अत्यधिक मान की समस्या का समाधान नहीं करती है।
(D) श्रेणीबद्ध करना: यह तकनीक मूल्यांकित जानकारी को नष्ट कर देती है और विश्लेषण की सांख्यिकीय शक्ति को कम करती है, जिससे यह एक अनुमानित रेखीय पुनरावृत्ति मॉडल के लिए एक खराब विकल्प बन जाती है।
When designing a relational database schema to minimize data redundancy and avoid update anomalies, a data practitioner should apply the principles of normalization. Which of the following are direct outcomes of properly normalizing a database to the Third Normal Form (3NF)? (Select all that apply.)
एक संबंधित डेटाबेस स्कीमा को डेटा रिडंडेंसी को कम करने और अपडेट एनोमैलीज़ से बचने के लिए डिज़ाइन करते समय, डेटा प्रैक्टिशनर को डेटा को तीसरे सामान्य रूप (3NF) में सामान्य करने के सिद्धांतों को लागू करना चाहिए। जिन निम्नलिखित को तीसरे सामान्य रूप (3NF) में सामान्य करने से सीधे परिणाम मिलते हैं (उचित चुनें)?
सही सामान्यीकरण से तीसरे सामान्य रूप (3NF) के परिणामस्वरूप सीधे होते हैं: ए) Transitive dependencies का उन्मूलन (जहां एक गैर-मुख्य गुणवत्ता एक अन्य गैर-मुख्य गुणवत्ता पर निर्भर करता है), बी) प्रत्येक गैर-मुख्य गुणवत्ता प्राथमिक कुंजी पर पूरी तरह से कार्यात्मक निर्भरता है (यह वास्तव में दूसरे सामान्य रूप (2NF) की परिभाषा है, जो 3NF के लिए एक आवश्यकता है), और डी) प्रत्येक टेबल एक एकल संपत्ति या विचार का प्रतिनिधित्व करता है। विकल्प सी, 'सभी multi-valued dependencies को हटा दिया जाता है', 3NF का उद्देश्य नहीं है, बल्कि चौथे सामान्य रूप (4NF) का है। विकल्प ई, 'प्रत्येक निर्धारक एक उम्मीदवार कुंजी है', बॉयस-कोड सामान्य रूप (BCNF) की परिभाषा है, जो 3NF से अधिक मजबूत है। वास्तव में, 3NF अक्सर ऑनलाइन लेनदेन प्रसंस्करण (OLTP) सिस्टम के लिए लक्ष्य होता है क्योंकि यह प्रभावी ढंग से रिडंडेंसी को कम करता है और प्रबंधनीय जटिलता बनाए रखता है। 3NF के लिए एक उपयोगी स्मृति सहायता है: 'प्रत्येक गैर-मुख्य गुणवत्ता को मुख्य कुंजी के बारे में एक तथ्य प्रदान करना चाहिए, पूरे मुख्य कुंजी के बारे में और केवल मुख्य कुंजी के बारे में (मुझे कोड की मदद से)।
Retail Sales Pipeline A retail company's data engineering team has built an ETL pipeline that extracts sales data from point-of-sale systems nightly, transforms it by applying currency conversion and aggregating by product category, and loads it into a central data warehouse. The pipeline is scheduled and orchestrated using Apache Airflow.
Which of the following are characteristics of a well-architected, maintainable ETL pipeline as demonstrated in this scenario? (Select all that apply.)
एक संगठित और बनावटी ETL पाइपलाइन के विशेषताएं निम्नलिखित हैं:
एक बनावटी ETL पाइपलाइन में idempotency (A), fault tolerance (C), और modularity (E) की विशेषताएं होती हैं। Idempotency सुनिश्चित करता है कि नियमित नौकरियों या पुनः चलाने में विश्वसनीयता है, जिससे दोहरे रिकॉर्ड की रोकथाम होती है। Fault tolerance, जो अक्सर try-catch ब्लॉक और dead-letter queues के साथ लागू किया जाता है, आंशिक सफलता और आसान डीबगिंग की अनुमति देता है। Modularity के साथ, चिंताओं को अलग किया जाता है, जिससे स्वतंत्र विकास, परीक्षण (उदाहरण के लिए, एक परिवर्तन कार्य का यूनिट परीक्षण) और पुनर्व्यापार की अनुमति मिलती है। विकल्प B (monolithic design) एक anti-pattern है; यह एक 'बड़ा गंदा गोला' बनाता है जो मुश्किल से डीबग, परीक्षण और अपडेट किया जा सकता है। विकल्प D (hard-coded configurations) भी एक खराब अभ्यास है; निर्देशिकाएं बाहरी किया जाना चाहिए (उदाहरण के लिए, पर्यावरण चरों में या कॉन्फ़िगरेशन फ़ाइलों में) ताकि सुरक्षा और विभिन्न पर्यावरणों (विकास, स्टेजिंग, उत्पादन) में लचीलापन बढ़ाया जा सके। Airflow जैसे एक ऑर्केस्ट्रेटर (जिसे संदर्भ में उल्लेख किया गया है) ने अपने task-based DAG कार्यान्वयन मॉडल के माध्यम से निरंतरता और त्रुटि सहनशीलता को बढ़ावा दिया।
इस परीक्षा में क्या शामिल है
पढ़ाई की योजना बनाने के लिए प्रकाशित डोमेन भार का उपयोग करें। अभ्यास के परिणाम आपके सर्टिफिकेशन परीक्षा के स्कोर का अनुमान नहीं हैं।