iPAS AI 應用規劃師(中級) 科目2 大數據處理分析與應用 (8) 發佈留言 / 作者: S學院 / 2025-05-24 iPAS AI應用規劃師(中級) 科目2 大數據處理分析與應用 模擬試題 ,採智能選題,無限次反覆練習。 1. 關於天真貝氏分類器(Naive Bayes Classifier)的敘述,下列哪一項正確? 天真貝氏分類器假設所有特徵變數之間是高度相關的,並且會影響最終的分類結果 天真貝氏分類器主要用於處理迴歸問題,而不是分類問題 天真貝氏分類器假設所有特徵是條件獨立的,即每個特徵對於目標變數的影響是獨立於其他特徵的 天真貝氏分類器只能在大規模數據集上有效,對小規模數據集無法提供準確的預測 None 2. 如附圖所示為 Python 程式碼,關於程式碼的敘述,下列哪一項錯誤? 第 2 列是讀取 CSV 檔案轉成資料框型別 第 4 列是統計各群別銷售地區的資料內容加總 第 1 列是匯入 pandas 套件,並設定別名為 pd 第 3 列是以產品種類進行分群 None 3. 假設教師用傳統教學法教授學生之統計平均成績為 75 分。此教師想要驗證一種新的教學方法對學生統計成績的影響,設立的虛無假設為「新的教學方法對學生統計成績沒有影響」(H₀: μ = 75),對立假設為「新的教學方法提高學生統計成績」(Ha: μ > 75)。經過實驗,從 36 名學生中獲得的成績樣本平均數為 78,樣本標準差為 10。計算得出的 t 值為 1.8,對應的 p 值約為 0.04。假設顯著水準(Significance Level)設定為 0.05,請問研究者應該如何解釋數據分析後之檢定結果? 不拒絕虛無假設,因為 p 值略低於 0.05 需要更多數據來驗證檢定結果的穩定性 拒絕虛無假設,並認為新的教學方法可提高學生統計成績 不拒絕虛無假設,因為樣本平均數未顯著超過 75 None 4. 關於低結構化文字資料前處理的敘述,下列哪一項錯誤? 移除停駐詞(Stop Words):例如移除英文中的 the、as、to、from 等介係詞或助詞,它們對本文語意的瞭解可能沒有太大幫助 本文正規化(Text Normalization):是將輸入的本文轉換為標準形式,如:將數字、符號、縮寫等轉換為全稱 資料清理(Data Cleaning):例如網頁資料,必須先移除 HTML 標籤(Tag),取出乾淨的本文 分詞(Tokenize):透過移除單字的後綴,進行字根還原 None 5. 特徵選取(Feature Selection)和特徵萃取(Feature Extraction)是兩種不同的技術,用於處理資料集的特徵。關於這兩者的敘述,下列哪一項是正確的比較? 特徵萃取比特徵選取更常用於預測模型的訓練過程 特徵選取是使用機器學習模型(如決策樹)直接篩選特徵,而特徵萃取則不涉及任何模型的使用 特徵選取是從原始特徵中選擇最重要的部分,而特徵萃取是從原始特徵透過特定方法生成新的特徵 特徵選取常使用隨機森林來選擇特徵,而特徵萃取則是通過聚類分析生成新特徵 None 6. 關於 Python 所提供的資料表排序功能敘述,下列哪一項錯誤? sort_values()是以內定列索引為鍵值進行排序 ascending=False,表示由大到小排列 ascending=True,表示由小到大排列 sort_index()是以內定列索引為鍵值(Key 值)進行排序 None 7. 在比較不同分組的統計量時,我們通常關注下列哪一項指標? 平均值和標準差 僅中位數 僅平均值 僅資料的最大值 None 8. 在進行機器學習時,當資料的數值範圍差異過大會影響模型的表現。關於數值資料調整方式的敘述,下列哪一項正確? 資料標準化(Standardization)會將資料的範圍縮放到[0, 1]之間,使得所有變數在相同尺度下進行計算 當資料特徵服從常態分佈時,資料標準化相較於正規化更適合用來調整資料範圍 資料正規化(Normalization)會將資料調整成均值為 0、標準差為 1,以便模型能夠更有效率地訓練 當資料具有明顯的異常值時,資料標準化可以有效避免異常值的影響,因為其考慮了最小值與最大值 None 9. 一位數據分析師正在分析一組員工薪資數據,並計算以下統計指標。下列敘述哪一項敘述錯誤? 算術平均數易受到極端高薪或低薪的影響 中位數是將數據排序後位於中間的值,並能有效抵抗極端值的影響 四分位數可以幫助識別數據中的異常值 標準差越大,表示數據的變異性越小,數據點越接近平均數 None 10. 在進行假設檢定時,當 p 值小於α(顯著性水準)時,下列結論哪一項正確? 拒絕虛無假設 接受虛無假設 接受對立假設 拒絕對立假設 None 11. 在資料分析中,主成份分析(Principal Components Analysis, PCA)是一種特徵萃取(Feature Extraction)的技術。PCA 的主要目的下列哪一項正確? 提高數據的維度以捕捉更多的特徵訊息 從原始數據中提取最具變異性的特徵以減少維度 將特徵轉換為類別變數以便於模型訓練 透過轉換數據來強化特徵之間的相關性 None 12. 一位數據分析師正在分析一組銷售數據,並希望了解數據的分布特徵以及變數之間的相關性。關於資料分布和相關性的敘述,下列哪一項正確? 散佈圖可以幫助呈現兩個變數之間的關係,包括線性和非線性關係 當變數之間的相關係數為 0 時,表示它們之間存在強烈的非線性關係 當數據具有常態分佈時,標準差是唯一適合描述數據變異性的指標 數據分布呈現偏態時,算術平均數會比中位數更能準確地反映數據的中心趨勢 None 13. 關於資料尺度的敘述,下列哪一項正確? 等距尺度比順序尺度粗糙 比率尺度可以轉換成名目尺度 順序尺度加減運算後是有意義的 名目尺度是衡量數值型變數 None 14. 在非監督式學習的觀念和應用情境中,下列敘述哪一項錯誤? 使用聚類方法(Clustering)將商品依照銷售模式進行分類,以幫助公司制定銷售策略 使用關聯規則學習來分析顧客購買行為,發現商品之間的隱藏關聯 使用主成份分析(Principal Components Analysis, PCA)來降低高維度資料的複雜性,以便進行視覺化分析 使用支持向量機(Support Vector Machine, SVM)對數據進行分類,根據已知標籤來預測新樣本類別 None 15. 假設我們有以下依升序排列的薪資值(仟元):32、35、48、50、52、56、56、60、65、72、72、120;關於第一個四分位數(First quartile, Q1)、四分位距(Interquartile Range, IQR)與第三個四分位數(Third quartile, Q3),下列敘述哪一項正確? 第一個四分位數(Q1):50 仟元 四分位距(IQR):17 仟元 第三個四分位數(Q3):72 仟元 四分位距(IQR):56 仟元 None 16. 下列敘述哪一項正確? 眾數容易受到極值影響 平均數不會受到極值影響 中位數不會受到極值影響 極值一定是異常值 None 17. 關於文本資料的敘述,下列哪一項正確? 文本語料庫中,文字資料通常是標準化的資料 詞性標註(Part Of Speech, POS)是一種詮釋資料的方式 文本資料通常不太需要新增額外的詮釋資料,就可擁有不錯的結構性 文本資料是一種高結構化(Highly Structured Data) None 18. 判斷資料是否接近常態可以透過常態分位數圖(Quantile-Quantile Plot , QQ Plot)來檢視,下列哪一項接近常態分佈? C B D A None 19. 關於決策樹(Decision Tree)的敘述,下列哪一項正確? 決策樹對數據中的小變化不敏感,能夠穩健地處理不同的數據集 決策樹的剪枝過程主要是用來增加模型的複雜度,以便更好地擬合訓練數據 決策樹中的每一個節點都會進行多次分裂,以尋找最佳的分裂特徵和閾值,以達到最佳的模型性能 決策樹的深度對模型的複雜度和過擬合風險有重要影響,樹的深度越大,模型越容易過度擬合訓練數據 None 20. 在進行數據分析時,了解資料的性質與類型對於選擇合適的分析方法相當重要。關於資料的性質和處理方式,下列敘述哪一項正確? 離散型資料(Discrete Data)的分佈通常用連續的機率密度函數來描述 順序型資料(Ordinal Data)的比較可以使用中位數來評估差異 名目型資料(Nominal Data)的分析通常需要使用 t 檢定來檢查兩個群體之間的差異 連續型資料(Continuous Data)只能使用線性迴歸進行分析,無法使用其他統計方法 None 如有問題可留言,謝謝您的寶貴意見! 暱稱 電郵(提交獲得正確答案,可換題測驗完整題庫,新增題庫電郵通知) Time's up