iPAS AI 應用規劃師(中級) 科目2 大數據處理分析與應用 (5) / iPAS AI 應用規劃師, AI 測驗題庫, iPAS AI 中級, 測驗題庫 / 作者: S學院 iPAS AI應用規劃師(中級) 科目2 大數據處理分析與應用 模擬試題,採智能選題,無限次反覆練習。 1. 參考附圖,R 語言中,已知 mystr 為串列(list),希望取出圖中串列結果,下列選項之 lapply 函數敘述何者正確? mystr, ")", 3 mystr, "(", 3 mystr, "[", 3 mystr, "]", 3 None 2. Generative model 與 Discriminative model 是兩種不同類型的模型,Generative model 可以透過統計的方法,根據所觀測的資料來建立近似原始資料分布的統計模型,因此可以用在模擬上,下列何者「不」是 Generative model? GMM(Gaussian Mixture Model) Naïve Bayes HMM(Hidden Markov Model) Logistic regression None 3. 請問下列選項中的圖表,何者較「符合」附圖程式碼進行核密度估計繪圖(Kernel Density Estimation, KDE)的結果? None 4. 在迴歸分析當中,最常用的迴歸係數估計方法是普通最小平方法(Ordinary Least Squares, OLS),不過 OLS 常常被錯誤理解或誤用,關於 OLS 失靈的狀況,「不」包括下列何項? 某一變量是其他變量的線性組合 預測變量個數大於樣本數 預測變量間相關性(correlation)不足 預測變量矩陣存在共線性(collinearity) None 5. 關於使用支援向量機(Support Vector Machines, SVM)的核函數(kernel function)於處理分類問題時,下列敘述何者正確? None 6. 收集學生的國文、英文、統計、經濟、會計成績進行主成分分析(Principal Components Analysis, PCA),計算出 5 個特徵值,分別為:λ1=3.148,λ2=1.352,λ3=0.351,λ4=0.122,λ5=0.037,第 1 主成分,解釋全體變數的變異數比例為何? 87.3% 67.7% 62.9% 90.0% None 7. 關於分群(clustering)演算法,下列敘述何者正確? 資料量夠大就不需人為定義分群數 分群的效果與資料數量、群集數量都無關 k-means 演算法進行分群前,可先不決定 k 值 訓練模型所使用的資料不需要包含類別標籤 None 8. 請問執行附圖程式碼後,下列哪一個選項內的使用者 ID「不」在 df_final 的使用者 ID 欄位當中? A C E G None 9. 關於主成分分析(Principal Components Analysis, PCA)於特徵提取(feature extraction)之主要用途,下列敘述何者正確? 提取重要特徵後不能以圖像視覺化呈現多變量資料 將最相關的訊息與無關的雜訊結合 將問題領域中的數個變數,組合成單一或數個具訊息力的特徵變數 將低度相關的預測變數矩陣 X,轉換成相關且量多的潛在變項集合 None 10. 在影像分類中,假設圖片有 0,1,2 三個類別,請問我們該如何對附圖進行單熱編碼(one-hot encoding)? A=0, B=0, C=0 A=0, B=1, C=1 A=1, B=1, C=1 A=0, B=1, C=0 None 11. 有 4 種交叉驗證方法,分別為(1) 留一驗證法(leave-one-out cross-validation, LOOCV)、(2) 5 折(5-fold)交叉驗證、(3) Bootstrap、(4) 10 折(10-fold)交叉驗證。請問在一個約 1000 筆資料集的訓練過程,下列交叉驗證方法執行時間排序,何者正確? (4) > (2) > (1) > (3) (3) > (4) > (2) > (1) (1) > (3) > (4) > (2) (1) > (4) > (2) > (3) None 12. 請問下列敘述何者「不」正確? 判別分析(discriminant analysis)可以用來找出對於應變數有解釋能力的自變數 判別分析(discriminant analysis)的分析資料不需要任何的假設條件 判別分析與集群分析都是針對每個觀察值的個體做分類,但兩者的差異在於判別分析已知每個觀察值所屬群體,而集群分析則否 當應變數和自變數皆屬連續型資料,可用迴歸分析來探討其關係;若當應變數是分類時,可用判別分析(discriminant analysis)來探討其因果關係 None 13. 參考附圖,請問程式碼___之處,應填入選項中哪一個 pandas 函數,才能得到如附圖下表之結果? translate map apply groupby None 14. 關於主成分分析(Principal Component Analysis, PCA)與奇異值分解(Singular Value Decomposition, SVD)的比較,下列敘述何者正確? 當變量個數大於觀測值個數時,可以使用 PCA 進行維度縮減 PCA 提供資料矩陣之縱行與橫列的基底向量 SVD 只有分解出資料矩陣橫列或縱行其一的基底向量(Basis) SVD 較 PCA 更一般化 None 15. 關於深度學習的說明,下列敘述何者「不」正確? 具忍受有雜訊的數據,可分析影像、影片等多維度且複雜的數據 神經元個數相同的卷積神經網路表現會比一般深度神經網路來得出色,大幅降低了需要訓練的參數量 不斷地調整某個網路中的每個參數,直到找到一個參數組合使之有效運作 利用多層神經網路來分析數據,重點是事先給定特徵值 None 16. 附圖為某電商平台於 2020 年 10 月至 2021 年 5 月份之新註冊用戶統計數據。請問關於選項中對此二圖表的敘述與解讀(請參考欄位定義與兩圖表),下列敘述何者「不」正確? 此平台之逐月新註冊用戶有正成長趨勢,並於 2021 年 3 月份出現月增 57%的成長 由圖表來看,此平台每 100 個新註冊用戶、只有不到 12 個用戶會於註冊後 7 天仍有購買行為 儘管 2021 年 5 月的首購用戶數量、相較 2020 年 10 月成長了約 400 人;但此平台用戶的首購率卻下降了接近 20%。顯示平台對於設定目標對象、促使用戶購買的規劃上可能出現了問題 由圖表來看,此平台的逐月獲利與新註冊人數,皆呈現正成長趨勢 None 17. 考慮使用 iris 資料集,輸入變數為 Sepal.Length(花萼長度)、Sepal.Width(花萼寬度)、Petal.Length(花瓣長度)與 Petal.Width(花瓣寬度),輸出變數為 Species(物種)。使用 keras 等模組進行多層感知器(Multilayer Perceptron)分析,參考附圖 Python 語言結果,下列敘述何者「不」正確? 第 2 個隱藏層的神經元個數為 6 個 輸出層的啟動函數(activation function)為 softmax 函數 第 1 個隱藏層的權重參數有 42 個 輸入層有 4 個特徵 None 18. k 折交叉驗證(k-fold cross-validation)是機器學習中常用來驗證訓練出來的模型好壞的一種方法,請問以下敘述何者正確? 當 k=10 時是指將數據集分成 10 份,其中 7 份做為訓練,剩下 3 份做驗證 通常會重複 k 次以上,再取其中 k-1 次的結果進行平均來評估模型準確率 留一驗證法(leave-one-out cross-validation, LOOCV)也是一種 k-fold cross-validation 資料依照類別排序後,依序將資料分成 10 份 None 19. 考慮企業分析不同廣告費用(youtube,facebook,newspaper)對銷售額(sales)的影響,參考附圖 R 語言使用 lm 函數分析結果,下列敘述何者「不」正確? 全部資料其有 200 筆 資料沒有遺漏值 調整後判定係數為 0.8961 newspaper 變數對整體線性模型最具有影響 None 20. 參考附圖,關於 R 語言使用 jsonlite 套件匯入 JSON 資料,下列敘述何者正確? 匯入後 df 資料物件為資料框(data.frame) df 資料物件的元素長度為 9 nrow(df$cwbopendata$location)結果為 438 df$cwbopendata$location 資料物件為矩陣(matrix) None 如有問題可留言,謝謝您的寶貴意見! 暱稱 電郵(提交獲得正確答案,可換題測驗完整題庫,新增題庫電郵通知) Time's up