iPAS AI 應用規劃師(中級) 科目2 大數據處理分析與應用 (3) 發佈留言 / 作者: S學院 / 2025-05-24 iPAS AI應用規劃師(中級) 科目2 大數據處理分析與應用 模擬試題,採智能選題,無限次反覆練習。 1. 下列何者通常「不」用來處理連續值的預測問題? 羅吉斯迴歸(logistic regression) 簡單線性迴歸(simple linear regression) 支援向量迴歸(support vector regression) 多元迴歸分析(multiple regression analysis) None 2. 交叉驗證(cross-validation)主要用於模型訓練或建模應用中,目的是為了得到可靠穩定的模型。請問下列敘述何者「不」正確? 採用 k 摺交叉驗證(k-fold cross validation)通常會重複 k 次以上,以 k-1 次的結果均值作為對算法精度的估計 k 摺交叉驗證(k-fold cross validation),若 k=10,代表將數據集分成 10 份,將其中 9 份做訓練、1 份做驗證 交叉驗證經常用於分類預測、偏最小平方迴歸(Partial Least Squares regression,PLS 迴歸)建模等 交叉驗證的類型,常見的有保留法(holdout)驗證、k 摺驗證 None 3. 鳶尾花 iris 資料集共有 150 個樣本,花瓣長寬、花萼長寬與花種(setosa、versicolor、virginica)等五個變數,關於下圖中樹狀模型的說明何者「不」正確? 第一次切分條件為 Petal.Length < 2.45,滿足的樣本子集有左邊的50 株(33.3%),此子集中全為 setosa,三類樣本比例分別(1.000, .000, .000) 是預測類別變數的分類樹 共有五個節點,弧角方框內由下往上的資訊分別是:落入此節點的樣本比例、三類樣本的比例、以及比例最高的類別標籤(若有平手狀況,則優先取排在前面的類別標籤) 樹深為 3 None 4. 俗話說:「三個臭皮匠,勝過一個諸葛亮」,恰好呼應了拔靴集成法(Bootsrap AGGregatING, BAGGING)中,會產生多個弱分類器,並將這些弱分類器組合在一起,以獲得一個強分類器,有機會做出更準確的判斷。請問以下敘述何者正確? 增加臭皮匠的數量會導致意見分歧,反而無法贏過諸葛亮。(亦即:增加弱分類器數量,反而會導致強分類器的分類準確度變差。) 每個臭皮匠的意見越接近越好,因為表示他們越團結一心。(亦即:各個弱分類器的判斷結果越接近,強分類器的分類結果越準確。) 即使沒有一個臭皮匠能答對所有的問題,但這些臭皮匠一起討論後,仍有可能答對所有的問題。(亦即:雖然各個弱分類器的分類準確度都不到 100%,但強分類器的分類準確度仍有可能達到100%。) 假如臭皮匠們沒有贏過諸葛亮,只要持續增加臭皮匠的人數,必定可以勝過諸葛亮。(亦即:假如強分類器表現不好,只要增加弱分類器的數量,必定能提升強分類器的分類準確度。) None 5. 當身體肌肉收縮時,肌電訊號(Electromyography,EMG)肌電信號可用於控制計算機,作為一種用戶界面。EMG 訊號一般可由:頻率(Frequency, F)、強度(Strength, S)與時間(Time, T)來表示,下表為 EMG 的實驗資料(F, S, T)和相應的動作分類(Action, A),若用Gini 係數來建立決策樹模型,第一個分類屬性為下列何者? 頻率(Frequency, F) 強度(Strength, S) 動作分類(Action, A) 時間(Time, T) None 6. 下表是 7 個資料點的(x, y)值,假設現在分成三個集群 A={P1, P3, P6}, B={P2, P4}, C={P5,P7},若以歐氏距離(Euclidean distance)平方作為衡量相似度的依據,則集群 A 與 B 間共有 6 個兩兩資料點的距離:D(P1, P2)=233, D(P1, P4)=261, D(P3, P2)=149, D(P3 P4)=169, D(P6, P2)=80, D(P6, P4)=104,則下列敘述何者「不」正確? 若以中心值距離(centroid distance)作為集群相似度的衡量,則集群 A 與 B 間的距離是 156.89 若以最小距離(minimum distance)作為集群相似度的衡量,則集群 A 與 B 間的距離是 80 若以最大距離(maximum distance)作為集群相似度的衡量,則集群 A 與 B 間的距離是 261 若以平均距離(average distance)作為集群相似度的衡量,則集群 A 與 B 間的距離是 160 None 7. 使用拔靴集成法(Bootsrap AGGregatING, BAGGING)需要注意的地方,「不」包含下列何者? 拔靴集成法能提升機器學習演算法的穩定性和準確性,它可以減少模型的變異數(variance)從而避免出現過度配適(overfitting)的現象 拔靴集成法用抽樣資料建構的模型,可能有好有壞,所以通常以取平均(或投票法)的方式,來獲得較穩定的表現 預先指定特徵進行訓練 拔靴集成法可以改良比較不穩定演算法的性能,例如:類神經網路、CART None 8. 關於接收者操作特性曲線(Receiver Operating characteristic Curve, ROC),下列敘述何者「不」正確? ROC 常用於分析二元分類模型 ROC 曲線是以假陽性率(False Positive Rate, FPR)為 X 軸,以真陽性率(True Positive Rate, TPR)為 Y 軸 AUC=0.8,代表無鑑別力 ROC 曲線往左上角移動,代表模型的敏感度越高 None 9. 下列何者是 k 平均數集群(k-means clustering)的優點? 算法涉及隨機抽樣,每次運行的結果不盡相同 原理簡單,容易以非統計的詞彙解釋說明之 形成的群多為類圓球狀且大小相近 不易受到離群值的影響 None 10. 關於軟性邊界支援向量機(soft-margin support vector machine),下列敘述何者正確? 因為公式(1)中有‖w‖2,所以又稱 L2-SVM 若使用 Gaussian kernel: k(x, x′) = exp(−γ||x−x′||2) 且只調整 γ,則(c) (d)圖中,(d)圖的 γ 比較大 在(a)圖中+1.0 與-1.0 直線間的樣本,ξi=0 若只調整參數 C,則(a) (b)圖中,(b)圖的參數 C 比較大 None 11. 關於機器學習的建模方式,下列何者比較不會因為增加模型的複雜度而產生過度配適(overfitting)的現象? 決策樹(decision tree) 隨機森林(random forest) 多層感知機(multi-layer perceptron) 羅吉斯迴歸(logistic regression) None 12. 關於求解線性迴歸 Y=βTX=β0*1+β1x1+β2*x2+…+βm*xm,其中 βT=[β0, β1, …, βm],下列敘述何者「不」正確? 簡單線性迴歸解得模型是否有效,需要計算相關係數 r 以確認 X對 Y 有顯著的影響,並呈密切的線性相關 簡單線性迴歸,只包括一個自變量和一個因變量,可使用最小平方法求解 多元迴歸公式的結構等於一個只有輸入和輸出層的神經網路,可用隨機梯度下降法(Stochastic gradient descent, SGD)去找 βT的最佳解 多元線性迴歸自變數之間的相關程度可以高於自變數與因變數之間的相關程度 None 13. 圖形資料集如圖(1),則圖(2)的支持度為?n(圖取自資料探勘 /Pang Ning Tan, Michael Steinbach , 作者:施雅月,出版社: 臺灣培生教育/ 歐亞) 20% 60% 40% 80% None 14. 關於隨機森林(random forest),下列敘述何者「不」正確? 可用來進行預測、分類 可用於具有遺缺值的資料 提供變數重要度分數 在薈萃式學習(ensemble learning)裡面,隨機森林採用效能提升的方式(boosting)進行系集模型的建構 None 15. 有一個混淆矩陣(confusion matrix),橫列表示預測類別,縱行表示真實類別,假設有一個預測類別矩陣為[0, 0, 1, 0, 1, 1, 0, 1, 1, 0, 0, 1 ,1],真實類別矩陣為[1, 0, 1, 1, 0, 1, 0, 1, 1, 1, 0, 0 ,1],則假陽數(false positive)的值為何? 2 6 3 5 None 16. 下列何者「不是」薈萃式學習(ensemble learning)常用的集成技術? 投票法(voting) 平均法(averaging) 平衡法(balance) 提升法(boosting) None 17. 下列何者「不是」用來評估模型的驗證指標(validation index)? 特徵值(eigenvalue) 均方誤差(Mean Squared Error, MSE) 混淆矩陣(confusion matrix)與敏感度(sensitivity) ROC 曲線與曲線下方面積(Area Under Curve, AUC) None 18. 關於 k 近鄰(k-nearest neighbors)學習,下列敘述何者「不」正確? 因為沒有模型,所以限制了我們瞭解預測變數與目標變數之間關係的能力 度量綱不一的屬性、名目屬性與遺缺數據需要額外處理 k 近鄰法計算耗時,計算時須將數據載入記憶體中,當資料量大時通常用節省記憶體的資料結構,以加快計算,如:k 維樹(k-dimensional tree, k-d tree) 資料需服從常態分配 None 19. 關於離群值檢測(outlier detection)可能面臨的挑戰,下列敘述何者「不」正確? 一般檢測方法與應用無關(application-independent) 異常值檢測高度依賴於正常(非異常值)和異常值的有效建模 異常值與雜訊不同 檢測到異常值具備易理解性(understandability) None 20. 假設有一訓練資料集為 S = {1(-), 1(-), 2(+), 2(+), 2(+), 3(-), 3(-), 5(-), 7(-), 9(-)},其中數字代表特徵值,括號內的正負號代表類別。若使用拔靴集成法(Bootsrap AGGregatING, BAGGING)建立分類器時,使用的抽樣方法為下列何者?(假設抽樣的資料筆數亦為 10) 隨機從 S 中抽取 10 筆資料,S 中的每筆資料可被抽取不只一次,但必須維持正負兩個類別的比例各半(1:1),例如:{2(+), 1(-), 9(-), 2(+), 2(+), 3(-), 2(+), 7(-), 2(+), 3(-)} 隨機從 S 中抽取 10 筆資料,S 中的每筆資料可被抽取不只一次,但必須維持正負兩個類別的比例和 S 中的比例相同(3:7),例如:{2(+), 1(-), 9(-), 7(-), 9(-), 3(-), 1(-), 2(+), 5(-), 2(+)} 隨機從 S 中抽取 10 筆資料,S 中的每筆資料至多只能抽取一次,例如:{5(-), 1(-), 9(-), 2(+), 3(-), 2(+), 7(-), 2(+), 3(-), 1(-)} 隨機從 S 中抽取 10 筆資料,S 中的每筆資料可被抽取不只一次,例如:{5(-), 1(-), 9(-), 7(-), 9(-), 3(-), 1(-), 2(+), 5(-), 2(+)} None 如有問題可留言,謝謝您的寶貴意見! 暱稱 電郵(提交獲得正確答案,可換題測驗完整題庫,新增題庫電郵通知) Time's up