iPAS AI 應用規劃師(中級) 科目2 大數據處理分析與應用 (5) 發佈留言 / 作者: S學院 / 2025-05-26 iPAS AI應用規劃師(中級) 科目2 大數據處理分析與應用 模擬試題,採智能選題,無限次反覆練習。 1. 可延伸標記式語言(Extensible Markup Language, XML)是一種標記式語言,被廣泛用來作為跨平台之數據互動的形式。設計 XML 是用來傳送和攜帶數據資訊,而非用於表現和展示資料,下列何項敘述違背所謂結構良好(well-formed)的 XML 文件? XML 屬性僅能出現在結尾標籤中,不得出現在起始標籤 XML 屬性名稱大小寫有別 XML 元素的巢狀結構必須正確 每個 XML 元素必須有一個名稱 None 2. 附圖為 pandas 資料表(DataFrame)cell_ca t 的部份內容,請問下列選項何者為產製全部變量之次數分佈表的正確指令? cell_cat.to_freq() cell_cat.select_dtypes(include="object") cell_cat.apply(lambda x: x.value_counts(), axis=0) cell_cat.value_counts() None 3. 參考附圖,R 語言中,已知 mystr 為串列(list),希望取出圖中串列結果,下列選項之 lapply 函數敘述何者正確? mystr, "(", 3 mystr, "]", 3 mystr, ")", 3 mystr, "[", 3 None 4. 關於 ETL(Extract-Transform-Load),下列敘述何者「不」正確? Extract:從資料來源處擷取所需之數據資料 建置或更新資料倉儲(Data Warehouse)中的內容時所需的過程 Transform:針對結構資料轉換,非結構資料則無法處理 Load:最後將已作適當轉換過的數據資料載入到目的地 None 5. 關於迴歸分析(regression analysis),下列敘述何者「不」正確? 在預測的研究中需將變數區分為反應變數和解釋變數 迴歸分析是利用兩個或多個數量變數間的關係,使反應變數的值可以用一個或多個解釋變數的值加以預測的方法 殘差分析(residual analysis)無法用來評估迴歸模型的預測品質 參數皆為一次的模型稱為線性模型,一般以 Y = β0+β1X1+β2X2+...+β(p-1)X(p-1)+ε的形式表達 None 6. 參考附圖,Python 語言中,當使用 pandas 與 numpy 模組進行資料分析時,下列敘述何者正確? df_group.agg(max)結果是依群組計算最小值 pd.isnull(df_measure).sum()結果是 1 df_measure.mean()結果是計算每列(row)的平均值 df_group.sum()結果是依群組計算各行(column)的數值總計 None 7. 考慮購物網站的銷售資料集時,若使用集群法(clustering)進行銷售分析,下列敘述何者正確? k-medoid 集群法(k-medoid clustering)與 k-means 集群法(k-means clustering)比較時,前者較容易受到異常值或極端值的影響 凝聚階層法(agglomerative hierarchical)是一種切割式集群法(partitional clustering) 在 k-medoid 集群法(k-medoid clustering)中,側影係數(Silhouette Coefficient)為正數且數值較大時,表示該資料分派到較合適的集群 k-means 集群法(k-means clustering)的結果是同一集群內的樣本點具有高度的差異性 None 8. k 折交叉驗證(k-fold cross-validation)是機器學習中常用來驗證訓練出來的模型好壞的一種方法,請問以下敘述何者正確? 當 k=10 時是指將數據集分成 10 份,其中 7 份做為訓練,剩下 3 份做驗證 通常會重複 k 次以上,再取其中 k-1 次的結果進行平均來評估模型準確率 資料依照類別排序後,依序將資料分成 10 份 留一驗證法(leave-one-out cross-validation, LOOCV)也是一種 k-fold cross-validation None 9. 關於主成分分析(Principal Components Analysis, PCA)於特徵提取(feature extraction)之主要用途,下列敘述何者正確? 將低度相關的預測變數矩陣 X,轉換成相關且量多的潛在變項集合 提取重要特徵後不能以圖像視覺化呈現多變量資料 將最相關的訊息與無關的雜訊結合 將問題領域中的數個變數,組合成單一或數個具訊息力的特徵變數 None 10. 在迴歸分析當中,最常用的迴歸係數估計方法是普通最小平方法(Ordinary Least Squares, OLS),不過 OLS 常常被錯誤理解或誤用,關於 OLS 失靈的狀況,「不」包括下列何項? 預測變量矩陣存在共線性(collinearity) 某一變量是其他變量的線性組合 預測變量個數大於樣本數 預測變量間相關性(correlation)不足 None 11. 資料清理是指發現並糾正資料中的錯誤,關於資料清理的方法,下列敘述何者「不」正確? 遺缺值(missing value)的處理 迴歸係數的處理 異常值的處理 驗證資料的正確性 None 12. 關於深度學習的說明,下列敘述何者「不」正確? 利用多層神經網路來分析數據,重點是事先給定特徵值 具忍受有雜訊的數據,可分析影像、影片等多維度且複雜的數據 神經元個數相同的卷積神經網路表現會比一般深度神經網路來得出色,大幅降低了需要訓練的參數量 不斷地調整某個網路中的每個參數,直到找到一個參數組合使之有效運作 None 13. 使用 k-means 分群法(k-means clustering algorithm)與歐氏距離(Euclidean distance),將附圖資料分成三群,何者會自成一群? p7 p9 p2 p5 None 14. 政府資料開放平臺(data.gov.tw)的檔案格式中,CSV(Comma-Separated Values)為常見格式之一。請問下列何者「並非」CSV 的特性? 不支援中文資料 儲存兩個維度的陣列資料 欄與欄之間以逗號分隔 列與列之間以換行分隔 None 15. 關於線性相依(linearly dependent)、線性獨立(linearly independent)、正交(orthogonality)與相關(correlation),下列敘述何者正確? 如果 X 與 Y 線性相依,則兩者相關 如果 X 與 Y 線性相依,則兩者非正交 如果 X 與 Y 線性獨立,則兩者無關/正交 如果 X 與 Y 無關/正交,則兩者線性獨立 None 16. 蒐集氣象觀測站的溫度、水量、風速…等 10 項氣象指標以主成分法做因素分析。10 個特徵值與解釋變量如附圖,下列敘述何者「不」正確? 雖然第 3 個特徵值小於 1,但前 3 個特徵值的可解釋全體變數的變異數 80%以上,仍可考慮選入 第 1 個特徵值可解釋全體變數的變異數 45.4% 若以解釋能力 90%為標準,需選入 4 個特徵值(λ1、λ2、λ3、λ4) 選擇 2 個因素(λ1、λ2)可獲得 72.1%的解釋能力 None 17. 關於 R 語言模型參數調校使用 caret 套件,下列敘述何者「不」正確? 若想要自訂參數調校過程,可以 train()函數改變 trainControl()函數的控制參數 資料建模的相關參數有兩種:一種可直接利用資料估計其值的模型參數,另一種是不易從資料中估計的超參數 套件{caret}中 train()函數可針對不同模型給予參數調整的範圍 train()函數結合重抽樣方法評估不同模型參數對績效的影響,並從中選出最佳模型 None 18. 以年收入(X1)和房子坪數(X2)做區別變數,辨別家庭有無投資股票。分別蒐集 30 個有投資股票與 30 個無投資股票的家庭資料。相關數據資料如附圖,請問下列何者「不」正確? None 19. 實務上常見各類樣本分佈差距大的不平衡學習(Imbalanced Learning)情境,關於不平衡學習的處理方式,下列敘述何者「不」正確? 運用正負樣本的懲罰權重來解決,若分析建模的算法支援樣本權重設定,此方法是簡單有效的解決途徑 進行特徵選取(Feature Selection)來解決類別不平衡問題,透過變數的選取來提高模型績效 運用過度抽樣(Oversampling)解決之,此種方法可避免模型過度配適(Overfitting) 以薈萃式學習(Ensemble Learning)集成模型解決,形成模型預測能力良好的森林(Forest) None 20. 參考附圖,關於 R 語言使用 jsonlite 套件匯入 JSON 資料,下列敘述何者正確? df$cwbopendata$location 資料物件為矩陣(matrix) nrow(df$cwbopendata$location)結果為 438 匯入後 df 資料物件為資料框(data.frame) df 資料物件的元素長度為 9 None 如有問題可留言,謝謝您的寶貴意見! 暱稱 電郵(提交獲得正確答案,可換題測驗完整題庫,新增題庫電郵通知) Time's up