iPAS AI 應用規劃師(中級) 科目2 大數據處理分析與應用 (4) 發佈留言 / 作者: S學院 / 2025-05-24 iPAS AI應用規劃師(中級) 科目2 大數據處理分析與應用 模擬試題,採智能選題,無限次反覆練習。 1. 下列選項何者為梯度下降法的正確步驟順序?(1)重複迭代,直到得到權重最佳值、(2)把輸入傳入類神經網路,得到輸出、(3)對每一個神經元計算誤差與調整相對應的權重以減少誤差、(4)用隨機值初始化權重與偏差、(5)計算預測值與真實值之間的誤差 24513 45132 45312 42531 None 2. 拔靴集成法(Bootstrap AGGregatING, BAGGING)是一種常見的重抽樣(Resampling)方法,下列敘述何者「不」正確? 當有充足的樣本數、且樣本具有與母體類似的特性時,拔靴集成法可用來近似分配的形狀 拔靴集成法可以作為交叉驗證的一個替代方法,在原來的樣本中進行替換的隨機採樣,從而得到新的樣本 拔靴集成法是將已有的觀察值當作是母體,重複進行抽樣 拔靴集成法常用於大量數據資料重抽樣 None 3. 關於資料匯入與匯出,下列敘述何者「不」正確? 當 ETL 作業發生錯誤時,規劃良好的 ETL 作業具有分階段重新執行能力(Re-run),不用每次都重頭開始 考慮到關聯式資料庫之 ETL 作業執行效率,可一次執行多個大資料表(Table)關聯(Join),讓資料一次寫入目的地 ETL 作業常有上下游作業關係,因此需要設定好相互關係(Job Dependency)與執行順序 針對來源資料量設計資料萃取(Extract)方式,例如:將大檔案切分為數個小檔案後,各別進行資料萃取作業 None 4. 關於隨機森林(Random Forest)的建立過程中,下列敘述何者「不」正確? 隨機森林能處理很高維度的資料,並且不用做特徵篩選 因為隨機採樣的關係,就算不剪枝,也較不會出現過度配適(Over-fitting)的現象 當隨機森林中的決策樹個數很多時,進行資料訓練時需要的空間和時間會比較大 隨機森林是對決策樹(Decision Tree)的一種改進,森林中的每棵樹具有不同的分佈 None 5. 關於模型績效評量,下列敘述何者「不」正確? 均方預測誤差(Mean Squared Error, MSE)或簡稱為均方誤差,它是殘差平方值的算術平均,因其單位是原始反應變數單位的平方,容易造成數據解讀上的困擾 沒有衡量就無法管控,任何預測模型只有運用適當的指標,評核其模型績效後方能合理的運用之 衡量該模型績效的方式通常很多,實務上建議以單一評估指標瞭解特定模型的優缺點 以迴歸模型來說,許多績效評量的計算是基於殘差(Residual),或稱預測誤差(Prediction Error),也可簡稱為誤差(Error) None 6. 有一 pandas DataFrame 格式的變數 df,其資料內容如下: df.數學.median(),可得到 df 數學欄位之平均值為 76 df["加權分數"] = df.國文1 + df.英文2 + df.數學*2,可新增"加權分數"欄位至 df df.groupby("班級").agg({"姓名": "nunique"}),可獲得各班級人數之分組統計 df[df.姓名.str.startswith("K")],可篩選出 df 姓名開頭為 K 的資料表 None 7. 關於資料解析,下列敘述何者「不」正確? 資料解析過程中,若遇到有異常的數據資料,考慮時效性應該直接予以剔除 特徵工程(Feature Engineering)是一種資料解析的過程,使用專業背景知識和技巧處理數據,使得特徵能在機器學習算法上發揮更好的作用 資料整理、解析、變數篩選等步驟,往往佔據建模過程中大量的時間 資料變數篩選,可以採取專家討論或使用分析方法的方式來進行 None 8. 參考附圖,關於 mtcars 資料集散佈圖矩陣,下列敘述何者為正確? hp 達到 300 以上佔較大的比例 mpg 與 disp 資料呈現約為正相關 disp 與 hp 資料呈現約為負相關 qsec 與 disp 呈現約為負相關 None 9. 關於處理不平衡的數據資料集,下列何者「不」是常見採用的解決方法? k 折交叉驗證法(k-fold Cross-validation) 數據複製(Repetition) 拔靴法(Boostrapping) C5.0 法 None 10. 交叉驗證(Cross-Validation)主要用於模型訓練或建模應用中,目的是為了得到可靠穩定的模型。請問下列敘述何者正確? 保留法(Holdout)驗證不算交叉驗證的類型 k 摺交叉驗證(k-fold Cross Validation),若 k=10,代表將數據集分成 10 份,將其中 5 份做訓練、5 份做驗證 採用 k 摺交叉驗證(k-fold Cross Validation)通常會重複 k 次以上,以 k-1 次的結果均值作為對算法精度的估計 交叉驗證經常用於分類預測、偏最小平方(Partial Least Squares, PLS)迴歸建模等 None 11. 請問資訊增益(Information Gain)衡量是應用在樹狀模型(如:決策樹)建構過程中的哪一個階段? 訓練樣本數 分割資料集的預測變數(Attribute Selection Measures)與其分割值 葉節點(Leaf Node)的預測方程或方式 樹的深度或複雜度 None 12. 附圖為某餐廳之"餐廳小費統計數據"所繪製而成的箱型圖(Box Plot)。關於該數據與圖表的敘述,下列何者較「不」正確?(單位:元) 該數據之箱型圖繪製結果中,沒看到有離群值的情況 該數據之第三四分位數(第 75 個百分位數)大約是 24 元 該數據之中位數介於 10-20 元之間 該數據之最小值大於 0 元 None 13. 附圖是某次瑕疵檢測的混淆矩陣,此次總共檢測 100 片電路板,實際有瑕疵的電路板有 9 片,下列敘述何者「不」正確? 正確率(Accuracy)為 0.91 Precision Rate 為 0.11 Recall Rate 為 0.11 F1-measure 為 0.18 None 14. 在集成學習(Ensemble Learning)中,拔靴集成法(Bootstrap AGGregatING, BAGGING)和提升法(Boosting)是兩種常見的技術,關於兩者的比較,下列敘述何者正確? 拔靴集成法會產生袋外(Out-of-bag)資料,但提升法不會 提升法解決了拔靴集成法的過度配適(Over-fitting)問題,因此有較好的分類準確率 拔靴集成法會根據每個樣本的重要性不同,調整不同權重,而提升法中的每個樣本的權重皆相同 提升法需要依序訓練各個分類器,拔靴集成法則可以平行訓練各個分類器 None 15. 有一 pandas DataFrame 格式的變數 df,其資料內容如下:df_new = df.dropna(subset=['電話', '信箱'])、print(list(df_new.姓名.unique())),請問執行附圖程式碼後,下列何者為輸出結果? ['Alfred', 'Batman', 'Catwoman', 'Chris', 'Ken'] ['Alfred', 'Ken'] ['Batman', 'Catwoman'] ['Alfred', 'Batman', 'Catwoman'] None 16. 有一 pandas DataFrame 格式的變數 df,其資料內容如下:請問執行附圖程式碼後,下列選項內姓名何者「不」在執行結果當中? Andrew Judy Jen Celine None 17. 混淆矩陣(Confusion Matrix)是等長的觀測類別值向量與預測類別值向量,交叉統計後的二維表格結果,請問下列敘述何者「不」正確? 混淆矩陣中真陽數一定大於真陰數 陽性事件通常是我們所關心的事件,例如:授信客戶違約、垃圾郵件與簡訊、患有某種疾病等,當這些事件發生時,人們通常會採取因應措施 R 語言 caret 套件與 Python 語言 pandas_ml 套件中有分類模型的各種績效評估指標 形容詞真與假意指預測的結果是否與其真實的類別相同 None 18. 下列何者「不」屬於 Python 或 R 常用到的繪圖套件? Seaborn ggplot2 D3.js(Data-Driven Documents) Matplotlib None 19. 關於讀取.xlsx 檔,下列敘述何者正確? 在 R 語言中,可使用{readxl}套件中的 readxl( )函數 在 Python 語言中,可使用 pandas 套件中的 read_excel( )方法 在 Python 語言中,可使用 pandas 套件中的 open_xlsx( )方法 在 R 語言中,只有一個套件{readxl}可以使用 None 20. 真實的反應變數值與預測的反應變數值之間的差,稱為殘差或(預測)誤差,下列何者是應用殘差平方值的總和來評估迴歸模型的績效? 均方預測誤差(Mean Squared Error, MSE) 誤差平方和(Sum of the Squared Errors, SSE) 誤差絕對值和(Sum of Absolute Error, SAE) 均方根預測誤差(Root Mean Squared Error, RMSE) None 如有問題可留言,謝謝您的寶貴意見! 暱稱 電郵(提交獲得正確答案,可換題測驗完整題庫,新增題庫電郵通知) Time's up