iPAS AI 應用規劃師(中級) 科目2 大數據處理分析與應用 (4) / iPAS AI 應用規劃師, AI 測驗題庫, iPAS AI 中級, 測驗題庫 / 作者: S學院 iPAS AI應用規劃師(中級) 科目2 大數據處理分析與應用 模擬試題,採智能選題,無限次反覆練習。 1. 有一 pandas DataFrame 格式的變數 df,其資料內容如下:請問執行附圖程式碼後,下列選項內姓名何者「不」在執行結果當中? Jen Celine Andrew Judy None 2. R 語言中,使用 read.table 匯入以下特性的文字檔資料,並指派為mydf 物件,選項中何者是符合題目要求條件之正確語法?(1)檔案名稱為「ipas.csv」、(2)資料以「,」區隔、(3)檔案編碼為「UTF-8」、(4)資料沒有標題列 mydf <- read.table('ipas.csv', sep = ",", fileEncoding = 'UTF-8') mydf <- read.table('ipas.csv', header = TRUE, fileEncoding = 'UTF-8') mydf <- read.table('ipas.csv', header = TRUE, sep = ",", fileEncoding = 'UTF-8') mydf <- read.table('ipas.csv') None 3. 有一 pandas DataFrame 格式的變數 df,其資料內容如下: df3 = df1 + df2 df3 = df1.concat(df2).reset_index(drop=True) df3 = pd.concat([df1, df2]).reset_index(drop=True) df3 = df1.merge(df2, on="A") None 4. 下列選項何者為梯度下降法的正確步驟順序?(1)重複迭代,直到得到權重最佳值、(2)把輸入傳入類神經網路,得到輸出、(3)對每一個神經元計算誤差與調整相對應的權重以減少誤差、(4)用隨機值初始化權重與偏差、(5)計算預測值與真實值之間的誤差 24513 45312 45132 42531 None 5. 下列何者「不」屬於 Python 或 R 常用到的繪圖套件? Seaborn Matplotlib D3.js(Data-Driven Documents) ggplot2 None 6. 關於資料解析,下列敘述何者「不」正確? 特徵工程(Feature Engineering)是一種資料解析的過程,使用專業背景知識和技巧處理數據,使得特徵能在機器學習算法上發揮更好的作用 資料整理、解析、變數篩選等步驟,往往佔據建模過程中大量的時間 資料解析過程中,若遇到有異常的數據資料,考慮時效性應該直接予以剔除 資料變數篩選,可以採取專家討論或使用分析方法的方式來進行 None 7. 有一 pandas DataFrame 格式的變數 df,其資料內容如下: df[df.姓名.str.startswith("K")],可篩選出 df 姓名開頭為 K 的資料表 df.groupby("班級").agg({"姓名": "nunique"}),可獲得各班級人數之分組統計 df["加權分數"] = df.國文1 + df.英文2 + df.數學*2,可新增"加權分數"欄位至 df df.數學.median(),可得到 df 數學欄位之平均值為 76 None 8. 附圖為某餐廳之"餐廳小費統計數據"所繪製而成的箱型圖(Box Plot)。關於該數據與圖表的敘述,下列何者較「不」正確?(單位:元) 該數據之第三四分位數(第 75 個百分位數)大約是 24 元 該數據之箱型圖繪製結果中,沒看到有離群值的情況 該數據之中位數介於 10-20 元之間 該數據之最小值大於 0 元 None 9. 參考附圖,關於 mtcars 資料集散佈圖矩陣,下列敘述何者為正確? disp 與 hp 資料呈現約為負相關 hp 達到 300 以上佔較大的比例 mpg 與 disp 資料呈現約為正相關 qsec 與 disp 呈現約為負相關 None 10. 參考附圖,R 語言中,下列邏輯值索引敘述何者正確? mydata[0]執行結果為-1e-03 mydata[-1]執行結果為 1e+03 mydata[3]執行結果為 0 sum(mydata)執行結果為 0 None 11. 關於隨機森林(Random Forest),下列敘述何者正確? 經常使用在 Kaggle 競賽中的統計機器學習算法之一,以建立多個互補的弱模型(Weak Learner)提升效能 處理的問題涉及序列相關的決策(Sequential Decisions) 在模型中融入屬性隨機挑選的機制 產生的模型集合俗稱裝袋樹(Bagged Trees) None 12. 在集成學習(Ensemble Learning)中,拔靴集成法(Bootstrap AGGregatING, BAGGING)和提升法(Boosting)是兩種常見的技術,關於兩者的比較,下列敘述何者正確? 提升法需要依序訓練各個分類器,拔靴集成法則可以平行訓練各個分類器 拔靴集成法會產生袋外(Out-of-bag)資料,但提升法不會 拔靴集成法會根據每個樣本的重要性不同,調整不同權重,而提升法中的每個樣本的權重皆相同 提升法解決了拔靴集成法的過度配適(Over-fitting)問題,因此有較好的分類準確率 None 13. 基於集群的離群值之偵測方法(Clustering-based Approaches),下列何者「不」是用來判斷離群值的依據? 物件是小型或稀疏集群的一部分 物件不屬於任何集群 物件與最接近的集群之間是否存在較大距離 物件是否位於兩個集群之間 None 14. 在製作一個 CSV(Comma-Separated Values)檔案的過程中,如果有欄位的資料中含有逗號(例如金額的千位號),請問應如何處理該欄位資料最為恰當? 透過文字編輯器,先將所有逗號(,)轉換為句號(.) 使用雙引號(")包覆該欄位資料 不用特別處理該欄位資料 當使用資料匯入工具時,先告知工具該列資料的欄位數即可 None 15. 參考附圖,Python 語言中,選項中何者為計算各列的平均值? df.aggregate("mean") df.aggregate("mean", axis=0) df.aggregate("mean", axis="index") df.aggregate("mean", axis=1) None 16. 交叉驗證(Cross-Validation)主要用於模型訓練或建模應用中,目的是為了得到可靠穩定的模型。請問下列敘述何者正確? 保留法(Holdout)驗證不算交叉驗證的類型 k 摺交叉驗證(k-fold Cross Validation),若 k=10,代表將數據集分成 10 份,將其中 5 份做訓練、5 份做驗證 採用 k 摺交叉驗證(k-fold Cross Validation)通常會重複 k 次以上,以 k-1 次的結果均值作為對算法精度的估計 交叉驗證經常用於分類預測、偏最小平方(Partial Least Squares, PLS)迴歸建模等 None 17. 關於效能提升法(Boosting),下列敘述何者「不」正確? 可以用來減少變異數(Variance) 是集成學習(Ensemble Learning)的一種方法 自適應 Boosting(AdaBoost)是一種改良效能提升的方法 自適應 Boosting(AdaBoost)方法中的各個學習器存在著強依賴關係 None 18. 關於特徵工程(Feature Engineering),下列敘述何者正確? 時間戳屬性通常只需要分離成一兩個維度,比如:年、月,其他太細如:日、小時、分鐘、秒鐘等就不需要了 遇到類別型屬性的資料,不可以採用單熱編碼(One-hot Encoding)方式來進行分解 特徵交叉是一種很獨特的方式,它將兩個或更多的類別屬性組合成一個,當組合的特徵要比單個特徵更好時,這是一項非常有用的技術 逐步迴歸經常用於特徵縮放 None 19. 機器學習建模的過程中,面對解決模型變異過高的問題,下列何者是添加建模過程的隨機噪訊,以有效降低模型變異的方法? 策略梯度方法(Policy Gradient Method) 生成式對抗網路(Generative Adversarial Networks, GAN) 支援向量機(Support Vector Machines, SVM) 拔靴集成法(Bootstrap AGGregatING, BAGGING) None 20. 透過 Python 載入 CSV 資料時,可能會使用 pandas 套件的 read_csv 函數,下列敘述何者「不」正確?(可參考附圖官方說明文件) XLS(Excel Spreadsheet)資料類似於 CSV,故也可透過此函數匯入 可以載入非 CSV 格式,例如以 Tab 分隔或是以句號分隔的純文字資料 可以直接匯入網路上的 CSV 資料,例如:pandas.read_csv('http://www.sample-videos.com/csv/Sample-Spreadsheet-10-rows.csv') 可以直接匯入本機資料夾的 CSV 資料 None 如有問題可留言,謝謝您的寶貴意見! 暱稱 電郵(提交獲得正確答案,可換題測驗完整題庫,新增題庫電郵通知) Time's up