300+ câu Trắc nghiệm Học máy cơ bản có đáp án - Phần 2
30 câu hỏi
Trong học máy, ‘gradient descent’ là một thuật toán tối ưu hóa dùng để:
Phân loại dữ liệu
Tìm các cụm dữ liệu
Giảm thiểu hàm mất mát (loss function) bằng cách điều chỉnh tham số mô hình
Tạo ra các đặc trưng mới
Chọn đáp án C
Trong bài toán hồi quy, độ đo ‘Mean Squared Error’ (MSE) đo lường điều gì?
Tỷ lệ các dự đoán đúng trên tổng số dự đoán
Trung bình của bình phương sai số giữa giá trị dự đoán và giá trị thực tế
Tỷ lệ các trường hợp dương tính được dự đoán đúng
Độ chính xác của các dự đoán âm tính
Chọn đáp án B
Kỹ thuật ‘feature scaling’ (chuẩn hóa đặc trưng) như Min-Max Scaling hoặc Standard Scaling, thường cần thiết cho các thuật toán nào?
Cây quyết định (Decision Tree)
Các thuật toán dựa trên khoảng cách như K-Nearest Neighbors (KNN) và SVM
Hồi quy Logistic
Tất cả các thuật toán học máy
Chọn đáp án B
Hiện tượng ‘overfitting’ trong học máy xảy ra khi nào?
Mô hình quá đơn giản, không nắm bắt được mối quan hệ trong dữ liệu
Mô hình hoạt động tốt trên cả tập huấn luyện và tập kiểm tra
Mô hình hoạt động rất tốt trên tập huấn luyện nhưng kém trên tập kiểm tra
Dữ liệu huấn luyện không đủ lớn
Chọn đáp án C
Độ đo nào thường được sử dụng để đánh giá hiệu suất của mô hình phân loại nhị phân, đặc biệt khi tập dữ liệu mất cân bằng?
Độ chính xác (Accuracy)
Sai số bình phương trung bình (Mean Squared Error – MSE)
F1-Score
R-squared
Chọn đáp án B
Thuật toán ‘principal component analysis’ (PCA) là một phương pháp của kỹ thuật nào?
Học có giám sát (Supervised Learning)
Học không giám sát (Unsupervised Learning) cho giảm chiều dữ liệu
Học tăng cường (Reinforcement Learning)
Học bán giám sát (Semi-supervised Learning)
Chọn đáp án B
Thuật toán nào sau đây là một phương pháp học không giám sát được sử dụng để phát hiện các bất thường (anomaly detection)?
Hồi quy tuyến tính (Linear Regression)
Phân cụm Isolation Forest
Hồi quy Logistic (Logistic Regression)
Cây quyết định (Decision Tree)
Chọn đáp án B
Kỹ thuật ‘early stopping’ (dừng sớm) trong huấn luyện mô hình mạng nơ-ron được sử dụng để:
Tăng tốc độ huấn luyện
Ngăn chặn overfitting bằng cách dừng huấn luyện khi hiệu suất trên tập kiểm tra bắt đầu giảm
Giảm thiểu sai số hệ thống (bias)
Tăng cường tính đa dạng của các đặc trưng
Chọn đáp án B
Độ đo ‘Recall’ (độ nhạy) trong phân loại nhị phân được định nghĩa như thế nào?
Tỷ lệ các trường hợp dương tính thực sự trên tổng số các trường hợp được dự đoán là dương tính
Tỷ lệ các trường hợp dương tính thực sự trên tổng số các trường hợp dương tính thực tế
Tỷ lệ các trường hợp âm tính thực sự trên tổng số các trường hợp được dự đoán là âm tính
Tỷ lệ các trường hợp âm tính thực sự trên tổng số các trường hợp âm tính thực tế
Chọn đáp án B
Trong học máy, ‘hyperparameter’ là gì?
Các tham số của mô hình được học từ dữ liệu
Các biến đầu vào của mô hình
Các tham số được thiết lập trước khi quá trình huấn luyện bắt đầu và không được học từ dữ liệu
Các giá trị đầu ra của mô hình
Chọn đáp án C
Thuật toán ‘Random Forest’ là một tập hợp của nhiều thuật toán nào?
Decision Trees (Cây quyết định)
Linear Regressions (Hồi quy tuyến tính)
Support Vector Machines (SVM)
K-Means Clustering
Chọn đáp án A
Khi phân loại dữ liệu, ‘Precision’ (độ chính xác) đo lường điều gì?
Tỷ lệ các trường hợp được dự đoán là dương tính thực sự là dương tính
Tỷ lệ các trường hợp dương tính thực tế được mô hình dự đoán đúng
Tỷ lệ tổng số dự đoán đúng trên tổng số dự đoán
Khả năng mô hình đưa ra dự đoán chính xác trên dữ liệu chưa thấy
Chọn đáp án A
Đâu là một ví dụ về nhiệm vụ ‘regression’ (hồi quy) trong học máy?
Dự đoán giá nhà dựa trên diện tích, vị trí và số phòng ngủ
Phân loại hình ảnh thành chó hoặc mèo
Nhận dạng chữ viết tay
Phát hiện gian lận thẻ tín dụng
Chọn đáp án A
Phương pháp ‘Cross-validation’ (kiểm định chéo) được sử dụng để làm gì trong học máy?
Đánh giá hiệu suất của mô hình một cách đáng tin cậy và ước lượng khả năng khái quát hóa của nó
Tăng tốc độ huấn luyện mô hình trên tập dữ liệu lớn
Giảm số lượng đặc trưng (features) cần thiết cho mô hình
Trực quan hóa kết quả học tập của mô hình
Chọn đáp án A
Trong mô hình hồi quy tuyến tính (linear regression), ‘bias’ (độ chệch) là gì?
Sai số hệ thống do giả định đơn giản hóa của mô hình, dẫn đến việc mô hình bỏ sót các mối quan hệ thực sự trong dữ liệu
Sai số ngẫu nhiên do tính không chắc chắn của dữ liệu
Sai số do quá trình huấn luyện không hội tụ
Sai số do dữ liệu bị thiếu
Chọn đáp án A
Trong các thuật toán học máy, ‘bias-variance tradeoff’ đề cập đến sự cân bằng giữa hai nguồn sai số chính là gì?
Bias (độ chệch) và Variance (phương sai)
Precision và Recall
Overfitting và Underfitting
Accuracy và F1-Score
Chọn đáp án A
Thuật toán ‘Naive Bayes’ dựa trên định lý Bayes và giả định gì?
Các đặc trưng là độc lập có điều kiện với nhau, cho biết lớp (class) của mẫu
Các đặc trưng có mối tương quan mạnh mẽ với nhau
Dữ liệu tuân theo phân phối chuẩn
Các lớp là phụ thuộc lẫn nhau
Chọn đáp án A
Đâu là một ví dụ về thuật toán học bán giám sát (semi-supervised learning)?
Sử dụng một lượng nhỏ dữ liệu có nhãn và một lượng lớn dữ liệu không nhãn để huấn luyện mô hình
Chỉ sử dụng dữ liệu có nhãn
Chỉ sử dụng dữ liệu không nhãn
Huấn luyện mô hình dựa trên phần thưởng từ môi trường
Chọn đáp án A
Trong học máy, thuật ngữ ‘overfitting’ (quá khớp) mô tả hiện tượng gì?
Mô hình học quá tốt trên tập dữ liệu huấn luyện nhưng kém hiệu quả trên dữ liệu mới chưa từng thấy
Mô hình học kém trên cả tập dữ liệu huấn luyện và dữ liệu mới
Mô hình có khả năng khái quát hóa tốt trên mọi loại dữ liệu
Mô hình cần nhiều dữ liệu hơn để hội tụ
Chọn đáp án A
Thuật ngữ ‘variance’ (phương sai) trong ‘bias-variance tradeoff’ đề cập đến điều gì?
Mức độ thay đổi của ước lượng mô hình nếu nó được huấn luyện trên các tập dữ liệu huấn luyện khác nhau
Sai số hệ thống do giả định đơn giản hóa của mô hình
Sai số do dữ liệu bị thiếu
Sai số do mô hình không hội tụ
Chọn đáp án A
Mô hình ‘Deep Learning’ (học sâu) khác biệt với các mô hình học máy truyền thống ở điểm nào?
Sử dụng nhiều lớp ẩn (deep architectures) để học các biểu diễn dữ liệu phức tạp và phân cấp một cách tự động
Luôn yêu cầu dữ liệu có cấu trúc
Không sử dụng hàm mất mát
Chỉ áp dụng cho bài toán phân loại
Chọn đáp án A
Trong học tăng cường, thuật ngữ ‘reward’ (phần thưởng) đại diện cho điều gì?
Một tín hiệu phản hồi từ môi trường cho biết mức độ tốt hay xấu của hành động mà tác tử vừa thực hiện
Môi trường mà tác tử tương tác
Mục tiêu cuối cùng mà tác tử cần đạt được
Hàm mục tiêu mà tác tử cần tối ưu hóa
Chọn đáp án A
Trong xử lý ảnh bằng học máy, ‘convolutional neural networks’ (CNNs) nổi bật với khả năng gì?
Tự động trích xuất các đặc trưng phân cấp từ dữ liệu ảnh thông qua các lớp tích chập (convolutional layers)
Phân tích mối quan hệ tuần tự trong dữ liệu văn bản
Tìm kiếm các mẫu ẩn trong dữ liệu số
Tối ưu hóa quá trình ra quyết định trong môi trường tương tác
Chọn đáp án A
Kỹ thuật ‘Feature Scaling’ (chuẩn hóa đặc trưng) thường được áp dụng cho các thuật toán nào?
Các thuật toán nhạy cảm với thang đo của đặc trưng, như SVM, K-Nearest Neighbors (KNN) và Gradient Descent
Các thuật toán không phụ thuộc vào thang đo như Decision Trees và Random Forests
Tất cả các thuật toán học máy, không phân biệt
Chỉ các thuật toán học không giám sát
Chọn đáp án A
Mục tiêu của thuật toán ‘K-Means’ là gì?
Chia tập dữ liệu thành K cụm sao cho tổng bình phương khoảng cách từ mỗi điểm đến tâm cụm gần nhất của nó là nhỏ nhất
Tìm một đường thẳng phân chia dữ liệu
Dự đoán nhãn của các điểm dữ liệu
Tối ưu hóa hàm mất mát bằng gradient descent
Chọn đáp án A
Trong học máy, ‘feature selection’ (lựa chọn đặc trưng) là quá trình gì?
Chọn một tập con các đặc trưng có liên quan nhất đến biến mục tiêu để xây dựng mô hình
Tạo ra các đặc trưng mới từ dữ liệu thô
Giảm chiều dữ liệu bằng cách kết hợp các đặc trưng
Loại bỏ các mẫu dữ liệu không cần thiết
Chọn đáp án A
Đâu là một ví dụ về thuộc tính của dữ liệu ‘structured’ (có cấu trúc)?
Dữ liệu trong bảng cơ sở dữ liệu với các cột và hàng được định nghĩa rõ ràng
Tập hợp các bài đăng trên mạng xã hội
Tệp âm thanh
Hình ảnh y tế
Chọn đáp án A
Trong học máy, ‘regularization’ (chuẩn hóa) được áp dụng để làm gì?
Ngăn chặn overfitting bằng cách thêm một khoản phạt vào hàm mất mát dựa trên độ lớn của các trọng số
Tăng tốc độ huấn luyện mô hình
Giảm thiểu bias của mô hình
Tăng cường khả năng học trên dữ liệu huấn luyện
Chọn đáp án A
Trong học tăng cường (reinforcement learning), ‘agent’ (tác tử) là gì?
Thực thể học cách đưa ra quyết định bằng cách tương tác với môi trường để tối đa hóa phần thưởng
Môi trường mà tác tử tương tác
Phần thưởng mà tác tử nhận được
Hàm mục tiêu mà tác tử cần tối ưu
Chọn đáp án A
Đâu là một ví dụ về thuật toán học có giám sát (supervised learning)?
Logistic Regression (Hồi quy Logistic)
Principal Component Analysis (PCA)
K-Means Clustering
Association Rule Mining
Chọn đáp án A








