300+ câu Trắc nghiệm Học máy cơ bản có đáp án - Phần 6
30 câu hỏi
Kỹ thuật ‘Cross-Validation’ (Kiểm định chéo) được sử dụng để làm gì?
Để tăng tốc độ huấn luyện mô hình
Để đánh giá độ tin cậy của hiệu suất mô hình và giảm thiểu thiên vị (bias) do cách chia dữ liệu huấn luyện/kiểm tra
Để giảm số chiều của dữ liệu
Để tìm ra các tham số tối ưu cho mô hình
Chọn đáp án B
Khái niệm ‘Bias-Variance Trade-off’ trong Học Máy đề cập đến sự cân bằng giữa yếu tố nào?
Tốc độ huấn luyện và độ chính xác
Độ phức tạp của mô hình và khả năng khái quát hóa trên dữ liệu mới
Số lượng đặc trưng và số lượng mẫu dữ liệu
Hiệu suất trên tập huấn luyện và tập kiểm tra
Chọn đáp án B
Trong bài toán phân loại, ‘Confusion Matrix’ (Ma trận nhầm lẫn) cung cấp thông tin về:
Chỉ số độ chính xác tổng thể của mô hình
Số lượng True Positives, True Negatives, False Positives và False Negatives
Tốc độ huấn luyện của mô hình
Sự tương quan giữa các đặc trưng
Chọn đáp án B
Kỹ thuật ‘Regularization’ (Điều chuẩn) trong Học Máy thường được sử dụng để:
Tăng tốc độ hội tụ của mô hình
Giảm thiểu overfitting bằng cách thêm hình phạt vào hàm mất mát (loss function) dựa trên độ lớn của các trọng số (weights)
Tăng cường khả năng học của mô hình trên dữ liệu huấn luyện
Loại bỏ tất cả các đặc trưng có hệ số bằng 0
Chọn đáp án B
Thuật toán nào sau đây là một ví dụ về mô hình dựa trên cây (tree-based model)?
K-Nearest Neighbors (KNN)
Support Vector Machine (SVM)
Random Forest
Linear Regression
Chọn đáp án C
Thuật toán ‘Support Vector Machine’ (SVM) hoạt động dựa trên nguyên tắc chính nào?
Tìm đường phân chia có độ lệch lớn nhất giữa các lớp
Tìm siêu phẳng (hyperplane) phân chia tốt nhất giữa các lớp, tối đa hóa lề (margin)
Chia dữ liệu thành các cụm dựa trên khoảng cách
Xây dựng một chuỗi các quyết định tuần tự
Chọn đáp án B
Đâu là một thuật toán phân cụm dựa trên mật độ (density-based clustering algorithm)?
K-Means
Hierarchical Clustering
DBSCAN (Density-Based Spatial Clustering of Applications with Noise)
Gaussian Mixture Model (GMM)
Chọn đáp án C
Trong Học Máy Tăng Cường, một ‘State’ (Trạng thái) đại diện cho điều gì?
Quyết định mà Agent đưa ra
Phần thưởng mà Agent nhận được
Mô tả hiện tại của môi trường mà Agent đang tương tác
Hàm mục tiêu của Agent
Chọn đáp án C
Đâu là một ví dụ về ‘Deep Learning’?
Hồi quy Tuyến tính
Thuật toán K-Means
Mạng nơ-ron tích chập (CNN) hoặc Mạng nơ-ron hồi tiếp (RNN)
Cây quyết định
Chọn đáp án C
Thuật toán ‘Decision Tree’ có ưu điểm nổi bật là gì?
Khả năng học các biểu diễn phi tuyến rất phức tạp
Dễ dàng diễn giải (interpretable) và trực quan hóa
Hoạt động tốt với dữ liệu có số chiều rất cao
Không bị ảnh hưởng bởi overfitting
Chọn đáp án B
Trong mạng nơ-ron, thuật ngữ ‘backpropagation’ dùng để chỉ quá trình gì?
Truyền tín hiệu từ lớp đầu vào đến lớp đầu ra
Tính toán gradient của hàm mất mát theo trọng số của mạng để cập nhật trọng số
Khởi tạo ngẫu nhiên trọng số của mạng
Chuẩn hóa đầu vào của mạng
Chọn đáp án B
Thuật toán nào thường được sử dụng cho bài toán phân cụm (clustering)?
Linear Regression
Logistic Regression
K-Means
Support Vector Machine (SVM)
Chọn đáp án C
Khi dữ liệu có nhiều đặc trưng, việc sử dụng ‘Feature Selection’ có mục đích chính là gì?
Tăng cường độ phức tạp của mô hình
Giảm số lượng đặc trưng, loại bỏ các đặc trưng không liên quan hoặc dư thừa để cải thiện hiệu suất và giảm thời gian huấn luyện
Tăng cường khả năng overfitting
Tạo ra các đặc trưng mới
Chọn đáp án B
Khái niệm ‘variance’ (phương sai) trong học máy thường đề cập đến:
Sai số do mô hình quá đơn giản, không nắm bắt được mối quan hệ cơ bản trong dữ liệu
Sai số do mô hình quá nhạy cảm với các biến động nhỏ trong tập huấn luyện, dẫn đến hiệu suất khác nhau đáng kể trên các tập dữ liệu huấn luyện khác nhau
Sai số do việc thu thập dữ liệu bị thiên lệch
Sai số do lỗi tính toán trong thuật toán
Chọn đáp án B
Trong thuật toán Cây Quyết định (Decision Tree), nút lá (leaf node) đại diện cho điều gì?
Một quyết định trung gian dựa trên một thuộc tính
Một đặc trưng (feature) được chọn để phân chia dữ liệu
Một kết quả dự đoán cuối cùng (lớp hoặc giá trị)
Một ngưỡng để phân tách dữ liệu
Chọn đáp án C
Trong học máy, khái niệm ‘pipeline’ (quy trình) đề cập đến:
Một mô hình học máy duy nhất
Một chuỗi các bước xử lý dữ liệu và huấn luyện mô hình được liên kết với nhau
Quá trình đánh giá hiệu suất mô hình
Việc lựa chọn các tham số tốt nhất
Chọn đáp án B
Hệ số tương quan Pearson (Pearson Correlation Coefficient) đo lường:
Mối quan hệ nhân quả giữa hai biến
Mức độ tuyến tính của mối quan hệ giữa hai biến số và hướng của mối quan hệ đó
Sự khác biệt giữa trung bình của hai nhóm
Tỷ lệ các trường hợp khớp nhau giữa hai tập dữ liệu
Chọn đáp án B
Trong học máy giám sát, mục tiêu chính của việc sử dụng tập dữ liệu kiểm tra (test set) là gì?
Để huấn luyện mô hình và tinh chỉnh các tham số
Để đánh giá hiệu suất và khả năng tổng quát hóa của mô hình trên dữ liệu chưa từng thấy
Để lựa chọn các đặc trưng (features) quan trọng nhất cho mô hình
Để khám phá các mẫu ẩn và cấu trúc trong dữ liệu
Chọn đáp án B
Trong Xử lý Ngôn ngữ Tự nhiên (NLP), kỹ thuật ‘Tokenization’ là gì?
Chuyển đổi văn bản thành các vector số
Quá trình chia văn bản thành các đơn vị nhỏ hơn như từ, cụm từ hoặc ký tự
Loại bỏ các từ dừng (stopwords) khỏi văn bản
Biểu diễn ý nghĩa ngữ nghĩa của từ
Chọn đáp án C
Trong Học tăng cường (Reinforcement Learning), khái niệm ‘Agent’ đề cập đến:
Môi trường mà Agent hoạt động
Hành động mà Agent thực hiện
Thực thể học hỏi và đưa ra quyết định để đạt được mục tiêu
Phần thưởng hoặc hình phạt mà Agent nhận được
Chọn đáp án B
Độ đo Recall (Độ phủ) trong phân loại được tính như thế nào?
TP / (TP + FP)
TP / (TP + FN)
TN / (TN + FP)
TN / (TN + FN)
Chọn đáp án B
Trong NLP, kỹ thuật ‘Stemming’ và ‘Lemmatization’ đều có mục đích gì?
Biểu diễn từ dưới dạng vector
Giảm các biến thể của từ về dạng gốc hoặc gốc từ để chuẩn hóa dữ liệu văn bản
Loại bỏ các từ có tần suất xuất hiện thấp
Phân tích cấu trúc ngữ pháp của câu
Chọn đáp án B
Độ đo ‘F1-Score’ trong phân loại là sự kết hợp giữa:
Accuracy và Precision
Precision và Recall
Precision và Specificity
Recall và Specificity
Chọn đáp án B
Thuật toán Random Forest thuộc loại hình học máy nào?
Học máy không giám sát
Học máy có giám sát
Học tăng cường
Học sâu (Deep Learning)
Chọn đáp án B
Trong học máy, ‘feature scaling’ (chuẩn hóa đặc trưng) là quá trình gì?
Giảm số lượng đặc trưng
Biến đổi các đặc trưng để chúng có cùng thang đo hoặc phạm vi giá trị
Tạo ra các đặc trưng mới từ các đặc trưng hiện có
Loại bỏ các đặc trưng không liên quan
Chọn đáp án B
Trong học máy, khái niệm ‘hyperparameter’ là gì?
Các biến số được học từ dữ liệu trong quá trình huấn luyện
Các tham số của mô hình được thiết lập trước khi quá trình huấn luyện bắt đầu và không được học từ dữ liệu
Các thuộc tính đầu vào của dữ liệu
Kết quả dự đoán của mô hình
Chọn đáp án B
Kỹ thuật ‘Grid Search’ thường được sử dụng để:
Huấn luyện mô hình nhanh hơn
Tìm kiếm tập hợp các giá trị hyperparameter tốt nhất cho mô hình bằng cách thử tất cả các kết hợp có thể
Đánh giá hiệu suất cuối cùng của mô hình
Chọn lựa các đặc trưng quan trọng nhất
Chọn đáp án B
Trong mạng nơ-ron tích chập (Convolutional Neural Networks – CNNs), lớp tích chập (convolutional layer) có vai trò chính là gì?
Thực hiện phân loại cuối cùng
Trích xuất các đặc trưng cục bộ từ dữ liệu đầu vào (ví dụ: cạnh, góc trong ảnh)
Làm phẳng dữ liệu để đưa vào lớp kết nối đầy đủ
Áp dụng hàm kích hoạt phi tuyến
Chọn đáp án B
Thuật toán K-Nearest Neighbors (KNN) là một thuật toán học máy thuộc loại nào?
Học máy không giám sát
Học máy có giám sát (phân loại và hồi quy)
Học tăng cường
Học sâu
Chọn đáp án B
Thuật toán K-Means thuộc loại hình học máy nào?
Học máy có giám sát (Supervised Learning)
Học máy không giám sát (Unsupervised Learning)
Học tăng cường (Reinforcement Learning)
Học bán giám sát (Semi-supervised Learning)
Chọn đáp án B








