100+ câu trắc nghiệm tổng hợp Khoa học dữ liệu trong kinh tế và kinh doanh có đáp án - Phần 4
20 câu hỏi
Lựa chọn nào sau đây không phải là một bước trong quy trình khai thác dữ liệu?
Data Understanding
Data Preparation
Data Mining
Evaluation
Chọn đáp án C
Thuộc tính “Loại khách hàng” có hai giá trị: “VIP”, “Premium” và “Economic” là thuộc tính thuộc kiểu dữ liệu nào sau đây?
Liên tục
Rời rạc
Xếp hạng/thứ tự
Định danh
Chọn đáp án D
Tiền xử lý dữ liệu không bao gồm các bước nào sau đây?
Làm sạch dữ liệu
Chuyển đổi dữ liệu
Thu thập dữ liệu
Rút gọn dữ liệu
Chọn đáp án C
Có mấy cách dùng để xử lý khi dữ liệu bị thiếu?
2
3
4
5
Chọn đáp án B
Khi nào thì ta cần rời rạc hóa dữ liệu?
Dữ liệu bị thiếu
Dữ liệu thuộc kiểu số học
Dữ liệu thuộc kiểu định danh
Dữ liệu thuộc kiểu nhị phân
Chọn đáp án B
Chương 4
Phân lớp dữ liệu là thuộc phương pháp:
Không giám sát
Bán giám sát
Có giám sát
Phương pháp lai
Chọn đáp án C
Thuật toán phân lớp tham gia vào quá trình nào sau đây trong mô hình phân lớp dữ liệu?
Huấn luyện
Kiểm thử
Đánh giá
Dự đoán
Chọn đáp án D
Thuật toán phân lớp nào sau đây cho phép xử lý trên nhiều kiểu/loại dữ liệu khác nhau?
SVM
Cây quyết định
Logistic Regression
Mạng nơ ron
Chọn đáp án B
Trong Orange, biến có kiểu dữ liệu categorical là để chỉ các thuộc tính:
Liên tục
Rời rạc
Định lượng
Số học
Chọn đáp án B
Đối với bài toán phân lớp đa nhãn thì chỉ số đánh giá nào thường được dùng để đánh giá độ hiệu quả của mô hình phân lớp?
Precision
Recall
F1-score
Accuracy
Chọn đáp án C
Giá trị a[i;j] trong ma trận nhầm lẫn (confusion matrix) cho biết:
Số lượng mẫu i được phân vào đúng mẫu i
Số lượng mẫu i được phân nhầm vào mẫu j
Số lượng mẫu j được phân đúng vào mẫu j
Số lượng mẫu j được phân nhầm vào mẫu i
Chọn đáp án B
Phương pháp chọn mẫu dữ liệu nào sau đây dùng để khắc phục tình trạng over-fitting?
Chọn mẫu ngẫu nhiên (Random sampling)
Đánh giá chéo (k-fold cross validation)
Hold-out
Huấn luyện và kiểm thử trên cùng tập dữ liệu
Chọn đáp án C
Một người bị nghi ngờ bệnh lao đi thực hiện xét nghiệm. Nếu kết quả xét nghiệm cho thấy người này bị lao trong khi anh ta thật sự không mắc bệnh lao. Trường hợp này, được gọi là:
Tỷ lệ bỏ sót
Độ nhạy
Tỷ lệ báo động nhầm
Độ lỗi
Chọn đáp án C
Chương 5
Phân cụm dữ liệu là thuộc phương pháp:
Có giám sát
Không giám sát
Phương pháp lai
Bán giám sát
Chọn đáp án B
Một phương pháp phân cụm tốt là phương pháp cho kết quả phân cụm mà trong đó:
Độ tương đồng bên trong cụm cao, đồng thời độ tương đồng giữa các cụm cao.
Độ tương đồng bên trong cụm thấp, đồng thời độ tương đồng giữa các cụm cao.
Độ tương đồng bên trong cụm cao, đồng thời độ tương đồng giữa các cụm thấp.
Độ tương đồng bên trong cụm thấp, đồng thời độ tương đồng giữa các cụm thấp.
Chọn đáp án C
Thuật toán nào sau đây cho phép một phần tử có thể thuộc về một hoặc nhiều cụm khác nhau?
Diana
K-mean
DBSCAN
Fuzzy C-mean
Chọn đáp án D
Thuật toán phân cụm nào sau đây không cần biết trước số cụm?
K-mean
Agnes
Fuzzy C-mean
DBSCAN
Chọn đáp án B
Trong Orange, đối với thuật toán phân cụm phân cấp (HAC) để có được kết quả phân cụm với số lượng cụm cụ thể ta cần làm gì?
Chọn số lượng cụm k trên hộp thoại.
Chọn phương pháp tính khoảng cách trước khi chọn thuật toán.
Chọn đường cắt phù hợp trên cây phân cấp kết quả.
Không cần làm gì cả
Chọn đáp án C
So sánh kết quả giữa các mô hình để xem xét tính hiệu quả của việc phân cụm thuộc cách đánh giá nào sau đây?
Đánh giá ngoài
Đánh giá trong
Đánh giá tương đối
Tất cả các cách trên
Chọn đáp án C
Trong Orange, đối với thuật toán K-mean, tham số đầu vào nào sau đây dùng để kiểm soát trong trường hợp dữ liệu hội tụ chậm hoặc không hội tụ?
Số lượng cụm (number of cluster)
Khởi tạo các phần tử đại diện của cụm (Initialization)
Số lần chạy (re-runs)
Số lần lặp tối đa (maximum iterations)
Chọn đáp án A



