1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 22
30 câu hỏi
Trong xử lý ngôn ngữ tự nhiên (NLP), quá trình nào liên quan đến việc chia một đoạn văn bản thành các đơn vị nhỏ hơn, chẳng hạn như từ, cụm từ hoặc ký hiệu?
Lemmatization
Tokenization
Stemming
Phân tích cú pháp
Chọn đáp án B
Mô hình Bag-of-Words (BoW) biểu diễn văn bản như thế nào?
Một chuỗi các từ theo thứ tự xuất hiện trong văn bản
Một đồ thị thể hiện mối quan hệ ngữ pháp giữa các từ
Một vectơ tần số từ, trong đó mỗi chiều tương ứng với một từ trong từ vựng
Một mạng lưới các khái niệm và mối liên kết giữa chúng
Chọn đáp án C
TF-IDF là viết tắt của thuật ngữ nào và nó được sử dụng để làm gì trong NLP?
Term Frequency-Inverse Document Frequency; đo lường tầm quan trọng của từ trong tài liệu
Text Filtering-Information Dissemination Function; lọc thông tin không liên quan
Topic Factorization-Iterative Distribution Formula; phân tách chủ đề văn bản
Treebank Formation-Independent Dependency Feature; xây dựng cây cú pháp
Chọn đáp án A
Word embedding (ví dụ: Word2Vec, GloVe) giúp biểu diễn từ ngữ như thế nào để máy tính có thể xử lý?
Dạng hình ảnh trực quan của từ
Mã nhị phân duy nhất cho mỗi từ
Danh sách các từ đồng nghĩa và trái nghĩa
Vectơ số thực trong không gian nhiều chiều, thể hiện ngữ nghĩa của từ
Chọn đáp án D
Recurrent Neural Network (RNN) đặc biệt phù hợp cho các nhiệm vụ NLP nào?
Phân loại hình ảnh
Xử lý dữ liệu chuỗi tuần tự như dịch máy và phân tích văn bản
Phát hiện đối tượng trong ảnh
Dự đoán giá cổ phiếu
Chọn đáp án B
Transformer networks, đặc biệt là cơ chế attention, cải thiện hiệu suất trong các bài toán NLP như dịch máy như thế nào so với RNN?
RNN nhanh hơn Transformer trong quá trình huấn luyện
RNN có thể xử lý song song toàn bộ chuỗi đầu vào tốt hơn Transformer
Transformer cho phép mô hình tập trung vào các phần khác nhau của đầu vào một cách linh hoạt, xử lý tốt hơn các phụ thuộc xa trong câu
Transformer không yêu cầu dữ liệu huấn luyện lớn như RNN
Chọn đáp án C
Nhiệm vụ "Named Entity Recognition" (NER) trong NLP là gì?
Phân loại văn bản theo chủ đề
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Tóm tắt văn bản dài thành văn bản ngắn hơn
Xác định và phân loại các thực thể có tên (ví dụ: người, tổ chức, địa điểm) trong văn bản
Chọn đáp án A
Phân tích tình cảm (Sentiment Analysis) trong NLP nhằm mục đích gì?
Xác định thái độ, cảm xúc (tích cực, tiêu cực, trung lập) được thể hiện trong văn bản
Phân tích cấu trúc ngữ pháp của câu
Tìm kiếm thông tin cụ thể trong văn bản
Đo lường độ dài của văn bản
Chọn đáp án D
Trong ngữ cảnh của chatbot, NLP đóng vai trò quan trọng như thế nào?
NLP chỉ được sử dụng để tạo giao diện đồ họa cho chatbot
NLP cho phép chatbot hiểu ngôn ngữ tự nhiên của người dùng, diễn giải ý định và tạo phản hồi phù hợp
NLP giới hạn khả năng của chatbot trong việc nhận dạng giọng nói
NLP chỉ cần thiết cho chatbot đa ngôn ngữ
Chọn đáp án B
"Stop words" là gì và tại sao chúng thường bị loại bỏ trong quá trình tiền xử lý NLP?
Các từ mang nghĩa tiêu cực cần loại bỏ để phân tích tình cảm chính xác hơn
Các từ hiếm gặp cần loại bỏ để giảm kích thước từ vựng
Các từ phổ biến (ví dụ: "và", "là", "của") thường ít mang ý nghĩa trong nhiều nhiệm vụ NLP và có thể gây nhiễu
Các từ viết sai chính tả cần loại bỏ để làm sạch dữ liệu
Chọn đáp án C
Mục đích của "lemmatization" và "stemming" trong NLP là gì?
Tăng số lượng từ trong văn bản
Thay thế từ bằng từ đồng nghĩa
Phân tích cấu trúc ngữ pháp của từ
Đưa các từ về dạng gốc hoặc dạng chuẩn hóa để giảm sự phức tạp và cải thiện hiệu suất mô hình
Chọn đáp án D
Kỹ thuật "n-gram" được sử dụng để làm gì trong NLP?
Mã hóa văn bản thành dạng số
Phân tích chuỗi các từ liên tiếp để nắm bắt thông tin ngữ cảnh và thứ tự từ
Loại bỏ nhiễu từ văn bản
Tạo ra các từ mới từ văn bản hiện có
Chọn đáp án B
"Parse tree" (cây phân tích cú pháp) biểu diễn điều gì về một câu?
Tần suất xuất hiện của các từ trong câu
Ý nghĩa ngữ nghĩa của câu
Cấu trúc cú pháp và mối quan hệ ngữ pháp giữa các thành phần của câu
Tình cảm chủ đạo của câu
Chọn đáp án C
"Cosine similarity" thường được sử dụng để làm gì trong NLP?
Đo độ tương đồng giữa hai vectơ, thường được sử dụng để so sánh văn bản hoặc word embeddings
Phân loại văn bản thành các chủ đề khác nhau
Tìm kiếm lỗi chính tả trong văn bản
Đánh giá hiệu suất của mô hình dịch máy
Chọn đáp án A
"BLEU score" là gì và nó được sử dụng để đánh giá nhiệm vụ NLP nào?
Đánh giá độ chính xác của phân tích tình cảm
Đo lường tốc độ xử lý văn bản của mô hình
Đánh giá khả năng tóm tắt văn bản
Đánh giá chất lượng của đầu ra dịch máy so với bản dịch tham khảo
Chọn đáp án D
"Knowledge graph" (biểu đồ tri thức) được sử dụng để biểu diễn thông tin như thế nào trong NLP?
Dạng văn bản thuần túy
Dạng đồ thị với các nút (thực thể) và cạnh (mối quan hệ) giữa chúng
Dạng bảng cơ sở dữ liệu quan hệ
Dạng cây phân cấp
Chọn đáp án B
Ứng dụng nào sau đây thể hiện việc sử dụng NLP để cải thiện khả năng tiếp cận thông tin cho người dùng?
Phát hiện tin giả
Tạo quảng cáo cá nhân hóa
Tóm tắt văn bản tự động để nhanh chóng nắm bắt nội dung chính
Phân loại email spam
Chọn đáp án C
Trong bối cảnh NLP, "contextual embeddings" (ví dụ: BERT, ELMo) khác biệt như thế nào so với word embeddings truyền thống (ví dụ: Word2Vec, GloVe)?
Word embeddings truyền thống có kích thước vectơ lớn hơn
Contextual embeddings dễ huấn luyện hơn
Word embeddings truyền thống biểu diễn từ dựa trên ngữ cảnh
Contextual embeddings tạo ra biểu diễn khác nhau cho cùng một từ tùy thuộc vào ngữ cảnh sử dụng, trong khi word embeddings truyền thống tạo ra một biểu diễn duy nhất cho mỗi từ
Chọn đáp án D
Phương pháp "back-translation" được sử dụng để làm gì trong dịch máy?
Đánh giá chất lượng bản dịch
Tăng cường dữ liệu huấn luyện bằng cách tạo ra các cặp câu song ngữ mới từ dữ liệu đơn ngữ
Giảm thiểu lỗi dịch do từ vựng ngoài tập huấn luyện
Cải thiện tốc độ dịch
Chọn đáp án B
"Attention mechanism" trong Transformer hoạt động như thế nào?
Tăng tốc độ tính toán của mạng nơ-ron
Giảm số lượng tham số của mô hình
Cho phép mô hình tập trung vào các phần khác nhau của chuỗi đầu vào khi tạo ra đầu ra, bằng cách gán trọng số khác nhau cho mỗi vị trí đầu vào
Chuẩn hóa dữ liệu đầu vào
Chọn đáp án C
Thách thức chính của NLP khi xử lý ngôn ngữ tiếng Việt là gì, so với tiếng Anh?
Tiếng Việt là ngôn ngữ đơn lập, việc phân tách từ (word segmentation) phức tạp hơn do không có dấu cách rõ ràng giữa các từ ghép
Tiếng Việt có số lượng từ vựng ít hơn tiếng Anh
Tiếng Việt ít biến thể ngữ pháp hơn tiếng Anh
Tiếng Việt không có thanh điệu, gây khó khăn trong việc phân biệt nghĩa
Chọn đáp án A
Trong phát triển mô hình NLP, "overfitting" (quá khớp) xảy ra khi nào và nó ảnh hưởng đến hiệu suất mô hình như thế nào?
Khi mô hình học quá chậm trên dữ liệu huấn luyện
Khi mô hình sử dụng quá nhiều dữ liệu huấn luyện
Khi mô hình không đủ phức tạp để nắm bắt được mẫu trong dữ liệu
Khi mô hình học quá kỹ dữ liệu huấn luyện, dẫn đến hiệu suất tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới (dữ liệu kiểm thử)
Chọn đáp án D
Kỹ thuật "dropout" thường được sử dụng trong mạng nơ-ron sâu (deep neural networks) để giải quyết vấn đề gì?
Tăng tốc độ huấn luyện mô hình
Giảm kích thước mô hình
Giảm overfitting bằng cách ngẫu nhiên bỏ qua một số nơ-ron trong quá trình huấn luyện
Cải thiện khả năng diễn giải của mô hình
Chọn đáp án C
"Zero-shot learning" trong NLP có nghĩa là gì?
Huấn luyện mô hình với dữ liệu không có nhãn
Khả năng của mô hình thực hiện một nhiệm vụ mới mà không cần được huấn luyện trực tiếp trên nhiệm vụ đó, mà chỉ dựa trên kiến thức đã học từ các nhiệm vụ liên quan
Huấn luyện mô hình với dữ liệu tổng hợp
Sử dụng mô hình được huấn luyện trên một ngôn ngữ để thực hiện nhiệm vụ trên ngôn ngữ khác
Chọn đáp án B
"Few-shot learning" khác với "zero-shot learning" như thế nào?
Few-shot learning không sử dụng dữ liệu huấn luyện, trong khi zero-shot learning có sử dụng
Few-shot learning chỉ áp dụng cho phân loại văn bản, còn zero-shot learning áp dụng cho dịch máy
Few-shot learning cho phép mô hình học từ một số lượng rất ít ví dụ có nhãn cho một nhiệm vụ mới, trong khi zero-shot learning không sử dụng bất kỳ ví dụ có nhãn nào cho nhiệm vụ mới
Few-shot learning luôn đạt hiệu suất cao hơn zero-shot learning
Chọn đáp án C
"Explainable AI" (XAI) quan trọng như thế nào trong NLP, đặc biệt trong các ứng dụng nhạy cảm như phân tích ý kiến khách hàng hay sàng lọc hồ sơ?
Rất quan trọng, vì XAI giúp hiểu rõ cách mô hình NLP đưa ra quyết định, tăng tính minh bạch, trách nhiệm giải trình và độ tin cậy, đặc biệt cần thiết trong các ứng dụng nhạy cảm
Không quan trọng, vì hiệu suất dự đoán là yếu tố duy nhất cần quan tâm
Chỉ quan trọng trong nghiên cứu, không cần thiết trong ứng dụng thực tế
Ít quan trọng hơn so với các lĩnh vực AI khác như thị giác máy tính
Chọn đáp án A
"Adversarial attacks" (tấn công đối nghịch) trong NLP là gì và chúng gây ra vấn đề gì?
Các phương pháp huấn luyện mô hình NLP nhanh hơn
Các kỹ thuật làm tăng tính đa dạng của dữ liệu huấn luyện
Các biện pháp bảo vệ mô hình NLP khỏi bị sao chép
Các đầu vào được thiết kế đặc biệt để đánh lừa mô hình NLP, dẫn đến dự đoán sai và làm lộ ra các lỗ hổng bảo mật
Chọn đáp án D
"Data augmentation" (tăng cường dữ liệu) có thể được thực hiện như thế nào trong NLP?
Giảm kích thước dữ liệu huấn luyện
Loại bỏ dữ liệu nhiễu
Sử dụng các kỹ thuật như thay thế từ đồng nghĩa, dịch ngược, xáo trộn từ để tạo thêm dữ liệu huấn luyện đa dạng hơn
Chuẩn hóa dữ liệu đầu vào
Chọn đáp án C
Phương pháp "cross-lingual transfer learning" (học chuyển giao đa ngôn ngữ) cho phép mô hình NLP làm gì?
Dịch văn bản giữa nhiều ngôn ngữ khác nhau
Áp dụng kiến thức học được từ một ngôn ngữ (thường là ngôn ngữ có nhiều tài nguyên) sang ngôn ngữ khác (thường là ngôn ngữ ít tài nguyên) để cải thiện hiệu suất
Phân tích văn bản đa ngôn ngữ
Tạo ra văn bản đa ngôn ngữ
Chọn đáp án B
Trong đánh giá mô hình NLP, "precision" (độ chính xác) và "recall" (độ phủ) có ý nghĩa gì và chúng khác nhau như thế nào?
Precision đo tổng số dự đoán đúng, recall đo tổng số dự đoán sai
Precision và recall đều đo lường tỷ lệ dự đoán đúng trên tổng số mẫu
Precision đo tỷ lệ dự đoán đúng trên tổng số mẫu dương tính thực tế, recall đo tỷ lệ dự đoán đúng trên tổng số mẫu dự đoán dương tính
Precision đo tỷ lệ dự đoán đúng trong số các mẫu được dự đoán là dương tính, còn recall đo tỷ lệ dự đoán đúng trong số các mẫu thực sự là dương tính
Chọn đáp án D








