1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 25
30 câu hỏi
Trong quá trình tiền xử lý văn bản cho NLP, kỹ thuật nào giúp đưa các từ về dạng cơ sở hoặc dạng gốc của chúng, nhằm giảm số lượng biến thể từ và chuẩn hóa văn bản?
Mã hóa token (Tokenization)
Loại bỏ từ dừng (Stop word removal)
Lemma hóa (Lemmatization)
Phân tích cú pháp (Parsing)
Chọn đáp án C
Mô hình Bag-of-Words (BoW) biểu diễn văn bản bằng cách nào?
Bằng cách mã hóa thứ tự từ trong câu
Bằng cách đếm tần suất xuất hiện của mỗi từ trong văn bản
Bằng cách sử dụng mạng nơ-ron để học biểu diễn từ
Bằng cách phân tích quan hệ ngữ pháp giữa các từ
Chọn đáp án B
TF-IDF là một kỹ thuật được sử dụng để làm gì trong NLP?
Phân tích tình cảm của văn bản
Phát hiện ngôn ngữ của văn bản
Tóm tắt văn bản
Đánh giá tầm quan trọng của từ trong một văn bản so với tập hợp văn bản
Chọn đáp án D
Word embedding (biểu diễn từ dạng वेक्टर) như Word2Vec và GloVe giúp ích gì trong các bài toán NLP?
Biểu diễn từ dưới dạng vector số, giúp máy tính hiểu được quan hệ ngữ nghĩa giữa các từ
Loại bỏ các từ không quan trọng trong văn bản
Phân chia văn bản thành các câu
Đếm tần suất xuất hiện của các từ
Chọn đáp án A
Nhiệm vụ nào sau đây thuộc về phân tích cú pháp (syntactic analysis) trong NLP?
Xác định chủ đề của văn bản
Xác định cấu trúc ngữ pháp và quan hệ giữa các thành phần trong câu
Phân loại văn bản theo tình cảm (tích cực, tiêu cực, trung lập)
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Chọn đáp án B
Mô hình ngôn ngữ N-gram hoạt động dựa trên nguyên tắc nào?
Dựa trên mạng nơ-ron sâu để học ngữ cảnh
Dựa trên quy tắc ngữ pháp được lập trình sẵn
Dựa trên xác suất xuất hiện của N từ liên tiếp trong dữ liệu huấn luyện
Dựa trên phân tích ngữ nghĩa của từ
Chọn đáp án C
Trong ngữ cảnh của mô hình Transformer, "attention mechanism" (cơ chế chú ý) có vai trò gì?
Tăng tốc độ tính toán của mô hình
Giảm thiểu hiện tượng overfitting
Thay thế cho lớp mạng nơ-ron tích chập (CNN)
Cho phép mô hình tập trung vào các phần quan trọng nhất của đầu vào khi xử lý
Chọn đáp án D
BERT (Bidirectional Encoder Representations from Transformers) là một mô hình ngôn ngữ được biết đến với điều gì?
Khả năng hiểu ngữ cảnh hai chiều của từ trong câu
Khả năng dịch ngôn ngữ theo thời gian thực
Khả năng tạo sinh văn bản tự do
Khả năng phân tích hình ảnh và văn bản đồng thời
Chọn đáp án A
Mục tiêu chính của nhiệm vụ "Named Entity Recognition" (NER - Nhận dạng thực thể có tên) là gì?
Phân loại văn bản theo chủ đề
Xác định và phân loại các thực thể có tên (ví dụ: người, tổ chức, địa điểm) trong văn bản
Phân tích cảm xúc và thái độ trong văn bản
Tóm tắt nội dung chính của văn bản
Chọn đáp án B
"Sentiment Analysis" (Phân tích tình cảm) được sử dụng để làm gì?
Dịch văn bản sang ngôn ngữ khác
Nhận dạng các thực thể có tên trong văn bản
Xác định cảm xúc, thái độ (ví dụ: tích cực, tiêu cực, trung lập) được thể hiện trong văn bản
Tạo ra văn bản mới dựa trên phong cách đã học
Chọn đáp án C
Trong Machine Translation (Dịch máy), thách thức "out-of-vocabulary" (OOV) đề cập đến vấn đề gì?
Tốc độ dịch chậm do từ vựng quá lớn
Sự mơ hồ về nghĩa của từ trong các ngôn ngữ khác nhau
Khó khăn trong việc xử lý các câu phức tạp về mặt ngữ pháp
Việc mô hình gặp phải các từ không xuất hiện trong dữ liệu huấn luyện
Chọn đáp án D
Kỹ thuật "back-translation" (dịch ngược) được sử dụng để làm gì trong dịch máy?
Đánh giá chất lượng của bản dịch
Tăng cường dữ liệu huấn luyện bằng cách tạo ra dữ liệu song ngữ tổng hợp
Giảm kích thước của mô hình dịch máy
Cải thiện khả năng xử lý từ OOV
Chọn đáp án B
"Text Summarization" (Tóm tắt văn bản) có hai phương pháp chính là extractive và abstractive. Phương pháp abstractive khác biệt như thế nào so với extractive?
Abstractive chỉ tóm tắt các đoạn đầu của văn bản, còn extractive tóm tắt toàn bộ văn bản
Extractive tạo ra bản tóm tắt ngắn hơn abstractive
Abstractive tạo ra bản tóm tắt bằng cách diễn đạt lại ý chính, còn extractive chọn lọc và ghép nối các câu có sẵn trong văn bản gốc
Extractive sử dụng mô hình học sâu, còn abstractive sử dụng phương pháp thống kê truyền thống
Chọn đáp án C
Nhiệm vụ "Question Answering" (QA - Hỏi đáp) trong NLP nhằm mục đích gì?
Xây dựng hệ thống có thể trả lời câu hỏi của con người bằng ngôn ngữ tự nhiên
Phân loại câu hỏi theo chủ đề
Tạo ra các câu hỏi kiểm tra kiến thức
Đánh giá độ khó của câu hỏi
Chọn đáp án A
"Chatbot" (Trợ lý ảo) sử dụng NLP để thực hiện điều gì?
Phân tích dữ liệu người dùng để cải thiện sản phẩm
Hiểu ngôn ngữ tự nhiên của người dùng và phản hồi một cách phù hợp
Tự động tạo ra nội dung quảng cáo
Theo dõi hành vi trực tuyến của người dùng
Chọn đáp án B
Độ đo "Precision" (Độ chính xác) trong đánh giá mô hình NLP được tính như thế nào?
Tỷ lệ dự đoán đúng trên tổng số mẫu thực tế là tích cực
Tỷ lệ dự đoán sai trên tổng số mẫu
Tỷ lệ dự đoán đúng là tích cực trên tổng số mẫu dự đoán là tích cực
Tỷ lệ mẫu thực tế là tích cực được dự đoán đúng
Chọn đáp án C
"Recall" (Độ phủ) trong đánh giá mô hình NLP thể hiện điều gì?
Khả năng mô hình tìm ra tất cả các mẫu thực sự thuộc lớp tích cực
Khả năng mô hình dự đoán chính xác các mẫu thuộc lớp tiêu cực
Độ chính xác của mô hình trên toàn bộ tập dữ liệu
Tỷ lệ dự đoán sai trên tổng số mẫu dự đoán
Chọn đáp án A
F1-score là gì và tại sao nó hữu ích trong đánh giá mô hình NLP?
Đo lường tốc độ xử lý của mô hình
Trung bình điều hòa của Precision và Recall, hữu ích khi cần cân bằng giữa độ chính xác và độ phủ
Đo lường độ phức tạp của mô hình
Đo lường khả năng khái quát hóa của mô hình trên dữ liệu mới
Chọn đáp án B
Vấn đề "bias" (thiên kiến) trong NLP có thể phát sinh từ đâu?
Do thuật toán học máy không đủ mạnh
Do kích thước dữ liệu huấn luyện quá nhỏ
Do lỗi lập trình trong quá trình xây dựng mô hình
Từ dữ liệu huấn luyện có sẵn chứa đựng các định kiến xã hội và văn hóa
Chọn đáp án D
Làm thế nào để giảm thiểu "bias" trong mô hình NLP?
Tăng cường độ phức tạp của mô hình
Sử dụng nhiều dữ liệu huấn luyện hơn
Cải thiện chất lượng và tính đa dạng của dữ liệu huấn luyện, áp dụng các kỹ thuật de-biasing
Giảm số lượng tham số trong mô hình
Chọn đáp án C
Thư viện spaCy trong Python được sử dụng chủ yếu cho mục đích gì trong NLP?
Xây dựng mô hình dịch máy phức tạp
Xử lý văn bản hiệu suất cao, bao gồm tokenization, POS tagging, NER, và phân tích cú pháp
Phân tích dữ liệu âm thanh và giọng nói
Thực hiện các thuật toán học máy cổ điển như SVM và Random Forest
Chọn đáp án B
NLTK (Natural Language Toolkit) là gì và nó cung cấp những gì cho người làm NLP?
Một nền tảng đám mây để triển khai mô hình NLP
Một công cụ trực tuyến để dịch văn bản
Một thư viện chuyên biệt cho deep learning trong NLP
Một bộ công cụ toàn diện cho NLP, bao gồm tài nguyên văn bản, thuật toán và công cụ đánh giá
Chọn đáp án D
Mô hình ngôn ngữ "word embeddings" có thể được sử dụng trực tiếp cho nhiệm vụ nào sau đây?
Phân tích cú pháp câu
Tạo sinh văn bản hoàn chỉnh
Tính toán độ tương đồng ngữ nghĩa giữa các từ hoặc văn bản
Nhận dạng thực thể có tên trong văn bản
Chọn đáp án C
RNN (Recurrent Neural Network - Mạng nơ-ron hồi quy) phù hợp với loại dữ liệu nào trong NLP?
Dữ liệu chuỗi tuần tự, như văn bản và giọng nói
Dữ liệu dạng bảng
Dữ liệu hình ảnh tĩnh
Dữ liệu phi cấu trúc không có thứ tự
Chọn đáp án A
LSTM (Long Short-Term Memory) là một loại mạng nơ-ron hồi quy được thiết kế để giải quyết vấn đề gì của RNN truyền thống?
Vấn đề overfitting
Vấn đề vanishing gradient (mất mát đạo hàm) khi xử lý chuỗi dài
Vấn đề tính toán chậm
Vấn đề thiếu dữ liệu huấn luyện
Chọn đáp án B
"Tokenization" (Mã hóa token) là quá trình đầu tiên trong nhiều quy trình NLP. Nó làm gì?
Phân tích cấu trúc ngữ pháp của câu
Loại bỏ các từ dừng (stop words) khỏi văn bản
Chia văn bản thành các đơn vị nhỏ hơn, thường là từ hoặc cụm từ
Chuyển đổi văn bản thành dạng số
Chọn đáp án C
"Stop words" (Từ dừng) là gì và tại sao chúng thường được loại bỏ trong tiền xử lý văn bản?
Các từ mang thông tin ngữ nghĩa quan trọng nhất
Các từ mới xuất hiện trong văn bản
Các từ được sử dụng để liên kết các câu
Các từ phổ biến, ít mang thông tin đặc trưng cho văn bản (ví dụ: "và", "là", "của"), thường được loại bỏ để giảm nhiễu
Chọn đáp án D
"Stemming" (Rút gốc từ) và "Lemmatization" (Lemma hóa) đều nhằm mục đích chuẩn hóa từ, nhưng khác nhau ở điểm nào?
Stemming phức tạp hơn Lemmatization
Stemming chỉ đơn giản cắt bỏ hậu tố, có thể tạo ra từ không có nghĩa, còn Lemmatization đưa về dạng từ điển có nghĩa
Lemmatization nhanh hơn Stemming
Stemming chỉ áp dụng cho tiếng Anh, còn Lemmatization có thể dùng cho nhiều ngôn ngữ
Chọn đáp án B
"Part-of-speech tagging" (Gán nhãn từ loại) là gì?
Quá trình gán nhãn từ loại (ví dụ: danh từ, động từ, tính từ) cho mỗi từ trong câu
Quá trình phân tích mối quan hệ giữa các từ trong câu
Quá trình chuyển đổi văn bản thành giọng nói
Quá trình dịch từ loại từ ngôn ngữ này sang ngôn ngữ khác
Chọn đáp án A
Trong ngữ cảnh của NLP, "corpus" (ngữ liệu) dùng để chỉ điều gì?
Một thuật toán học máy cụ thể
Một phương pháp đánh giá mô hình NLP
Một tập hợp lớn các văn bản được sử dụng để huấn luyện hoặc đánh giá mô hình NLP
Một loại word embedding đặc biệt
Chọn đáp án C








