1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 15
30 câu hỏi
Lỗi 'overfitting' (quá khớp) trong huấn luyện mô hình NLP xảy ra khi:
Mô hình hoạt động kém trên cả dữ liệu huấn luyện và dữ liệu kiểm tra
Mô hình hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu kiểm tra
Mô hình hoạt động tốt trên cả dữ liệu huấn luyện và dữ liệu kiểm tra
Mô hình không hội tụ trong quá trình huấn luyện
Chọn đáp án B
Vấn đề 'context window limitation' (giới hạn cửa sổ ngữ cảnh) thường gặp ở mô hình ngôn ngữ nào?
Mô hình Transformer
Mô hình RNN (Recurrent Neural Network) truyền thống
Mô hình n-gram
Mô hình dựa trên Bag-of-Words
Chọn đáp án A
Trong mô hình ngôn ngữ dựa trên mạng nơ-ron, 'attention mechanism' (cơ chế chú ý) giúp giải quyết vấn đề gì?
Vấn đề từ vựng không có trong từ điển (out-of-vocabulary words)
Vấn đề phụ thuộc tầm xa (long-range dependencies) trong câu
Vấn đề tốc độ xử lý chậm của mạng nơ-ron
Vấn đề thiếu dữ liệu huấn luyện
Chọn đáp án B
Nhiệm vụ nào sau đây **KHÔNG PHẢI** là một ứng dụng chính của Xử lý ngôn ngữ tự nhiên (NLP)?
Phân tích cảm xúc văn bản
Dịch máy tự động
Nhận dạng khuôn mặt
Tóm tắt văn bản tự động
Chọn đáp án C
Vấn đề 'sparsity' (thưa thớt) thường gặp phải ở phương pháp biểu diễn văn bản nào?
Word embeddings (ví dụ: Word2Vec, GloVe)
Biểu diễn túi từ (Bag-of-Words)
Mô hình ngôn ngữ dựa trên mạng nơ-ron
Cây cú pháp phụ thuộc (Dependency parse tree)
Chọn đáp án
Phương pháp nào sau đây thường được sử dụng để đánh giá chất lượng của mô hình dịch máy?
Độ chính xác (Accuracy)
BLEU score (Bilingual Evaluation Understudy)
F1-score
Recall
Chọn đáp án B
Kỹ thuật 'stemming' trong NLP nhằm mục đích:
Tìm dạng nguyên gốc của từ (lemma)
Rút gọn từ về dạng gốc bằng cách loại bỏ các hậu tố và tiền tố
Phân tích cấu trúc ngữ pháp của câu
Phân loại văn bản dựa trên chủ đề
Chọn đáp án B
Phương pháp 'Bag-of-Words' biểu diễn văn bản dựa trên:
Thứ tự xuất hiện của các từ trong văn bản
Tần suất xuất hiện của mỗi từ trong văn bản, bỏ qua thứ tự
Ngữ cảnh xuất hiện của các từ trong văn bản
Mối quan hệ ngữ pháp giữa các từ trong văn bản
Chọn đáp án B
Kỹ thuật 'dropout' được sử dụng trong mạng nơ-ron để:
Tăng tốc độ huấn luyện
Giảm thiểu overfitting bằng cách ngẫu nhiên bỏ qua một số nơ-ron trong quá trình huấn luyện
Tăng kích thước mô hình
Cải thiện khả năng diễn giải của mô hình
Chọn đáp án B
Trong NLP, 'information retrieval' (IR - truy xuất thông tin) là lĩnh vực nghiên cứu về:
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Tìm kiếm và truy xuất các tài liệu liên quan đến một truy vấn cụ thể từ một tập dữ liệu lớn
Phân tích cảm xúc của văn bản trên mạng xã hội
Tạo ra văn bản tóm tắt từ một tài liệu dài
Chọn đáp án B
Trong ngữ cảnh của chatbots, 'intent recognition' (nhận dạng ý định) là quá trình:
Tạo ra phản hồi văn bản tự động
Xác định mục đích hoặc mong muốn của người dùng thông qua đầu vào văn bản của họ
Lưu trữ lịch sử hội thoại với người dùng
Chuyển đổi văn bản thành giọng nói để chatbot 'nói chuyện'
Chọn đáp án B
Sự khác biệt chính giữa 'stemming' và 'lemmatization' là gì?
Stemming chậm hơn lemmatization
Lemmatization tạo ra gốc từ có nghĩa, trong khi stemming có thể tạo ra gốc từ không có nghĩa
Stemming sử dụng từ điển, lemmatization thì không
Lemmatization chỉ áp dụng cho tiếng Anh, stemming áp dụng cho nhiều ngôn ngữ hơn
Chọn đáp án B
Trong ngữ cảnh của word embeddings, 'cosine similarity' (độ tương đồng cosine) được sử dụng để:
Đo khoảng cách giữa hai từ trong không gian vector
Đo mức độ tương tự về ngữ nghĩa giữa hai từ
Giảm chiều dữ liệu của word embeddings
Huấn luyện word embeddings từ dữ liệu văn bản
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, 'coreference resolution' (giải quyết đồng tham chiếu) là quá trình:
Dịch văn bản sang ngôn ngữ khác
Xác định tất cả các biểu thức tham chiếu đến cùng một thực thể trong văn bản
Phân tích cấu trúc ngữ pháp của câu
Tóm tắt nội dung chính của văn bản
Chọn đáp án B
Mô hình ngôn ngữ 'n-gram' hoạt động dựa trên giả định nào?
Mỗi từ trong câu độc lập với các từ khác
Xác suất xuất hiện của một từ chỉ phụ thuộc vào n-1 từ đứng trước nó
Ngữ nghĩa của từ là yếu tố quan trọng nhất
Cấu trúc ngữ pháp của câu quyết định ý nghĩa
Chọn đáp án B
Trong mô hình Transformer, thành phần 'self-attention' (tự chú ý) cho phép mô hình:
Xử lý dữ liệu tuần tự theo thứ tự
Tập trung vào các phần khác nhau của **cùng một** chuỗi đầu vào khi xử lý mỗi vị trí
Tập trung vào chuỗi đầu vào khác khi tạo ra chuỗi đầu ra
Giảm chiều dữ liệu đầu vào
Chọn đáp án B
Ứng dụng nào sau đây **KHÔNG** phải là một ví dụ trực tiếp của Xử lý ngôn ngữ tự nhiên?
Bộ lọc thư rác (Spam email filter)
Hệ thống đề xuất sản phẩm (Product recommendation system)
Trợ lý ảo (Virtual assistant)
Công cụ kiểm tra chính tả (Spell checker)
Chọn đáp án B
Thuật ngữ 'tokenization' trong NLP đề cập đến quá trình:
Chuyển đổi văn bản thành giọng nói
Chia văn bản thành các đơn vị nhỏ hơn, ví dụ như từ hoặc cụm từ
Gán nhãn từ loại cho mỗi từ trong câu
Loại bỏ các từ dừng (stop words) khỏi văn bản
Chọn đáp án B
Trong phân tích cảm xúc (sentiment analysis), 'aspect-based sentiment analysis' (phân tích cảm xúc dựa trên khía cạnh) đi sâu hơn bằng cách:
Xác định cảm xúc chung của toàn bộ văn bản
Xác định cảm xúc đối với từng khía cạnh cụ thể được đề cập trong văn bản
Dịch văn bản sang ngôn ngữ khác trước khi phân tích cảm xúc
Sử dụng từ điển cảm xúc để phân tích cảm xúc
Chọn đáp án B
Trong lĩnh vực tạo sinh văn bản (text generation), 'sampling' (lấy mẫu) là kỹ thuật:
Đánh giá chất lượng văn bản được tạo ra
Lựa chọn từ tiếp theo để tạo ra văn bản, dựa trên phân phối xác suất dự đoán của mô hình
Tiền xử lý dữ liệu huấn luyện
Tăng tốc độ tạo văn bản
Chọn đáp án B
Mục tiêu chính của 'Named Entity Recognition' (NER) là gì?
Phân tích cảm xúc của văn bản
Xác định và phân loại các thực thể có tên trong văn bản
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Tóm tắt nội dung chính của văn bản
Chọn đáp án B
Trong ngữ cảnh của mô hình ngôn ngữ, 'perplexity' (độ khó hiểu) là một metric đánh giá:
Tốc độ xử lý của mô hình
Khả năng dự đoán từ tiếp theo của mô hình
Độ phức tạp của mô hình
Kích thước của mô hình
Chọn đáp án B
Mục tiêu của 'dependency parsing' (phân tích cú pháp phụ thuộc) là gì?
Phân chia câu thành các cụm từ
Xác định mối quan hệ phụ thuộc giữa các từ trong câu, biểu diễn dưới dạng cây
Gán nhãn từ loại cho mỗi từ
Phân tích cảm xúc của câu
Chọn đáp án B
Phương pháp nào sau đây thường được sử dụng để giảm chiều dữ liệu trong biểu diễn vector từ (word embeddings)?
Mã hóa one-hot
Phân tích thành phần chính (PCA)
Biểu diễn túi từ (Bag-of-Words)
Biểu diễn TF-IDF
Chọn đáp án B
Phương pháp nào sau đây **KHÔNG** thuộc nhóm phương pháp học máy không giám sát (unsupervised learning) trong NLP?
Phân cụm văn bản (Document clustering)
Mô hình hóa chủ đề (Topic modeling)
Phân loại cảm xúc (Sentiment classification) với dữ liệu gán nhãn
Giảm chiều dữ liệu (Dimensionality reduction)
Chọn đáp án C
Phương pháp 'transfer learning' (học chuyển giao) trong NLP giúp ích như thế nào?
Giảm kích thước mô hình
Tái sử dụng kiến thức đã học từ một nhiệm vụ (hoặc tập dữ liệu) để cải thiện hiệu suất trên một nhiệm vụ khác, thường là với ít dữ liệu hơn
Tăng tốc độ huấn luyện mô hình
Cải thiện khả năng diễn giải của mô hình
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, 'stop words' (từ dừng) thường được loại bỏ vì:
Chúng chứa thông tin ngữ nghĩa quan trọng
Chúng xuất hiện quá thường xuyên và ít đóng góp vào ý nghĩa của văn bản
Chúng gây khó khăn cho việc tokenization
Chúng chỉ xuất hiện trong các ngôn ngữ nhất định
Chọn đáp án B
Trong NLP, 'word sense disambiguation' (WSD - phân biệt nghĩa từ) là bài toán:
Dịch một từ sang ngôn ngữ khác
Xác định nghĩa chính xác của một từ trong ngữ cảnh cụ thể, khi từ đó có nhiều nghĩa
Tìm từ đồng nghĩa và trái nghĩa của một từ
Phân tích cấu trúc ngữ pháp của câu chứa từ đó
Chọn đáp án B
Phương pháp 'TF-IDF' được sử dụng để làm gì trong NLP?
Giảm chiều dữ liệu văn bản
Đánh trọng số cho các từ trong văn bản dựa trên tần suất xuất hiện của chúng trong tài liệu và toàn bộ tập tài liệu
Phân cụm các văn bản tương tự
Tìm dạng nguyên gốc của từ (lemma)
Chọn đáp án B
Kỹ thuật 'backpropagation' (lan truyền ngược) được sử dụng để làm gì trong mạng nơ-ron?
Dự đoán đầu ra từ đầu vào
Tính toán gradient của hàm mất mát và cập nhật trọng số của mạng
Khởi tạo trọng số ban đầu cho mạng
Giảm chiều dữ liệu đầu vào
Chọn đáp án B








