1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 2
30 câu hỏi
Trong một hệ thống hỏi đáp (Question Answering), thành phần nào chịu trách nhiệm trích xuất thông tin từ văn bản để trả lời câu hỏi?
Question encoder
Answer decoder
Context retriever
Information extractor
Chọn đáp án D
Khi xây dựng một hệ thống phân tích cảm xúc, bạn nhận thấy mô hình của mình hoạt động tốt trên dữ liệu huấn luyện nhưng kém hiệu quả trên dữ liệu thực tế. Vấn đề này được gọi là gì?
Underfitting
Overfitting
Regularization
Normalization
Chọn đáp án B
Conditional Random Fields (CRF) thường được sử dụng cho tác vụ nào trong NLP?
Phân tích cảm xúc
Nhận dạng thực thể có tên (Named Entity Recognition)
Tóm tắt văn bản
Dịch máy
Chọn đáp án B
Khi xử lý văn bản thô, bước nào sau đây KHÔNG thuộc giai đoạn tiền xử lý?
Loại bỏ HTML tags
Chuyển đổi văn bản thành chữ thường
Huấn luyện mô hình
Loại bỏ dấu câu
Chọn đáp án C
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật nào sau đây thường được sử dụng để xác định loại từ (ví dụ: danh từ, động từ, tính từ) của mỗi từ trong một câu?
Tokenization
Stemming
Part-of-speech tagging
Stop word removal
Chọn đáp án C
Bag of Words (BoW) là một mô hình đơn giản trong NLP. Hạn chế lớn nhất của BoW là gì?
Không thể xử lý văn bản dài
Không giữ được thứ tự của từ trong câu
Yêu cầu lượng lớn bộ nhớ
Chỉ hoạt động với tiếng Anh
Chọn đáp án B
Mục tiêu của việc sử dụng word embeddings (ví dụ: Word2Vec, GloVe) trong NLP là gì?
Chuyển đổi từ thành dạng số để máy tính có thể xử lý
Giảm số lượng từ trong văn bản
Phân loại các từ theo loại từ (danh từ, động từ, tính từ)
Tìm gốc của từ để chuẩn hóa văn bản
Chọn đáp án A
Mục tiêu chính của stemming trong NLP là gì?
Tìm gốc của từ để chuẩn hóa văn bản
Phân loại các từ theo loại từ (danh từ, động từ, tính từ)
Loại bỏ các từ dừng (stop words) khỏi văn bản
Chia văn bản thành các token nhỏ hơn
Chọn đáp án A
Khi một mô hình NLP không thể khái quát hóa tốt trên dữ liệu mới và cho thấy hiệu suất kém, điều này thường được gọi là gì?
Overfitting
Underfitting
Regularization
Normalization
Chọn đáp án B
Phương pháp nào sau đây được sử dụng để đánh giá hiệu quả của một mô hình dịch máy?
BLEU (Bilingual Evaluation Understudy)
ROUGE (Recall-Oriented Understudy for Gisting Evaluation)
TF-IDF
Word2Vec
Chọn đáp án A
TF-IDF là một kỹ thuật quan trọng trong NLP, TF (Term Frequency) trong TF-IDF thể hiện điều gì?
Tần suất xuất hiện của một từ trong toàn bộ văn bản
Tần suất xuất hiện của một từ trong một tài liệu
Tổng số từ trong một tài liệu
Số lượng tài liệu chứa một từ
Chọn đáp án B
Khi xử lý văn bản tiếng Việt, điều gì cần đặc biệt lưu ý so với tiếng Anh?
Tiếng Việt không có dấu
Tiếng Việt là ngôn ngữ đơn âm tiết
Tiếng Việt có cấu trúc ngữ pháp đơn giản hơn
Tiếng Việt có nhiều từ mượn từ tiếng Pháp
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật nào sau đây thường được sử dụng để chuyển đổi văn bản thành dạng số để máy tính có thể xử lý?
Tokenization
Normalization
Vectorization
Stemming
Chọn đáp án C
Trong ngữ cảnh của topic modeling (mô hình hóa chủ đề), LDA (Latent Dirichlet Allocation) là gì?
Một thuật toán phân cụm dữ liệu
Một mô hình sinh xác suất để khám phá các chủ đề tiềm ẩn trong một tập hợp các tài liệu
Một phương pháp để giảm chiều dữ liệu
Một kỹ thuật để tăng cường dữ liệu
Chọn đáp án B
Mô hình ngôn ngữ BERT (Bidirectional Encoder Representations from Transformers) nổi tiếng với khả năng gì?
Chỉ hiểu ngôn ngữ theo một hướng (từ trái sang phải)
Hiểu ngôn ngữ theo cả hai hướng (trái sang phải và phải sang trái)
Dịch văn bản từ tiếng Anh sang tiếng Việt
Tạo sinh văn bản mới hoàn toàn
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, ‘paraphrasing’ là gì?
Quá trình chuyển đổi văn bản thành giọng nói
Quá trình diễn đạt lại một câu hoặc đoạn văn bằng cách sử dụng các từ ngữ khác nhưng vẫn giữ nguyên ý nghĩa
Quá trình phân tích cấu trúc ngữ pháp của một câu
Quá trình tóm tắt một văn bản dài thành một phiên bản ngắn hơn
Chọn đáp án B
Kỹ thuật nào sau đây thường được sử dụng để giảm chiều dữ liệu trong NLP, giúp giảm độ phức tạp tính toán và cải thiện hiệu suất mô hình?
Tokenization
Stemming
Principal Component Analysis (PCA)
Stop word removal
Chọn đáp án C
Trong mô hình Word2Vec, mục đích của việc huấn luyện mô hình là gì?
Dự đoán từ tiếp theo trong một câu
Tìm ra mối quan hệ ngữ nghĩa giữa các từ
Phân loại văn bản dựa trên chủ đề
Chuyển đổi văn bản thành giọng nói
Chọn đáp án B
Khi triển khai một chatbot, bạn muốn lưu trữ thông tin về trạng thái của cuộc trò chuyện (ví dụ: các bước đã hoàn thành, thông tin đã thu thập). Bạn nên sử dụng kỹ thuật nào?
Stemming
Context management
Sentiment analysis
Named entity recognition
Chọn đáp án B
Khi đánh giá một mô hình sinh văn bản, chỉ số nào sau đây thường được sử dụng để đo lường tính đa dạng của văn bản được tạo ra?
BLEU score
Perplexity
Distinct-n
ROUGE score
Chọn đáp án C
Trong xử lý ngôn ngữ tự nhiên, ‘coreference resolution’ là gì?
Quá trình chuyển đổi văn bản thành giọng nói
Quá trình xác định tất cả các tham chiếu đến cùng một thực thể trong một văn bản
Quá trình phân tích cấu trúc ngữ pháp của một câu
Quá trình dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Chọn đáp án B
Khi xây dựng một mô hình phân loại văn bản, bạn sử dụng kỹ thuật cross-validation để làm gì?
Tăng tốc độ huấn luyện mô hình
Đánh giá hiệu suất của mô hình trên dữ liệu chưa thấy
Giảm kích thước của dữ liệu huấn luyện
Cải thiện khả năng diễn giải của mô hình
Chọn đáp án B
Trong kiến trúc Transformer, self-attention (tự chú ý) cho phép mô hình làm gì?
Tập trung vào các từ quan trọng nhất trong câu đầu vào
Dịch văn bản sang ngôn ngữ khác
Tạo ra các câu văn mới
Phân loại văn bản theo chủ đề
Chọn đáp án A
Trong ngữ cảnh của chatbot, ‘intent’ (ý định) đề cập đến điều gì?
Cảm xúc của người dùng
Mục đích của người dùng khi tương tác với chatbot
Ngôn ngữ lập trình được sử dụng để xây dựng chatbot
Số lượng người dùng đang sử dụng chatbot
Chọn đáp án B
Ứng dụng nào sau đây KHÔNG phải là một ứng dụng phổ biến của NLP?
Phân tích thị trường chứng khoán
Dịch máy
Phân tích cảm xúc
Chatbot
Chọn đáp án A
Trong các mô hình sequence-to-sequence, ‘teacher forcing’ là gì?
Một kỹ thuật để tăng cường dữ liệu huấn luyện
Một phương pháp để điều chỉnh trọng số của mô hình
Một chiến lược huấn luyện trong đó đầu ra thực tế từ bước trước được sử dụng làm đầu vào cho bước hiện tại
Một kỹ thuật để giảm overfitting
Chọn đáp án C
Trong lĩnh vực NLP, ‘perplexity’ là một thước đo đánh giá điều gì?
Độ phức tạp của thuật toán
Khả năng dự đoán của mô hình ngôn ngữ
Tốc độ xử lý của máy tính
Mức độ chính xác của phân tích cú pháp
Chọn đáp án B
Trong lĩnh vực NLP, ‘n-gram’ đề cập đến điều gì?
Một mô hình ngôn ngữ dựa trên mạng nơ-ron
Một chuỗi gồm n từ liên tiếp trong một văn bản
Một phương pháp để loại bỏ nhiễu trong dữ liệu văn bản
Một kỹ thuật để tóm tắt văn bản
Chọn đáp án B
Attention mechanism (cơ chế chú ý) được sử dụng rộng rãi trong các mô hình sequence-to-sequence. Mục đích chính của attention mechanism là gì?
Giảm kích thước của dữ liệu đầu vào
Cho phép mô hình tập trung vào các phần quan trọng nhất của dữ liệu đầu vào khi tạo ra đầu ra
Tăng tốc độ huấn luyện mô hình
Cải thiện khả năng song song hóa của mô hình
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, phương pháp nào thường được sử dụng để giảm số lượng từ trong văn bản bằng cách loại bỏ các từ không mang nhiều ý nghĩa?
Stemming
Tokenization
Stop word removal
Part-of-speech tagging
Chọn đáp án C








