1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 1
30 câu hỏi
Trong lĩnh vực xử lý ngôn ngữ tự nhiên, ‘knowledge graph’ (đồ thị tri thức) được sử dụng để làm gì?
Biểu diễn mối quan hệ giữa các thực thể và khái niệm
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Tóm tắt nội dung của văn bản
Phân loại văn bản theo chủ đề
Chọn đáp án A
Khi xử lý văn bản tiếng Việt, vấn đề nào sau đây là đặc thù so với tiếng Anh?
Xử lý các từ viết tắt
Xử lý các từ đồng nghĩa
Tách từ (word segmentation)
Nhận dạng thực thể có tên
Chọn đáp án C
Trong xử lý ngôn ngữ tự nhiên, ‘TF-IDF’ là viết tắt của cụm từ nào?
Term Frequency – Inverse Document Frequency
Text Frequency – Inverse Document Format
Term Frequency – Integrated Data Frequency
Text Format – Inverse Document Frequency
Chọn đáp án A
Trong các phương pháp đánh giá mô hình sinh ngôn ngữ (ví dụ: mô hình dịch máy), độ đo BLEU (Bilingual Evaluation Understudy) được sử dụng để đánh giá yếu tố nào?
Độ chính xác của việc dự đoán từ tiếp theo
Mức độ tương đồng giữa văn bản được sinh ra và văn bản tham khảo
Khả năng khái quát hóa của mô hình trên dữ liệu mới
Thời gian cần thiết để mô hình sinh ra một câu
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, phương pháp nào thường được sử dụng để giảm số chiều của dữ liệu văn bản, giúp giảm độ phức tạp tính toán và cải thiện hiệu suất mô hình?
Mô hình hóa chủ đề (Topic Modeling)
Phân tích cú pháp (Parsing)
Biểu diễn word embedding (Word embedding)
Phân tích quan điểm (Sentiment Analysis)
Chọn đáp án C
Ứng dụng nào sau đây thể hiện việc sử dụng thành công của xử lý ngôn ngữ tự nhiên trong lĩnh vực y tế?
Phân tích cảm xúc của khách hàng về một sản phẩm
Tự động tóm tắt hồ sơ bệnh án
Dịch tự động các bài báo khoa học
Tạo chatbot để trả lời các câu hỏi thường gặp
Chọn đáp án B
Trong ngữ cảnh của chatbot, kỹ thuật ‘intent recognition’ (nhận dạng ý định) có vai trò gì?
Tạo ra các câu trả lời tự động
Xác định mục đích hoặc mong muốn của người dùng dựa trên câu hỏi của họ
Chuyển đổi văn bản thành giọng nói
Lưu trữ lịch sử trò chuyện
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật ‘word sense disambiguation’ (WSD) nhằm mục đích gì?
Tìm ra gốc của một từ (word stem)
Xác định ý nghĩa chính xác của một từ trong ngữ cảnh cụ thể
Phân loại các từ theo loại từ (part-of-speech)
Dịch một từ sang ngôn ngữ khác
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật ‘topic modeling’ (mô hình hóa chủ đề) nhằm mục đích gì?
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Tóm tắt nội dung chính của một văn bản
Phân loại văn bản theo chủ đề
Tìm ra các chủ đề tiềm ẩn trong một tập hợp các văn bản
Chọn đáp án D
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật ‘chunking’ (phân đoạn) thường được sử dụng để làm gì?
Chia văn bản thành các câu
Chia câu thành các cụm từ có nghĩa
Tìm gốc của từ
Loại bỏ các từ dừng
Chọn đáp án B
Phương pháp nào sau đây được sử dụng để đánh giá sự tương đồng giữa hai văn bản?
Part-of-speech tagging
Named entity recognition
Cosine similarity
Stemming
Chọn đáp án C
Cho đoạn văn bản: ‘Hôm nay, trời Hà Nội nhiều mây và có mưa rào.’ Thao tác nào sau đây thuộc về phân tích cú pháp (syntactic parsing)?
Xác định các thực thể có tên (named entities) như ‘Hà Nội’
Phân tích ý nghĩa của câu văn
Xây dựng cây cú pháp (parse tree) thể hiện cấu trúc ngữ pháp của câu
Đếm tần suất xuất hiện của các từ trong câu
Chọn đáp án C
Khi xây dựng một hệ thống phân tích cảm xúc (sentiment analysis), điều gì quan trọng nhất cần xem xét để đảm bảo tính chính xác của hệ thống?
Sử dụng một bộ từ điển cảm xúc lớn
Huấn luyện mô hình trên một tập dữ liệu lớn và đa dạng
Sử dụng các thuật toán stemming và lemmatization
Loại bỏ tất cả các stop words
Chọn đáp án B
Trong lĩnh vực xử lý ngôn ngữ tự nhiên, thuật ngữ ‘n-gram’ đề cập đến điều gì?
Một phương pháp biểu diễn từ dưới dạng vector
Một chuỗi gồm n từ liên tiếp trong một văn bản
Một kỹ thuật để sửa lỗi chính tả
Một mô hình ngôn ngữ dựa trên mạng nơ-ron
Chọn đáp án B
Trong mô hình hóa ngôn ngữ, ‘perplexity’ là gì?
Một kỹ thuật để giảm kích thước từ vựng
Một độ đo đánh giá khả năng dự đoán của mô hình ngôn ngữ
Một phương pháp để trích xuất các đặc trưng từ văn bản
Một thuật toán để sửa lỗi chính tả
Chọn đáp án B
Phương pháp nào sau đây có thể giúp cải thiện hiệu suất của mô hình ngôn ngữ khi dữ liệu huấn luyện bị thiếu?
Sử dụng mô hình lớn hơn
Áp dụng kỹ thuật transfer learning
Loại bỏ các stop words
Sử dụng stemming
Chọn đáp án B
Phương pháp nào sau đây KHÔNG thuộc về các kỹ thuật giảm chiều dữ liệu (dimensionality reduction) trong xử lý ngôn ngữ tự nhiên?
Principal Component Analysis (PCA)
Singular Value Decomposition (SVD)
Linear Discriminant Analysis (LDA)
Part-of-speech tagging (POS tagging)
Chọn đáp án D
Ứng dụng nào sau đây KHÔNG phải là một ứng dụng của xử lý ngôn ngữ tự nhiên trong lĩnh vực marketing?
Phân tích phản hồi của khách hàng trên mạng xã hội
Tự động tạo nội dung quảng cáo
Dự đoán giá cổ phiếu
Cá nhân hóa trải nghiệm người dùng
Chọn đáp án C
Phương pháp nào sau đây thường được sử dụng để xử lý vấn đề ‘Out-of-Vocabulary’ (OOV) trong các mô hình ngôn ngữ dựa trên từ (word-based)?
Stemming
Lemmatization
Byte Pair Encoding (BPE)
TF-IDF
Chọn đáp án C
Kỹ thuật nào sau đây thường được sử dụng để giảm thiểu ảnh hưởng của các từ phổ biến (ví dụ: ‘the’, ‘a’, ‘is’) trong quá trình phân tích văn bản?
Stemming
Lemmatization
Loại bỏ stop words
Part-of-speech tagging
Chọn đáp án C
Trong xử lý ngôn ngữ tự nhiên, ‘coreference resolution’ (giải quyết đồng tham chiếu) là gì?
Quá trình xác định các từ có nghĩa giống nhau
Quá trình xác định các thực thể có tên trong văn bản
Quá trình xác định các từ hoặc cụm từ đề cập đến cùng một đối tượng trong văn bản
Quá trình phân tích cấu trúc ngữ pháp của một câu
Chọn đáp án C
Ứng dụng nào sau đây KHÔNG phải là một ứng dụng phổ biến của kỹ thuật Named Entity Recognition (NER) trong xử lý ngôn ngữ tự nhiên?
Trích xuất thông tin từ văn bản
Phân tích quan điểm về sản phẩm
Phân loại văn bản theo chủ đề
Xây dựng tri thức đồ (Knowledge Graph)
Chọn đáp án B
Kỹ thuật nào sau đây thường được sử dụng để tạo ra các biến thể khác nhau của một câu, nhằm tăng cường dữ liệu huấn luyện cho các mô hình NLP?
Back-translation
Stemming
Lemmatization
Stop word removal
Chọn đáp án A
Trong các bước tiền xử lý văn bản, kỹ thuật ‘stemming’ (tách gốc từ) có tác dụng gì?
Loại bỏ các từ dừng (stop words) như ‘và’, ‘hoặc’
Chuyển đổi các từ về dạng gốc của chúng
Phân loại các từ theo loại từ (part-of-speech)
Sửa lỗi chính tả trong văn bản
Chọn đáp án B
Khi đánh giá hiệu suất của một mô hình phân loại văn bản, độ đo ‘F1-score’ là gì?
Tỷ lệ các trường hợp được dự đoán đúng
Trung bình điều hòa của precision (độ chính xác) và recall (độ phủ)
Tỷ lệ các trường hợp được dự đoán sai
Diện tích dưới đường cong ROC
Chọn đáp án B
Trong các mô hình transformer, cơ chế ‘self-attention’ (tự chú ý) cho phép mô hình làm gì?
Tập trung vào các từ quan trọng nhất trong câu
Dịch văn bản sang ngôn ngữ khác
Tóm tắt nội dung của văn bản
Phân loại văn bản theo chủ đề
Chọn đáp án A
Mục tiêu chính của kỹ thuật ‘machine translation’ (dịch máy) là gì?
Phân tích cấu trúc ngữ pháp của một câu
Chuyển đổi văn bản từ một ngôn ngữ sang một ngôn ngữ khác một cách tự động
Tóm tắt nội dung của một văn bản dài
Nhận dạng các thực thể có tên trong văn bản
Chọn đáp án B
Trong các mô hình học sâu cho NLP, recurrent neural network (RNN) đặc biệt phù hợp với loại dữ liệu nào?
Dữ liệu ảnh
Dữ liệu âm thanh
Dữ liệu chuỗi (ví dụ: văn bản, chuỗi thời gian)
Dữ liệu bảng
Chọn đáp án C
Trong lĩnh vực xử lý ngôn ngữ tự nhiên, ‘attention mechanism’ (cơ chế chú ý) giải quyết vấn đề chính nào trong các mô hình sequence-to-sequence?
Vanishing gradient (mất mát đạo hàm)
Thời gian huấn luyện quá lâu
Khả năng xử lý các chuỗi dài (long-range dependencies)
Sự thiếu hụt dữ liệu huấn luyện
Chọn đáp án C
Ưu điểm chính của việc sử dụng ‘word embeddings’ (ví dụ: Word2Vec, GloVe) so với các phương pháp biểu diễn từ truyền thống như ‘one-hot encoding’ là gì?
Word embeddings dễ tính toán hơn
Word embeddings biểu diễn ngữ nghĩa của từ tốt hơn
Word embeddings không yêu cầu dữ liệu huấn luyện lớn
Word embeddings phù hợp hơn với các ngôn ngữ có cấu trúc phức tạp
Chọn đáp án B








