1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 4
30 câu hỏi
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật nào được sử dụng để giảm số lượng từ trong văn bản bằng cách loại bỏ các từ phổ biến không mang nhiều ý nghĩa?
Stemming
Part-of-speech tagging
Stop word removal
Named entity recognition
Chọn đáp án C
Trong lĩnh vực NLP, thuật ngữ ‘n-gram’ đề cập đến điều gì?
Một mô hình ngôn ngữ dựa trên mạng nơ-ron
Một chuỗi gồm n từ liên tiếp trong một văn bản
Một phương pháp loại bỏ các từ dừng
Một kỹ thuật stemming
Chọn đáp án B
Cho câu: ‘Tôi đang học xử lý ngôn ngữ tự nhiên’. Nếu sử dụng stemming (ví dụ: Porter stemmer), từ nào có thể được chuyển đổi thành ‘hoc’?
‘học’
‘đang’
‘xử lý’
‘ngôn ngữ’
Chọn đáp án A
Trong NLP, kỹ thuật nào được sử dụng để chia một đoạn văn bản thành các đơn vị nhỏ hơn, chẳng hạn như từ hoặc câu?
Stemming
Tokenization
Lemmatization
Stop word removal
Chọn đáp án B
Mô hình nào sau đây thường được sử dụng để tạo ra văn bản mới, chẳng hạn như trong việc tạo thơ hoặc viết truyện ngắn?
Naive Bayes
Support Vector Machine (SVM)
Generative Adversarial Network (GAN)
K-means Clustering
Chọn đáp án C
TF-IDF là viết tắt của thuật ngữ nào?
Term Frequency – Inverse Document Frequency
Text Frequency – Inverse Data Frequency
Term Frequency – Integrated Document Frequency
Text Frequency – Integrated Data Frequency
Chọn đáp án A
Mục đích chính của stemming trong NLP là gì?
Tìm các thực thể có tên trong văn bản
Gán nhãn từ loại cho mỗi từ trong câu
Giảm các từ về dạng gốc của chúng
Loại bỏ các từ dừng
Chọn đáp án C
Cho một đoạn văn bản: ‘Hôm nay, trời rất đẹp. Tôi muốn đi dạo trong công viên.’ Sau khi thực hiện tokenization, kết quả sẽ là gì?
[‘Hôm nay trời rất đẹp Tôi muốn đi dạo trong công viên’]
[‘Hôm’, ‘nay’, ‘,’, ‘trời’, ‘rất’, ‘đẹp’, ‘.’, ‘Tôi’, ‘muốn’, ‘đi’, ‘dạo’, ‘trong’, ‘công’, ‘viên’, ‘.’]
[‘Hôm nay’, ‘trời’, ‘rất’, ‘đẹp’, ‘Tôi’, ‘muốn’, ‘đi’, ‘dạo’, ‘trong’, ‘công viên’]
[‘Hôm nay, trời rất đẹp.’, ‘Tôi muốn đi dạo trong công viên.’]
Chọn đáp án B
Kỹ thuật nào sau đây được sử dụng để giảm chiều dữ liệu trong word embeddings?
Tokenization
Stop word removal
Principal Component Analysis (PCA)
Stemming
Chọn đáp án C
Trong các mô hình transformer, cơ chế self-attention được sử dụng để làm gì?
Để tăng tốc độ huấn luyện mô hình
Để cho phép mô hình tập trung vào các phần khác nhau của đầu vào khi xử lý nó
Để giảm kích thước của mô hình
Để loại bỏ các từ dừng
Chọn đáp án B
Trong lĩnh vực NLP, BLEU score được sử dụng để đánh giá điều gì?
Độ chính xác của mô hình phân tích cảm xúc
Độ chính xác của mô hình dịch máy
Độ chính xác của mô hình nhận dạng thực thể có tên
Độ chính xác của mô hình tóm tắt văn bản
Chọn đáp án B
Sự khác biệt chính giữa stemming và lemmatization là gì?
Stemming tạo ra các từ gốc hợp lệ, trong khi lemmatization có thể tạo ra các từ không hợp lệ
Stemming nhanh hơn nhưng có thể không chính xác bằng lemmatization
Lemmatization nhanh hơn nhưng có thể không chính xác bằng stemming
Stemming sử dụng từ điển, trong khi lemmatization không sử dụng
Chọn đáp án B
Trong lĩnh vực NLP, POS tagging là viết tắt của?
Part-of-Speech tagging
Point-of-Sale tagging
Process-of-Speech tagging
Pattern-of-Speech tagging
Chọn đáp án A
Trong ngữ cảnh của mô hình ngôn ngữ, perplexity được sử dụng để làm gì?
Đo lường độ phức tạp của thuật toán
Đo lường khả năng dự đoán của mô hình
Đo lường tốc độ hội tụ của mô hình
Đo lường kích thước của từ vựng
Chọn đáp án B
Trong xử lý ngôn ngữ tự nhiên, kỹ thuật nào được sử dụng để sửa lỗi chính tả trong văn bản?
Stemming
Spell checking
Lemmatization
Parsing
Chọn đáp án B
Trong lĩnh vực NLP, ‘Knowledge Graph’ được sử dụng để làm gì?
Để lưu trữ và quản lý thông tin về các thực thể và mối quan hệ giữa chúng
Để dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Để tóm tắt văn bản
Để phân loại văn bản dựa trên chủ đề
Chọn đáp án A
Mục tiêu của coreference resolution là gì?
Xác định tất cả các tham chiếu đến cùng một thực thể trong văn bản
Dịch văn bản sang ngôn ngữ khác
Tóm tắt văn bản
Phân loại văn bản dựa trên chủ đề
Chọn đáp án A
Trong lĩnh vực NLP, ‘zero-shot learning’ đề cập đến khả năng của mô hình để làm gì?
Học từ dữ liệu không có nhãn
Học một nhiệm vụ mà không cần bất kỳ dữ liệu huấn luyện nào cho nhiệm vụ đó
Học một nhiệm vụ với rất ít dữ liệu huấn luyện
Học một nhiệm vụ nhanh hơn so với các mô hình khác
Chọn đáp án B
Mục tiêu của Named Entity Recognition (NER) là gì?
Phân loại văn bản dựa trên chủ đề
Xác định và phân loại các thực thể có tên trong văn bản (ví dụ: tên người, tổ chức, địa điểm)
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Tóm tắt văn bản
Chọn đáp án B
Mục tiêu chính của sentiment analysis (phân tích cảm xúc) là gì?
Xác định chủ đề chính của văn bản
Xác định cảm xúc hoặc thái độ được thể hiện trong văn bản
Dịch văn bản sang ngôn ngữ khác
Tóm tắt văn bản
Chọn đáp án B
Mô hình nào sau đây thường được sử dụng cho bài toán dịch máy (machine translation)?
Naive Bayes
Support Vector Machine (SVM)
Recurrent Neural Network (RNN) với kiến trúc Sequence-to-Sequence
K-means Clustering
Chọn đáp án C
Trong các mô hình ngôn ngữ, smoothing được sử dụng để giải quyết vấn đề gì?
Overfitting
Underfitting
Zero probability cho các n-gram chưa xuất hiện trong dữ liệu huấn luyện
Vanishing gradients
Chọn đáp án C
Trong lĩnh vực NLP, thuật ngữ ‘parsing’ đề cập đến điều gì?
Quá trình loại bỏ các từ dừng
Quá trình phân tích cấu trúc cú pháp của một câu
Quá trình chuyển đổi văn bản thành dạng số
Quá trình giảm các từ về dạng gốc của chúng
Chọn đáp án B
Thuật ngữ nào mô tả quá trình chuyển đổi văn bản thành dạng số để máy tính có thể xử lý?
Tokenization
Normalization
Vectorization
Stemming
Chọn đáp án C
Khi xây dựng chatbot, kỹ thuật nào thường được sử dụng để hiểu ý định của người dùng?
Named Entity Recognition (NER)
Sentiment Analysis
Intent Recognition
Machine Translation
Chọn đáp án C
Phương pháp nào sau đây giúp giải quyết vấn đề ‘vanishing gradient’ trong mạng nơ-ron sâu (deep neural networks)?
Sử dụng hàm kích hoạt sigmoid
Sử dụng hàm kích hoạt ReLU
Sử dụng L1 regularization
Sử dụng PCA (Principal Component Analysis)
Chọn đáp án B
Trong lĩnh vực NLP, attention mechanism (cơ chế chú ý) được sử dụng để làm gì?
Để tăng tốc độ huấn luyện mô hình
Để cho phép mô hình tập trung vào các phần quan trọng nhất của đầu vào khi đưa ra dự đoán
Để giảm kích thước của mô hình
Để loại bỏ các từ dừng
Chọn đáp án B
Trong NLP, word embedding (ví dụ: Word2Vec, GloVe) được sử dụng để làm gì?
Để mã hóa các từ thành vectơ số, thể hiện ý nghĩa ngữ nghĩa của chúng
Để phân tích cú pháp của câu
Để loại bỏ các từ dừng
Để thực hiện stemming
Chọn đáp án A
Phương pháp nào sau đây thường được sử dụng để đánh giá sự tương đồng giữa hai văn bản?
Cosine similarity
Euclidean distance
Manhattan distance
All of the above
Chọn đáp án D
Bag of Words (BoW) là gì?
Một phương pháp biểu diễn văn bản dưới dạng tập hợp các từ, bỏ qua thứ tự của chúng
Một phương pháp biểu diễn văn bản dưới dạng một chuỗi liên tục các từ
Một phương pháp biểu diễn văn bản bằng cách sử dụng word embeddings
Một phương pháp biểu diễn văn bản bằng cách sử dụng TF-IDF
Chọn đáp án A








