1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 21
30 câu hỏi
Trong quá trình tiền xử lý văn bản cho NLP, kỹ thuật nào giúp giảm số lượng chiều dữ liệu bằng cách chuyển các từ về dạng cơ sở, từ đó gom nhóm các biến thể của từ (ví dụ: "chạy", "đã chạy", "đang chạy" về "chạy")?
Tách từ (Tokenization)
Loại bỏ từ dừng (Stop word removal)
Nguyên thể hóa (Lemmatization)
Chuẩn hóa văn bản (Text normalization)
Chọn đáp án C
Mô hình không gian vectơ từ (Word embedding) nào sau đây thể hiện mối quan hệ ngữ nghĩa giữa các từ bằng cách chiếu chúng vào một không gian vectơ đa chiều, nơi các từ có nghĩa tương tự nằm gần nhau hơn?
Word2Vec
Bag-of-Words
TF-IDF
One-hot encoding
Chọn đáp án B
Trong các bài toán phân loại văn bản, kỹ thuật nào sau đây giúp đánh giá mức độ quan trọng của một từ trong một văn bản so với toàn bộ tập văn bản, từ đó giúp xác định các từ khóa đặc trưng cho từng loại văn bản?
Đếm tần suất từ (Term Frequency - TF)
TF-IDF (Term Frequency-Inverse Document Frequency)
Bag-of-Words
N-gram
Chọn đáp án A
Xét bài toán phân tích cảm xúc văn bản. Khi một mô hình NLP dự đoán một bình luận là "tích cực" trong khi thực tế nó là "tiêu cực", điều này được gọi là lỗi gì trong đánh giá mô hình?
Độ chính xác (Accuracy)
ĐộRecall (Recall)
Điểm F1 (F1-score)
Lỗi dương tính giả (False Positive)
Chọn đáp án B
Trong kiến trúc Transformer, cơ chế "self-attention" đóng vai trò gì quan trọng trong việc xử lý ngôn ngữ?
Tăng tốc độ tính toán song song
Cho phép mô hình học được mối quan hệ giữa các từ trong cùng một câu
Giảm thiểu hiện tượng biến mất gradient
Thay thế hoàn toàn mạng nơ-ron tích chập (CNN)
Chọn đáp án B
Để xây dựng một hệ thống chatbot có khả năng duy trì ngữ cảnh hội thoại, loại mô hình mạng nơ-ron hồi quy (RNN) nào sau đây thường được sử dụng vì khả năng ghi nhớ thông tin từ các bước thời gian trước đó?
Mạng nơ-ron truyền thẳng (Feedforward Neural Network)
Mạng nơ-ron tích chập (Convolutional Neural Network - CNN)
Mạng nơ-ron hồi quy dài-ngắn hạn (Long Short-Term Memory - LSTM)
Mạng tự mã hóa (Autoencoder)
Chọn đáp án C
Trong dịch máy thống kê, mô hình ngôn ngữ (Language Model) được sử dụng với mục đích chính nào?
Phân tích cấu trúc cú pháp của câu nguồn
Đảm bảo tính trôi chảy và ngữ pháp của câu dịch ở ngôn ngữ đích
Đối chiếu từ vựng giữa ngôn ngữ nguồn và ngôn ngữ đích
Xử lý các từ không có trong từ điển
Chọn đáp án B
Khi đánh giá hiệu suất của một hệ thống nhận dạng thực thể có tên (Named Entity Recognition - NER), chỉ số nào sau đây đo lường tỷ lệ thực thể có tên được hệ thống xác định chính xác trong số tất cả các thực thể có tên thực sự tồn tại trong văn bản?
Độ chính xác (Precision)
Độ đo F1 (F1-score)
ĐộRecall (Recall)
Độ đo AUC (AUC-score)
Chọn đáp án C
Kỹ thuật "back-translation" (dịch ngược) được sử dụng trong NLP với mục đích chính nào, đặc biệt trong các bài toán dịch máy?
Đánh giá chất lượng bản dịch máy
Cải thiện tốc độ dịch máy
Giảm kích thước mô hình dịch máy
Tăng cường dữ liệu huấn luyện cho mô hình dịch máy
Chọn đáp án D
Trong xử lý ngôn ngữ tự nhiên, "parsing" (phân tích cú pháp) đề cập đến nhiệm vụ nào?
Phân tích cấu trúc ngữ pháp của một câu để xác định mối quan hệ giữa các từ
Chuyển đổi văn bản thành giọng nói
Phân loại văn bản theo chủ đề
Loại bỏ các từ không quan trọng trong văn bản
Chọn đáp án A
Để xử lý hiệu quả các từ "out-of-vocabulary" (OOV - từ ngoại từ điển) mà mô hình chưa từng gặp trong quá trình huấn luyện, kỹ thuật nào thường được sử dụng trong các mô hình ngôn ngữ hiện đại, ví dụ như mô hình dựa trên Transformer?
Thay thế từ OOV bằng từ đồng nghĩa
Sử dụng mã hóa theo cặp byte (Byte Pair Encoding - BPE) hoặc các phương pháp phân tách từ con
Bỏ qua hoàn toàn các từ OOV trong quá trình xử lý
Gán ngẫu nhiên vectơ cho các từ OOV
Chọn đáp án B
Trong các ứng dụng NLP, "chunking" (phân đoạn cú pháp nông) là quá trình nhận dạng và nhóm các thành phần nào trong câu?
Các mệnh đề độc lập và phụ thuộc
Các từ khóa quan trọng nhất trong câu
Các cụm từ có nghĩa (ví dụ: cụm danh từ, cụm động từ)
Các thực thể có tên (Named Entities)
Chọn đáp án C
Mô hình BERT (Bidirectional Encoder Representations from Transformers) nổi tiếng với khả năng hiểu ngữ cảnh hai chiều của từ trong câu. Điều này có nghĩa là gì?
BERT chỉ xử lý văn bản từ trái sang phải, giống như các mô hình RNN truyền thống.
BERT xem xét cả ngữ cảnh bên trái và bên phải của một từ khi tạo biểu diễn vectơ từ đó.
BERT chỉ phù hợp cho các bài toán phân loại văn bản, không dùng được cho nhận dạng thực thể.
BERT là một mô hình ngôn ngữ dựa trên CNN, không phải Transformer.
Chọn đáp án B
Trong bài toán tóm tắt văn bản tự động, phương pháp "extractive summarization" (tóm tắt trích rút) hoạt động bằng cách nào?
Chọn lọc và kết hợp các câu quan trọng nhất từ văn bản gốc để tạo bản tóm tắt
Diễn giải lại nội dung của văn bản gốc bằng ngôn ngữ khác
Sử dụng mô hình sinh văn bản để tạo ra bản tóm tắt mới hoàn toàn
Loại bỏ các thông tin không quan trọng và giữ lại các từ khóa chính
Chọn đáp án A
Để đánh giá độ tương đồng ngữ nghĩa giữa hai câu văn, phương pháp nào sau đây thường được sử dụng trong NLP?
So sánh số lượng từ chung giữa hai câu
Kiểm tra xem hai câu có cùng chủ đề hay không
Đếm số lượng thực thể có tên giống nhau
Sử dụng biểu diễn vectơ câu (sentence embeddings) và tính độ tương đồng cosine giữa chúng
Chọn đáp án D
Trong xử lý ngôn ngữ tự nhiên cho tiếng Việt, công cụ nào sau đây cung cấp chức năng tách từ (word segmentation) hiệu quả, đặc biệt khi tiếng Việt là ngôn ngữ không có dấu cách giữa các từ?
NLTK (Natural Language Toolkit)
SpaCy
underthesea
Stanford CoreNLP
Chọn đáp án C
Ứng dụng nào sau đây của NLP tập trung vào việc chuyển đổi ngôn ngữ viết thành ngôn ngữ nói?
Nhận dạng giọng nói (Speech Recognition)
Tổng hợp tiếng nói (Text-to-Speech - TTS)
Dịch máy (Machine Translation)
Phân tích văn bản (Text Analytics)
Chọn đáp án B
Giả sử bạn có một tập dữ liệu lớn các đánh giá sản phẩm trực tuyến. Nhiệm vụ NLP nào sẽ giúp bạn tự động phân loại các đánh giá này thành "tích cực", "tiêu cực", hoặc "trung lập"?
Nhận dạng thực thể có tên (Named Entity Recognition)
Tóm tắt văn bản (Text Summarization)
Phân tích cú pháp (Syntactic Parsing)
Phân tích cảm xúc (Sentiment Analysis)
Chọn đáp án D
Để xây dựng một hệ thống hỏi đáp tự động (Question Answering system), thành phần nào của NLP giúp trích xuất thông tin quan trọng từ văn bản để trả lời câu hỏi?
Sinh văn bản (Text Generation)
Dịch máy (Machine Translation)
Trích xuất thông tin (Information Extraction)
Phân loại văn bản (Text Classification)
Chọn đáp án C
Trong ngữ cảnh của mô hình ngôn ngữ, "perplexity" là một độ đo đánh giá điều gì?
Khả năng dự đoán chuỗi từ tiếp theo của mô hình ngôn ngữ
Tốc độ huấn luyện của mô hình ngôn ngữ
Kích thước bộ nhớ cần thiết để lưu trữ mô hình ngôn ngữ
Độ phức tạp của kiến trúc mô hình ngôn ngữ
Chọn đáp án A
Kỹ thuật "word sense disambiguation" (WSD - phân biệt nghĩa của từ) trong NLP nhằm giải quyết vấn đề gì?
Phân tích cấu trúc cú pháp của câu chứa từ đó
Xác định nghĩa chính xác của một từ trong ngữ cảnh cụ thể khi từ đó có nhiều nghĩa
Tìm ra các từ đồng nghĩa và trái nghĩa của từ
Chuyển đổi từ về dạng nguyên thể của nó
Chọn đáp án B
Trong lĩnh vực chatbot và trợ lý ảo, "intent recognition" (nhận dạng ý định) là bước quan trọng để làm gì?
Tạo ra phản hồi tự nhiên và trôi chảy
Lưu trữ lịch sử hội thoại của người dùng
Xác định mục đích hoặc mong muốn của người dùng thông qua câu nói của họ
Chuyển đổi giọng nói của người dùng thành văn bản
Chọn đáp án C
Để giảm thiểu kích thước từ vựng trong mô hình NLP và xử lý các ngôn ngữ có hình thái phong phú (morphologically rich languages), kỹ thuật nào sau đây thường được sử dụng?
Loại bỏ từ dừng (Stop word removal)
Nguyên thể hóa (Lemmatization)
Stemming
Phân tách từ thành đơn vị con (Subword tokenization)
Chọn đáp án D
Trong các mô hình sequence-to-sequence như Transformer, cơ chế "encoder-decoder attention" (chú ý bộ mã hóa-giải mã) giúp ích gì trong quá trình dịch máy?
Tăng tốc độ huấn luyện mô hình
Cho phép bộ giải mã (decoder) tập trung vào các phần liên quan của câu nguồn khi tạo từ dịch
Giảm độ phức tạp tính toán của mô hình
Cải thiện khả năng xử lý ngữ cảnh hai chiều của mô hình
Chọn đáp án B
Để đảm bảo tính công bằng và tránh thiên kiến (bias) trong các hệ thống NLP, ví dụ như trong phân tích cảm xúc hoặc tuyển dụng tự động, cần thực hiện những biện pháp nào?
Chỉ sử dụng dữ liệu từ một nguồn duy nhất để đảm bảo tính nhất quán
Tăng cường sử dụng các thuật toán phức tạp hơn để tự động loại bỏ thiên kiến
Đa dạng hóa dữ liệu huấn luyện và kiểm tra, đồng thời giám sát và đánh giá thiên kiến trong mô hình
Giấu thông tin nhạy cảm (ví dụ: giới tính, chủng tộc) trong dữ liệu huấn luyện
Chọn đáp án C
Trong lĩnh vực xử lý ngôn ngữ tự nhiên, "knowledge graph" (biểu đồ tri thức) được sử dụng để biểu diễn điều gì?
Các thực thể và mối quan hệ giữa chúng trong thế giới thực
Cấu trúc ngữ pháp của ngôn ngữ
Biểu diễn vectơ của từ và câu
Quy trình xử lý văn bản từ đầu đến cuối
Chọn đáp án A
Trong các hệ thống đối thoại, "dialogue state tracking" (theo dõi trạng thái hội thoại) là quá trình quản lý thông tin gì?
Lịch sử các câu hỏi và câu trả lời trong hội thoại
Thông tin về ngữ cảnh hiện tại và mục tiêu của người dùng trong hội thoại
Các thực thể có tên được đề cập trong hội thoại
Cảm xúc của người dùng trong suốt hội thoại
Chọn đáp án B
Để xây dựng một hệ thống gợi ý sản phẩm dựa trên đánh giá văn bản của người dùng, kỹ thuật NLP nào sau đây có thể được sử dụng để xác định các khía cạnh (aspects) khác nhau của sản phẩm mà người dùng quan tâm (ví dụ: "pin", "màn hình", "camera" của điện thoại)?
Phân loại văn bản (Text Classification)
Tóm tắt văn bản (Text Summarization)
Phân tích cảm xúc tổng thể (Overall Sentiment Analysis)
Phân tích cảm xúc dựa trên khía cạnh (Aspect-Based Sentiment Analysis)
Chọn đáp án D
Trong NLP, kỹ thuật "zero-shot learning" (học không mẫu) cho phép mô hình làm gì?
Học từ dữ liệu không có nhãn
Huấn luyện mô hình trên dữ liệu tổng hợp
Tổng quát hóa và thực hiện nhiệm vụ trên các lớp hoặc nhãn chưa từng thấy trong quá trình huấn luyện
Tăng tốc độ học của mô hình bằng cách bỏ qua một số mẫu dữ liệu
Chọn đáp án C
Trong lĩnh vực đạo đức và trách nhiệm giải trình của AI, vấn đề "explainability" (khả năng giải thích) trong NLP có ý nghĩa gì?
Khả năng mô hình tự động sửa lỗi sai trong quá trình xử lý ngôn ngữ
Khả năng hiểu và giải thích được lý do tại sao mô hình đưa ra một dự đoán hoặc quyết định cụ thể
Khả năng mô hình học hỏi từ ít dữ liệu huấn luyện hơn
Khả năng mô hình hoạt động hiệu quả trên nhiều ngôn ngữ khác nhau
Chọn đáp án B








