1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 31
30 câu hỏi
TF-IDF (Term Frequency-Inverse Document Frequency) được sử dụng để làm gì trong NLP?
Dịch máy
Đo lường tầm quan trọng của một từ trong một văn bản so với một tập hợp các văn bản
Phân tích cảm xúc
Tạo sinh văn bản
Chọn đáp án B
Beam search (tìm kiếm chùm tia) là một thuật toán được sử dụng trong NLP để:
Tăng tốc độ huấn luyện mô hình
Tìm kiếm chuỗi đầu ra có xác suất cao nhất trong các tác vụ sinh tạo ngôn ngữ như dịch máy hoặc tóm tắt văn bản
Giảm kích thước từ vựng
Phân tích cú pháp câu
Chọn đáp án B
Conll-U format (định dạng Conll-U) thường được sử dụng để biểu diễn dữ liệu gì trong NLP?
Word embeddings
Dữ liệu chú giải cú pháp phụ thuộc (dependency parsing)
Dữ liệu văn bản thô
Dữ liệu âm thanh
Chọn đáp án B
Ví dụ nào sau đây thể hiện sự mơ hồ ngữ nghĩa (semantic ambiguity) trong ngôn ngữ tự nhiên?
'Con mèo đang ngủ trên ghế'
'Tôi thấy con dơi bay trong đêm'
'Thời tiết hôm nay đẹp'
'Máy tính rất hữu ích'
Chọn đáp án B
Ví dụ nào sau đây KHÔNG phải là một thách thức lớn trong NLP?
Xử lý ngôn ngữ mơ hồ (Ambiguity)
Hiểu ngữ cảnh (Context understanding)
Dịch từ tiếng Anh sang tiếng Anh
Xử lý ngôn ngữ có tính sáng tạo và ẩn dụ (Creativity and metaphor)
Chọn đáp án C
Coreference resolution (giải quyết đồng tham chiếu) trong NLP là gì?
Dịch các đại từ nhân xưng
Xác định tất cả các biểu thức ngôn ngữ (ví dụ: đại từ, cụm danh từ) tham chiếu đến cùng một thực thể trong văn bản
Sửa lỗi chính tả và ngữ pháp
Tóm tắt các đoạn văn dài
Chọn đáp án B
Transformer network (mạng Transformer) khắc phục vấn đề 'gradient vanishing' của RNN bằng cách nào?
Sử dụng cơ chế attention (cơ chế chú ý) để cho phép mô hình tập trung vào các phần quan trọng của chuỗi đầu vào
Tăng số lượng lớp ẩn trong mạng
Sử dụng hàm kích hoạt ReLU thay vì sigmoid
Áp dụng kỹ thuật dropout
Chọn đáp án A
N-gram language model (mô hình ngôn ngữ N-gram) dựa trên giả định nào?
Từ tiếp theo trong chuỗi chỉ phụ thuộc vào N-1 từ đứng trước nó
Tất cả các từ trong chuỗi đều độc lập với nhau
Ngôn ngữ là tuyến tính và không có cấu trúc
Mô hình ngôn ngữ cần phải được huấn luyện trên dữ liệu đa ngôn ngữ
Chọn đáp án A
Few-shot learning khác với zero-shot learning ở điểm nào?
Few-shot learning đòi hỏi nhiều dữ liệu huấn luyện hơn zero-shot learning
Few-shot learning cho phép mô hình học từ một số lượng nhỏ ví dụ huấn luyện cho nhiệm vụ mới, trong khi zero-shot learning không sử dụng bất kỳ ví dụ nào
Few-shot learning chỉ áp dụng cho mô hình Transformer, zero-shot learning thì không
Không có sự khác biệt, đây là hai thuật ngữ thay thế cho nhau
Chọn đáp án B
Sự khác biệt chính giữa stemming và lemmatization là gì?
Stemming chậm hơn lemmatization
Lemmatization tạo ra dạng gốc đúng ngữ pháp (lemma), trong khi stemming có thể tạo ra gốc từ không có nghĩa
Stemming sử dụng từ điển, lemmatization thì không
Lemmatization chỉ áp dụng cho tiếng Anh, stemming áp dụng cho mọi ngôn ngữ
Chọn đáp án B
Vấn đề 'gradient vanishing' (mất đạo hàm) thường gặp phải ở loại mạng nơ-ron nào?
Convolutional Neural Network (CNN)
Recurrent Neural Network (RNN) truyền thống
Feedforward Neural Network (FFNN)
Generative Adversarial Network (GAN)
Chọn đáp án B
Zero-shot learning trong NLP có nghĩa là:
Mô hình học mà không cần bất kỳ dữ liệu huấn luyện nào
Mô hình có khả năng thực hiện các nhiệm vụ mà nó chưa từng được huấn luyện trực tiếp, chỉ dựa trên mô tả bằng ngôn ngữ tự nhiên của nhiệm vụ
Mô hình được huấn luyện trên dữ liệu tổng hợp (synthetic data)
Mô hình có độ chính xác bằng 0 trên tập kiểm tra
Chọn đáp án B
Công đoạn nào sau đây KHÔNG thuộc quy trình xử lý ngôn ngữ tự nhiên điển hình?
Phân tích cú pháp (Parsing)
Phân tích ngữ nghĩa (Semantic Analysis)
Phân tích tài chính (Financial Analysis)
Sinh tạo ngôn ngữ (Language Generation)
Chọn đáp án C
Ứng dụng nào sau đây của NLP có tiềm năng lớn nhất trong lĩnh vực y tế?
Chơi game
Phân tích bệnh án điện tử để hỗ trợ chẩn đoán và điều trị
Tạo nhạc
Dịch sách văn học
Chọn đáp án B
Named Entity Recognition (NER - Nhận dạng thực thể có tên) là nhiệm vụ:
Dịch tên riêng từ ngôn ngữ này sang ngôn ngữ khác
Xác định và phân loại các thực thể có tên trong văn bản, ví dụ: tên người, tổ chức, địa điểm, ngày tháng, v.v.
Tạo ra tên mới cho sản phẩm hoặc công ty
Kiểm tra chính tả tên riêng
Chọn đáp án B
Tokenization trong NLP là quá trình:
Chuyển đổi văn bản thành giọng nói
Chia văn bản thành các đơn vị nhỏ hơn, chẳng hạn như từ hoặc cụm từ
Loại bỏ các từ dừng (stop words) khỏi văn bản
Gán nhãn từ loại (Part-of-Speech tagging) cho mỗi từ
Chọn đáp án B
Mục đích chính của stemming (cắt gốc từ) trong NLP là gì?
Tăng cường ngữ nghĩa của văn bản
Giảm số lượng từ khác nhau bằng cách đưa các từ về dạng gốc chung
Chuyển đổi văn bản thành chữ hoa
Phát hiện ngôn ngữ của văn bản
Chọn đáp án B
Recurrent Neural Network (RNN) đặc biệt phù hợp với các tác vụ NLP nào?
Phân loại ảnh
Xử lý dữ liệu chuỗi tuần tự như văn bản hoặc giọng nói
Phát hiện đối tượng trong ảnh
Tạo ảnh từ văn bản
Chọn đáp án B
Trong NLP, 'stop words' (từ dừng) thường được loại bỏ vì:
Chúng mang nhiều thông tin quan trọng
Chúng xuất hiện rất ít trong văn bản
Chúng xuất hiện thường xuyên nhưng ít mang ý nghĩa ngữ nghĩa trong nhiều tác vụ NLP
Chúng gây ra lỗi chính tả
Chọn đáp án C
Phương pháp nào sau đây thường được sử dụng để giảm chiều dữ liệu trong word embedding?
Mã hóa One-Hot
PCA (Principal Component Analysis)
Stemming (cắt gốc từ)
Lemmatization (nguyên dạng hóa từ)
Chọn đáp án B
Mô hình ngôn ngữ (Language Model) được sử dụng để làm gì?
Dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác
Ước tính xác suất xuất hiện của một chuỗi từ hoặc dự đoán từ tiếp theo trong câu
Phân loại văn bản theo chủ đề
Tóm tắt văn bản dài thành văn bản ngắn hơn
Chọn đáp án B
Fine-tuning (tinh chỉnh) trong NLP là quá trình:
Huấn luyện lại toàn bộ mô hình từ đầu với dữ liệu mới
Tiếp tục huấn luyện một mô hình đã được tiền huấn luyện (pre-trained model) trên một tập dữ liệu cụ thể cho một nhiệm vụ cụ thể
Thay đổi kiến trúc mạng nơ-ron
Giảm kích thước mô hình để triển khai trên thiết bị di động
Chọn đáp án B
Trong lĩnh vực đạo đức NLP, vấn đề bias (thiên kiến) trong dữ liệu huấn luyện có thể dẫn đến hậu quả gì?
Mô hình hoạt động nhanh hơn
Mô hình đưa ra các dự đoán không công bằng hoặc phân biệt đối xử đối với một số nhóm người nhất định
Mô hình dễ dàng khái quát hóa sang các ngôn ngữ khác
Mô hình trở nên dễ giải thích hơn
Chọn đáp án B
Word embedding (biểu diễn từ) nhằm mục đích:
Mã hóa văn bản thành hình ảnh
Biểu diễn từ dưới dạng vector số trong không gian nhiều chiều, thể hiện quan hệ ngữ nghĩa giữa các từ
Tăng tốc độ xử lý văn bản
Giảm dung lượng lưu trữ văn bản
Chọn đáp án B
ROUGE score (Điểm ROUGE) thường được sử dụng để đánh giá chất lượng của hệ thống nào?
Hệ thống dịch máy
Hệ thống phân tích cảm xúc
Hệ thống tóm tắt văn bản
Hệ thống trả lời câu hỏi
Chọn đáp án C
Attention mechanism (cơ chế chú ý) trong Transformer hoạt động như thế nào?
Tăng tốc độ tính toán của mạng
Cho phép mô hình học cách gán trọng số khác nhau cho các phần khác nhau của đầu vào khi tạo ra đầu ra
Giảm kích thước bộ nhớ cần thiết để huấn luyện mô hình
Cải thiện khả năng phân loại văn bản
Chọn đáp án B
Phương pháp đánh giá BLEU score (Điểm BLEU) thường được sử dụng để đánh giá chất lượng của hệ thống nào?
Hệ thống phân loại văn bản
Hệ thống dịch máy
Hệ thống nhận dạng giọng nói
Hệ thống tóm tắt văn bản
Chọn đáp án B
Mô hình BERT (Bidirectional Encoder Representations from Transformers) nổi tiếng với khả năng gì?
Tạo sinh văn bản tự động
Hiểu ngữ cảnh hai chiều của từ trong câu, xem xét cả từ trước và sau từ đó
Dịch ngôn ngữ theo thời gian thực
Phân tích cảm xúc với độ chính xác tuyệt đối
Chọn đáp án B
NLP, viết tắt của Xử lý ngôn ngữ tự nhiên, là một lĩnh vực thuộc ngành nào?
Toán học thuần túy
Vật lý lý thuyết
Khoa học máy tính và trí tuệ nhân tạo
Ngôn ngữ học ứng dụng
Chọn đáp án C
Nhiệm vụ nào sau đây KHÔNG phải là ứng dụng phổ biến của NLP?
Dịch máy (Machine Translation)
Phân tích cảm xúc (Sentiment Analysis)
Dự báo thời tiết (Weather Forecasting)
Trợ lý ảo (Virtual Assistants)
Chọn đáp án C








