1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 2
Đề thi

1000+ câu Trắc nghiệm Nhập môn xử lý ngôn ngữ tự nhiên có đáp án - Phần 2

A
Admin
Đại họcTrắc nghiệm tổng hợp20 lượt thi
30 câu hỏi
1. Trắc nghiệm
• 1 điểm

Trong một hệ thống hỏi đáp (Question Answering), thành phần nào chịu trách nhiệm trích xuất thông tin từ văn bản để trả lời câu hỏi?

Question encoder

Answer decoder

Context retriever

Information extractor

Xem đáp án

Chọn đáp án D

2. Trắc nghiệm
• 1 điểm

Khi xây dựng một hệ thống phân tích cảm xúc, bạn nhận thấy mô hình của mình hoạt động tốt trên dữ liệu huấn luyện nhưng kém hiệu quả trên dữ liệu thực tế. Vấn đề này được gọi là gì?

Underfitting

Overfitting

Regularization

Normalization

Xem đáp án

Chọn đáp án B

3. Trắc nghiệm
• 1 điểm

Conditional Random Fields (CRF) thường được sử dụng cho tác vụ nào trong NLP?

Phân tích cảm xúc

Nhận dạng thực thể có tên (Named Entity Recognition)

Tóm tắt văn bản

Dịch máy

Xem đáp án

Chọn đáp án B

4. Trắc nghiệm
• 1 điểm

Khi xử lý văn bản thô, bước nào sau đây KHÔNG thuộc giai đoạn tiền xử lý?

Loại bỏ HTML tags

Chuyển đổi văn bản thành chữ thường

Huấn luyện mô hình

Loại bỏ dấu câu

Xem đáp án

Chọn đáp án C

5. Trắc nghiệm
• 1 điểm

Trong xử lý ngôn ngữ tự nhiên, kỹ thuật nào sau đây thường được sử dụng để xác định loại từ (ví dụ: danh từ, động từ, tính từ) của mỗi từ trong một câu?

Tokenization

Stemming

Part-of-speech tagging

Stop word removal

Xem đáp án

Chọn đáp án C

6. Trắc nghiệm
• 1 điểm

Bag of Words (BoW) là một mô hình đơn giản trong NLP. Hạn chế lớn nhất của BoW là gì?

Không thể xử lý văn bản dài

Không giữ được thứ tự của từ trong câu

Yêu cầu lượng lớn bộ nhớ

Chỉ hoạt động với tiếng Anh

Xem đáp án

Chọn đáp án B

7. Trắc nghiệm
• 1 điểm

Mục tiêu của việc sử dụng word embeddings (ví dụ: Word2Vec, GloVe) trong NLP là gì?

Chuyển đổi từ thành dạng số để máy tính có thể xử lý

Giảm số lượng từ trong văn bản

Phân loại các từ theo loại từ (danh từ, động từ, tính từ)

Tìm gốc của từ để chuẩn hóa văn bản

Xem đáp án

Chọn đáp án A

8. Trắc nghiệm
• 1 điểm

Mục tiêu chính của stemming trong NLP là gì?

Tìm gốc của từ để chuẩn hóa văn bản

Phân loại các từ theo loại từ (danh từ, động từ, tính từ)

Loại bỏ các từ dừng (stop words) khỏi văn bản

Chia văn bản thành các token nhỏ hơn

Xem đáp án

Chọn đáp án A

9. Trắc nghiệm
• 1 điểm

Khi một mô hình NLP không thể khái quát hóa tốt trên dữ liệu mới và cho thấy hiệu suất kém, điều này thường được gọi là gì?

Overfitting

Underfitting

Regularization

Normalization

Xem đáp án

Chọn đáp án B

10. Trắc nghiệm
• 1 điểm

Phương pháp nào sau đây được sử dụng để đánh giá hiệu quả của một mô hình dịch máy?

BLEU (Bilingual Evaluation Understudy)

ROUGE (Recall-Oriented Understudy for Gisting Evaluation)

TF-IDF

Word2Vec

Xem đáp án

Chọn đáp án A

11. Trắc nghiệm
• 1 điểm

TF-IDF là một kỹ thuật quan trọng trong NLP, TF (Term Frequency) trong TF-IDF thể hiện điều gì?

Tần suất xuất hiện của một từ trong toàn bộ văn bản

Tần suất xuất hiện của một từ trong một tài liệu

Tổng số từ trong một tài liệu

Số lượng tài liệu chứa một từ

Xem đáp án

Chọn đáp án B

12. Trắc nghiệm
• 1 điểm

Khi xử lý văn bản tiếng Việt, điều gì cần đặc biệt lưu ý so với tiếng Anh?

Tiếng Việt không có dấu

Tiếng Việt là ngôn ngữ đơn âm tiết

Tiếng Việt có cấu trúc ngữ pháp đơn giản hơn

Tiếng Việt có nhiều từ mượn từ tiếng Pháp

Xem đáp án

Chọn đáp án B

13. Trắc nghiệm
• 1 điểm

Trong xử lý ngôn ngữ tự nhiên, kỹ thuật nào sau đây thường được sử dụng để chuyển đổi văn bản thành dạng số để máy tính có thể xử lý?

Tokenization

Normalization

Vectorization

Stemming

Xem đáp án

Chọn đáp án C

14. Trắc nghiệm
• 1 điểm

Trong ngữ cảnh của topic modeling (mô hình hóa chủ đề), LDA (Latent Dirichlet Allocation) là gì?

Một thuật toán phân cụm dữ liệu

Một mô hình sinh xác suất để khám phá các chủ đề tiềm ẩn trong một tập hợp các tài liệu

Một phương pháp để giảm chiều dữ liệu

Một kỹ thuật để tăng cường dữ liệu

Xem đáp án

Chọn đáp án B

15. Trắc nghiệm
• 1 điểm

Mô hình ngôn ngữ BERT (Bidirectional Encoder Representations from Transformers) nổi tiếng với khả năng gì?

Chỉ hiểu ngôn ngữ theo một hướng (từ trái sang phải)

Hiểu ngôn ngữ theo cả hai hướng (trái sang phải và phải sang trái)

Dịch văn bản từ tiếng Anh sang tiếng Việt

Tạo sinh văn bản mới hoàn toàn

Xem đáp án

Chọn đáp án B

16. Trắc nghiệm
• 1 điểm

Trong xử lý ngôn ngữ tự nhiên, ‘paraphrasing’ là gì?

Quá trình chuyển đổi văn bản thành giọng nói

Quá trình diễn đạt lại một câu hoặc đoạn văn bằng cách sử dụng các từ ngữ khác nhưng vẫn giữ nguyên ý nghĩa

Quá trình phân tích cấu trúc ngữ pháp của một câu

Quá trình tóm tắt một văn bản dài thành một phiên bản ngắn hơn

Xem đáp án

Chọn đáp án B

17. Trắc nghiệm
• 1 điểm

Kỹ thuật nào sau đây thường được sử dụng để giảm chiều dữ liệu trong NLP, giúp giảm độ phức tạp tính toán và cải thiện hiệu suất mô hình?

Tokenization

Stemming

Principal Component Analysis (PCA)

Stop word removal

Xem đáp án

Chọn đáp án C

18. Trắc nghiệm
• 1 điểm

Trong mô hình Word2Vec, mục đích của việc huấn luyện mô hình là gì?

Dự đoán từ tiếp theo trong một câu

Tìm ra mối quan hệ ngữ nghĩa giữa các từ

Phân loại văn bản dựa trên chủ đề

Chuyển đổi văn bản thành giọng nói

Xem đáp án

Chọn đáp án B

19. Trắc nghiệm
• 1 điểm

Khi triển khai một chatbot, bạn muốn lưu trữ thông tin về trạng thái của cuộc trò chuyện (ví dụ: các bước đã hoàn thành, thông tin đã thu thập). Bạn nên sử dụng kỹ thuật nào?

Stemming

Context management

Sentiment analysis

Named entity recognition

Xem đáp án

Chọn đáp án B

20. Trắc nghiệm
• 1 điểm

Khi đánh giá một mô hình sinh văn bản, chỉ số nào sau đây thường được sử dụng để đo lường tính đa dạng của văn bản được tạo ra?

BLEU score

Perplexity

Distinct-n

ROUGE score

Xem đáp án

Chọn đáp án C

21. Trắc nghiệm
• 1 điểm

Trong xử lý ngôn ngữ tự nhiên, ‘coreference resolution’ là gì?

Quá trình chuyển đổi văn bản thành giọng nói

Quá trình xác định tất cả các tham chiếu đến cùng một thực thể trong một văn bản

Quá trình phân tích cấu trúc ngữ pháp của một câu

Quá trình dịch văn bản từ ngôn ngữ này sang ngôn ngữ khác

Xem đáp án

Chọn đáp án B

22. Trắc nghiệm
• 1 điểm

Khi xây dựng một mô hình phân loại văn bản, bạn sử dụng kỹ thuật cross-validation để làm gì?

Tăng tốc độ huấn luyện mô hình

Đánh giá hiệu suất của mô hình trên dữ liệu chưa thấy

Giảm kích thước của dữ liệu huấn luyện

Cải thiện khả năng diễn giải của mô hình

Xem đáp án

Chọn đáp án B

23. Trắc nghiệm
• 1 điểm

Trong kiến trúc Transformer, self-attention (tự chú ý) cho phép mô hình làm gì?

Tập trung vào các từ quan trọng nhất trong câu đầu vào

Dịch văn bản sang ngôn ngữ khác

Tạo ra các câu văn mới

Phân loại văn bản theo chủ đề

Xem đáp án

Chọn đáp án A

24. Trắc nghiệm
• 1 điểm

Trong ngữ cảnh của chatbot, ‘intent’ (ý định) đề cập đến điều gì?

Cảm xúc của người dùng

Mục đích của người dùng khi tương tác với chatbot

Ngôn ngữ lập trình được sử dụng để xây dựng chatbot

Số lượng người dùng đang sử dụng chatbot

Xem đáp án

Chọn đáp án B

25. Trắc nghiệm
• 1 điểm

Ứng dụng nào sau đây KHÔNG phải là một ứng dụng phổ biến của NLP?

Phân tích thị trường chứng khoán

Dịch máy

Phân tích cảm xúc

Chatbot

Xem đáp án

Chọn đáp án A

26. Trắc nghiệm
• 1 điểm

Trong các mô hình sequence-to-sequence, ‘teacher forcing’ là gì?

Một kỹ thuật để tăng cường dữ liệu huấn luyện

Một phương pháp để điều chỉnh trọng số của mô hình

Một chiến lược huấn luyện trong đó đầu ra thực tế từ bước trước được sử dụng làm đầu vào cho bước hiện tại

Một kỹ thuật để giảm overfitting

Xem đáp án

Chọn đáp án C

27. Trắc nghiệm
• 1 điểm

Trong lĩnh vực NLP, ‘perplexity’ là một thước đo đánh giá điều gì?

Độ phức tạp của thuật toán

Khả năng dự đoán của mô hình ngôn ngữ

Tốc độ xử lý của máy tính

Mức độ chính xác của phân tích cú pháp

Xem đáp án

Chọn đáp án B

28. Trắc nghiệm
• 1 điểm

Trong lĩnh vực NLP, ‘n-gram’ đề cập đến điều gì?

Một mô hình ngôn ngữ dựa trên mạng nơ-ron

Một chuỗi gồm n từ liên tiếp trong một văn bản

Một phương pháp để loại bỏ nhiễu trong dữ liệu văn bản

Một kỹ thuật để tóm tắt văn bản

Xem đáp án

Chọn đáp án B

29. Trắc nghiệm
• 1 điểm

Attention mechanism (cơ chế chú ý) được sử dụng rộng rãi trong các mô hình sequence-to-sequence. Mục đích chính của attention mechanism là gì?

Giảm kích thước của dữ liệu đầu vào

Cho phép mô hình tập trung vào các phần quan trọng nhất của dữ liệu đầu vào khi tạo ra đầu ra

Tăng tốc độ huấn luyện mô hình

Cải thiện khả năng song song hóa của mô hình

Xem đáp án

Chọn đáp án B

30. Trắc nghiệm
• 1 điểm

Trong xử lý ngôn ngữ tự nhiên, phương pháp nào thường được sử dụng để giảm số lượng từ trong văn bản bằng cách loại bỏ các từ không mang nhiều ý nghĩa?

Stemming

Tokenization

Stop word removal

Part-of-speech tagging

Xem đáp án

Chọn đáp án C