Trong kiến trúc Transformer, "Multi-Head Attention" (cơ chế chú ý đa đầu) có vai trò gì so với "Single-Head Attention" (cơ chế chú ý đơn đầu)?30/30Trong kiến trúc Transformer, "Multi-Head Attention" (cơ chế chú ý đa đầu) có vai trò gì so với "Single-Head Attention" (cơ chế chú ý đơn đầu)?Giảm độ phức tạp tính toán của mô hình.Tăng tốc độ huấn luyện mô hình.Cho phép mô hình học được nhiều khía cạnh khác nhau của mối quan hệ giữa các từ trong câu.Giảm số lượng tham số của mô hình Transformer.Giải thíchChọn đáp án A