star twitter facebook envelope linkedin youtube alert-red alert home left-quote chevron hamburger minus plus search triangle x

DECISION TREE

Decision Tree (cây quyết định) là một mô hình học máy có giám sát dùng cho cả bài toán phân loại và hồi quy, trong đó quá trình ra quyết định được tổ chức dưới dạng cấu trúc cây gồm các nút và nhánh. Thuật toán này mô phỏng chân thực quá trình tư duy của con người dưới dạng một sơ đồ phân cấp.

Tại mỗi bước xử lý, thuật toán Decision Tree sẽ đặt ra một câu hỏi về một thuộc tính cụ thể của dữ liệu, sau đó hệ thống tiến hành phân chia dữ liệu thành các nhóm nhỏ hơn dựa trên kết quả trả lời. Quá trình phân tách này lặp đi lặp lại liên tục cho đến khi mô hình xác định được kết luận cuối cùng. Nhờ sở hữu tính trực quan cao, mô hình Decision Tree giúp các chuyên gia dễ dàng giải thích các quyết định phân tích dữ liệu phức tạp mà không đòi hỏi người nghe phải có kiến thức sâu về toán học.

Nguyên lý hoạt động của Decision Tree

Decision Tree hoạt động dựa trên nguyên tắc chia để trị, thuật toán liên tục tách tập dữ liệu thành các nhóm nhỏ hơn cho đến khi các nhóm đủ thuần nhất để dự đoán ổn định. Dưới đây là quy trình cơ bản:

  1. Chọn thuộc tính và ngưỡng tách tối ưu: Ở mỗi node, thuật toán duyệt qua các thuộc tính và ngưỡng nếu thuộc tính liên tục, sau đó tính các tiêu chí như Information Gain, Gain Ratio hoặc Gini impurity để tìm phép tách giúp các node con thuần hơn về nhãn so với node cha.
  2. Chia dữ liệu thành các node con: Sau khi chọn được thuộc tính và ngưỡng tách, tập dữ liệu tại node đó được chia thành các phần tương ứng với từng kết quả của phép tách, mỗi phần trở thành một nhánh con trong cây và giữ lại các mẫu rơi vào nhánh đó để xử lý tiếp.
  3. Lặp lại việc tách trên từng node con: Với mỗi node con, thuật toán lặp lại quy trình chọn thuộc tính, tìm ngưỡng, tính độ tốt của phép tách và tiếp tục chia nhỏ cho đến khi đạt điều kiện dừng như node chỉ chứa một lớp, không còn thuộc tính phù hợp, số mẫu quá ít hoặc cây đạt độ sâu tối đa.
  4. Gán nhãn cho node lá: Khi không tách tiếp, node trở thành node lá và được gán nhãn dự đoán, với bài toán phân loại, nhãn thường là lớp xuất hiện nhiều nhất trong node và với bài toán hồi quy, giá trị thường là trung bình hoặc trung vị của các giá trị mục tiêu trong node đó.
  5. Cắt tỉa (Pruning) để giảm overfitting: Sau khi cây được xây, có thể áp dụng pre-pruning bằng cách giới hạn độ sâu, số mẫu tối thiểu hoặc post-pruning bằng cách xây cây đầy đủ rồi lược bỏ các nhánh ít đóng góp để giảm phức tạp và cải thiện khả năng tổng quát hóa trên dữ liệu mới.

Các loại Decision Tree phổ biến

Các loại Decision Tree phổ biến thường được chia theo dạng đầu ra của bài toán, gồm hai nhóm chính là cây phân loại và cây hồi quy.

  • Cây phân loại (Classification Tree): Dùng cho bài toán dự đoán nhãn rời rạc như “spam/không spam”, “churn/không churn” hoặc phân loại nhóm khách hàng. Mỗi node lá lưu một lớp và các phép tách trong cây được chọn để tăng độ thuần lớp thông qua giảm entropy hoặc Gini, giúp mô hình gán khách hàng vào nhóm thích hợp dựa trên đặc trưng như độ tuổi, thu nhập và hành vi.
  • Cây hồi quy (Regression Tree): Dùng cho bài toán dự đoán giá trị liên tục như giá nhà, doanh thu dự kiến hoặc nhiệt độ. Thay vì tối ưu độ thuần lớp, cây hồi quy chọn phép tách để giảm sai số dự đoán, thường sử dụng MSE và node lá lưu một giá trị số đại diện như giá thuê trung bình cho các căn hộ có diện tích, vị trí và số phòng ngủ thuộc cùng một vùng trong không gian đặc trưng.
A - Z Sitemap

Đào tạo, nghiên cứu gắn liền với khoa học và công nghệ nhằm tạo ra những sinh viên và học viên có lòng yêu nước, có phẩm chất nhân văn mang đậm bản sắc Việt Nam, có ý thức sinh hoạt cộng đồng, có sức khỏe, có năng lực và kỹ năng toàn diện, tự tin, năng động, sáng tạo và trở thành công dân khởi nghiệp mang tính toàn cầu.