HỒI QUY LOGISTIC – KHI MACHINE LEARNING HỌC CÁCH RA PHÁN QUYẾT "CÓ" HOẶC "KHÔNG"
HỒI QUY LOGISTIC – KHI MACHINE LEARNING HỌC CÁCH RA PHÁN QUYẾT "CÓ" HOẶC "KHÔNG"
Trong cuộc sống và kinh doanh, không phải lúc nào chúng ta cũng đi tìm một con số kéo dài vô tận như doanh thu tháng sau là bao nhiêu hay giá căn hộ này là mấy tỷ. Hầu hết các quyết định mang tính sinh tồn đều nằm ở dạng nhị phân: Có hay Không, Sống hay Mất, Mua hay Bỏ, Duyệt hay Bác.
- Khách hàng này sẽ tiếp tục gắn bó hay hủy dịch vụ (Churn)?
- Giao dịch ngân hàng vừa thực hiện là hợp lệ hay gian lận (Fraud)?
- Khối u trên hình ảnh X-quang là lành tính hay ác tính?
- Email gửi đến hòm thư là thư thường hay thư rác (Spam)?
Hồi quy tuyến tính (ở Bài trước) hoàn toàn "bó tay" trước những câu hỏi này. Một đường thẳng kéo dài từ âm vô cực đến dương vô cực sẽ cho ra những kết quả phi lý như "xác suất đậu đại học là 150%" hoặc "xác suất giao dịch gian lận là -30%".
Để giải quyết bài toán phân loại nhị phân này, các nhà khoa học dữ liệu đã đưa ra một bước tiến lịch sử: Hồi quy Logistic (Logistic Regression).
1. Phép màu uốn cong đường thẳng: Hàm Sigmoid
Hãy tưởng tượng bạn cố dùng Hồi quy tuyến tính để dự đoán xem một học sinh sẽ Đậu (1) hay Rớt (0) dựa trên số giờ ôn thi.
Nếu bạn vẽ một đường thẳng, khi số giờ học quá nhiều, kết quả vượt xa con số 1; khi số giờ học quá ít, kết quả tụt xuống dưới con số 0. Xác suất thực tế không thể nằm ngoài khoảng 0% đến 100%.
Hồi quy Logistic đã giải quyết bế tắc này bằng cách lấy đường thẳng của Hồi quy tuyến tính và "nén" nó qua một chiếc phễu đặc biệt mang tên Hàm Sigmoid:
Trong đó:
- (chính là phương trình đường thẳng đa biến mà chúng ta đã biết).
- e là hằng số Euler (≈ 2.718$).
- σ(z) là đầu ra xác suất, luôn nằm trong khoảng từ 0 đến 1.
Xác suất (P)
1.0 | /--- [Trạng thái 1: Đậu / Fraud / Spam]
| /
0.5 |--------------------X----- Ngưỡng quyết định (Decision Boundary)
| /
0.0 |---/-------------- [Trạng thái 0: Rớt / Legitimate / Normal]
+-----------------------------------
-vô cực 0 +vô cực (Giá trị z)
Sức mạnh của Sigmoid: Dù giá trị z có nhỏ tới âm vô cực hay lớn tới dương vô cực, hàm Sigmoid sẽ uốn cong nó thành một đường hình chữ S mềm mại, biến mọi giá trị đầu ra thành một con số xác suất chuẩn xác từ 0% đến 100%.
2. Ngưỡng quyết định (Decision Boundary) và Phán quyết tự động
Sau khi ép con số về dạng xác suất, mô hình cần một quy tắc để biến xác suất thành phán quyết cuối cùng. Mô hình sẽ thiết lập một Ngưỡng quyết định (Threshold), mặc định ban đầu thường là 0.5 (50%):
- Nếu P ≥ 0.5 thì suy ra: Tuyên án: Trạng thái 1 (Có / Duyệt / Spam)
- Nếu P < 0.5 thì suy ra: Tuyên án: Trạng thái 0 (Không / Bác / Thường)
Ví dụ thực tế tại Ngân hàng:
Khi bạn nộp hồ sơ xin cấp hạn mức tín dụng 100 triệu, thuật toán Hồi quy Logistic sẽ chạy ngầm. Nó nạp các biến số X1 (Thu nhập), X2 (Độ tuổi), X3 (Số lần trả chậm trong quá khứ) vào hàm Sigmoid.
Nếu mô hình trả về xác suất quỵt nợ của bạn là 0.12 (12% < 50%), hệ thống lập tức thông báo: Hồ sơ được duyệt tự động trong 3 giây!
3. Cạm bẫy Ngưỡng 0.5: Bài toán cái giá của sự sai lầm
Một nhà phân tích dữ liệu nghiệp dư sẽ luôn trung thành với ngưỡng mặc định 0.5. Nhưng một chuyên gia thực sự sẽ luôn đặt ra câu hỏi: "Nếu mô hình đoán sai, cái giá phải trả là gì?"
Tình huống 1: Chẩn đoán Ung thư Y tế
- Sai lầm A (Âm tính giả): Bệnh nhân bị ung thư thật, nhưng AI đoán xác suất chỉ là 42% (< 50%) nên kết luận "Bình thường". Bệnh nhân về nhà và mất đi cơ hội vàng để điều trị.
- Sai lầm B (Dương tính giả): Bệnh nhân khỏe mạnh, nhưng AI đoán xác suất là 55%$(> 50%) nên báo nguy cơ. Bệnh nhân tốn thêm tiền làm xét nghiệm sinh thiết để khẳng định lại.
- Giải pháp: Trong y tế, người ta chủ động hạ ngưỡng quyết định xuống 0.1 (10%). Chỉ cần mô hình thấy 10% nguy cơ, hệ thống đã phát báo động để bác sĩ can thiệp. Thà bắt nhầm còn hơn bỏ sót!
Tình huống 2: Lọc thư rác (Spam Filter)
- Giải pháp: Nếu một email quan trọng của đối tác bị tống vào hòm thư Spam (Dương tính giả), bạn có thể mất hợp đồng triệu đô. Do đó, các kỹ sư Google sẽ nâng ngưỡng Spam lên 0.9 (90%). Email phải cực kỳ giống thư rác thì mới bị chặn lại.
4. Ý nghĩa nền tảng trong Kỷ nguyên AI
Hồi quy Logistic không chỉ dừng lại ở một thuật toán độc lập. Nó chính là viên gạch đầu tiên xây dựng nên Mạng Nơ-ron Nhân tạo (Neural Networks).
Mỗi tế bào nơ-ron trong các mô hình Deep Learning hay Chatbot AI ngày nay thực chất chính là một đơn vị xử lý nhận đầu vào, tính tổng trọng số và đi qua một hàm kích hoạt (như Sigmoid) để đưa ra quyết định đóng hoặc mở dòng tín hiệu.
Lời kết
Nếu Hồi quy tuyến tính cho chúng ta khả năng ước lượng quy mô của tương lai, thì Hồi quy Logistic trao cho máy tính khả năng ra quyết định phân loại. Nó giúp các hệ thống tự động hóa vận hành hàng triệu giao dịch mỗi giây mà không cần con người can thiệp.
Thế nhưng, khi AI đưa ra phán quyết "Có" hoặc "Không", làm sao chúng ta biết mô hình đó thực sự thông minh hay chỉ đang "đoán mò" dựa trên sự may mắn?
Bài viết liên quan
- AI đã giải bài toán thiên niên kỷ Navier–Stokes?
- Kinh tế tuần hoàn – Từ yêu cầu cấp thiết đến động lực phát triển bền vững
- VỎ CHANH LEO – NGUỒN CHẤT XƠ TIỀM NĂNG CHO PHÁT TRIỂN THỰC PHẨM ĂN KIÊNG
- ĐẶC ĐIỂM MÔI TRƯỜNG ĐẤT TẠI KHU VỰC NÔNG THÔN
- ỨNG DỤNG CÔNG NGHỆ RÀO CẢN (HURDLE TECHNOLOGY) TRONG BẢO QUẢN THỰC PHẨM