Bài 6 — Xác suất một email chứa chữ "khuyến mãi" là thư rác là bao nhiêu phần trăm?
Một email vừa tới. Tiêu đề có chữ "khuyến mãi". Nó có phải thư rác không?
Quản trị viên
18 tháng 9, 2026· 6 phút đọc
Một email vừa tới. Tiêu đề có chữ "khuyến mãi". Nó có phải thư rác không?
Đây là câu hỏi mà bộ lọc phải trả lời hàng tỉ lần mỗi ngày, và nó không thể trả lời chắc chắn. Thư thật cũng có thể chứa chữ ấy — trường học gửi thông báo về chương trình khuyến mãi sách vở chẳng hạn.
Nên câu hỏi đúng không phải "có phải spam không" mà là "xác suất là spam bao nhiêu phần trăm". Và công cụ trả lời nằm ở chương xác suất Toán 12.
Chỗ dễ nhầm nhất: hai xác suất trông giống nhau
Giả sử thống kê cho biết:
80% thư rác có chứa chữ "khuyến mãi".
Câu hỏi bẫy: vậy một thư chứa chữ "khuyến mãi" có 80% khả năng là rác, đúng không?
Không nhất thiết. Hai mệnh đề ấy nói về hai xác suất khác nhau:
Chúng đảo điều kiện cho nhau, và nói chung không bằng nhau.
Ví dụ dễ thấy hơn: , nhưng thì thấp — bàn ghế cũng bốn chân.
Lẫn hai xác suất này là sai lầm phổ biến nhất trong toàn bộ môn xác suất, và nó có tên riêng: nguỵ biện xác suất đảo. Công thức Bayes sinh ra để chuyển đúng từ vế này sang vế kia.
Ý tưởng: đếm trên 1000 thư
Trước khi viết công thức, hãy làm cách dễ nhất: đếm.
Giả thiết:
- thư đến hộp thư là rác;
- thư rác chứa chữ "khuyến mãi";
- chỉ thư thật chứa chữ ấy.
Lấy thư làm mẫu:
Bước 1. là rác ⇒ thư rác, thư thật.
Bước 2. Trong thư rác, chứa chữ ấy ⇒ thư.
Bước 3. Trong thư thật, chứa chữ ấy ⇒ thư.
Bước 4. Tổng số thư chứa chữ "khuyến mãi": thư. Trong đó là rác.
Trực quan hoá
⚠️ Ở bộ số liệu này, kết quả tình cờ trùng với giả thiết ban đầu. Đó là trùng hợp, không phải quy luật — phần tiếp theo sẽ cho thấy chỉ cần đổi một con số là hai giá trị tách ngay khỏi nhau.
Giải bài toán mẫu bằng công thức Bayes
Bây giờ làm lại bằng công thức của SGK Toán 12. Ký hiệu = "là rác", = "có chữ khuyến mãi".
Dữ kiện:
Bước 1 — Tính bằng công thức xác suất toàn phần:
Bước 2 — Áp công thức Bayes:
Đúng bằng kết quả đếm tay. Hai cách, một đáp số — và cách đếm giải thích vì sao công thức đúng: tử số là "số thư vừa rác vừa có chữ", mẫu số là "tổng số thư có chữ".
Tại sao cần "naive" — và chữ ấy nghĩa là gì
Một từ thì chưa đủ. Bộ lọc thật xét hàng nghìn từ cùng lúc. Nhưng lúc đó công thức phình ra rất nhanh: với từ đã cần biết , tức xác suất đồng thời, và số tổ hợp tăng theo hàm mũ.
Cách chữa là một giả thiết cố tình đơn giản hoá:
Giả sử các từ xuất hiện ĐỘC LẬP với nhau (khi đã biết thư là rác hay thật).
Khi đó xác suất đồng thời thành tích các xác suất riêng. Giả thiết này sai trong thực tế — "miễn" và "phí" rõ ràng hay đi cùng nhau — nên người ta gọi mô hình là naive, nghĩa là "ngây thơ".
Điều bất ngờ: mô hình ngây thơ ấy lại chạy rất tốt. Nó là bộ lọc thư rác tiêu chuẩn suốt nhiều năm, vì để xếp hạng cái nào nhiều khả năng là rác hơn thì sai số do giả thiết độc lập thường không làm đổi thứ tự.
Thử với hai từ. Thêm chữ "miễn phí" với và . Một thư chứa cả hai chữ:
Từ lên chỉ nhờ một từ nữa. Đó là lý do bộ lọc thật xét hàng nghìn từ: mỗi từ đẩy xác suất thêm một chút, và chúng dồn lại rất nhanh.
Cùng công thức ấy trong y học
Đây là ứng dụng khiến công thức Bayes đáng được dạy kỹ hơn.
Một xét nghiệm có độ nhạy (người bệnh thì ra dương tính) và độ đặc hiệu (người khoẻ thì ra âm tính). Bệnh hiếm, chỉ dân số mắc.
Bạn xét nghiệm và ra dương tính. Xác suất bạn thực sự mắc bệnh là bao nhiêu?
Đếm trên người:
- Mắc bệnh: người. Dương tính đúng: người.
- Khoẻ: người. Dương tính giả: người.
- Tổng dương tính: .
Chỉ 9%, dù xét nghiệm chính xác tới . Lý do: bệnh quá hiếm nên số dương tính giả (999) áp đảo số dương tính thật (99).
Đây là lý do bác sĩ không chẩn đoán dựa trên một xét nghiệm sàng lọc duy nhất. Và nó là một bài toán Toán 12 nguyên vẹn.
Thử thách tự tính
Một nhà máy có hai dây chuyền:
- Dây A sản xuất sản phẩm, tỉ lệ lỗi .
- Dây B sản xuất sản phẩm, tỉ lệ lỗi .
Câu hỏi 1. Lấy ngẫu nhiên một sản phẩm. Tính xác suất nó bị lỗi.
Câu hỏi 2. Biết sản phẩm lấy ra bị lỗi. Tính xác suất nó đến từ dây B.
Câu hỏi 3. Kiểm lại câu 2 bằng cách đếm trên sản phẩm.
Câu hỏi 4. Nhận xét: dây B chỉ làm ra sản phẩm, nhưng chiếm bao nhiêu phần trăm số hàng lỗi?
Đáp án
Câu 1. Xác suất toàn phần:
Câu 2. Bayes:
Câu 3. Trên sản phẩm: dây A làm , lỗi . Dây B làm , lỗi . Tổng lỗi , trong đó từ B là . Vậy ✓
Câu 4. Dây B chỉ chiếm sản lượng nhưng gây ra 63,2% số hàng lỗi. Đây chính là cách dùng Bayes trong quản lý chất lượng: nó chỉ ra nên đi sửa dây chuyền nào trước.
Lời kết
Công thức Bayes ngắn tới mức dễ bị coi là một công thức phải thuộc:
Nhưng nội dung của nó là một trong những ý sâu nhất của toán ứng dụng: cách cập nhật niềm tin khi có thêm bằng chứng. Trước khi đọc email, bạn nghĩ khả năng là rác. Sau khi thấy chữ "khuyến mãi", con số ấy thành . Thấy thêm "miễn phí", nó lên .
Và bài toán xét nghiệm y tế cho thấy vì sao phải học nó cho kỹ: trực giác của con người sai rất xa ở đây — gần như ai cũng đoán trong khi đáp án là . Cái sai ấy không vô hại; nó dẫn tới những quyết định thật về sức khoẻ.
Bài 7 sẽ quay lại phần đại số: làm sao một phép nhân ma trận biến thành bộ lọc ảnh của Instagram.
Muốn luyện chắc xác suất có điều kiện và công thức Bayes, thầy cô và các bạn có thể dựng bộ đề riêng trên Grade: chấm tự động ngay khi nộp kèm lời giải chi tiết từng câu. Dùng thử miễn phí tại đây.
Bắt đầu học cùng Grade
Luyện tập, kiểm tra trình độ và theo dõi tiến độ học tập đa môn — trên web và điện thoại.