Phân tích phổ điểm theo thang Bloom: bốn hình dạng phổ điểm và điều mỗi hình dạng nói về lớp
Chấm xong một đề bốn mươi câu, con số đầu tiên ai cũng tính là điểm trung bình của lớp. Nó là con số ít hữu ích nhất trong tất cả những con số có thể tính từ tập dữ liệu ấy.
Quản trị viên
21 tháng 9, 2026· 12 phút đọc

Chấm xong một đề bốn mươi câu, con số đầu tiên ai cũng tính là điểm trung bình của lớp. Nó là con số ít hữu ích nhất trong tất cả những con số có thể tính từ tập dữ liệu ấy. Trung bình 6,2 có thể là một lớp đồng đều quanh 6, hoặc một lớp chia làm hai nửa 8 và 4 — hai tình huống cần hai cách dạy tiếp hoàn toàn khác nhau, và trung bình xoá sạch khác biệt đó.

Nỗi khó: dữ liệu đã có sẵn, chỉ là không ai đọc nó
Sau mỗi kỳ kiểm tra, thầy cô đang giữ một tập dữ liệu khá giàu: bốn mươi học sinh × bốn mươi câu là một nghìn sáu trăm quan sát. Nhưng thứ được dùng thường chỉ là tổng theo hàng (điểm từng em) và một trung bình. Tổng theo cột — câu nào cả lớp sai — thì ít khi được tính, và các phép tính chéo thì gần như không.
Lý do không phải thầy cô không muốn. Lý do là bốn mươi cột nhân bốn lớp là một buổi ngồi với bảng tính, mỗi kỳ, và không ai chắc là buổi đó đổi được gì.
Bài này nói về bốn con số nên đọc thay cho điểm trung bình, và quan trọng hơn: bốn hình dạng phổ điểm mà mỗi hình dạng dẫn tới một hành động khác nhau. Nếu chỉ đọc được một thứ thì hãy đọc hình dạng, vì nó không cần tính toán gì.
Bản chất: thang Bloom biến một cột điểm thành một bản chẩn đoán
Thang phân loại Bloom — bản sửa năm 2001 của Anderson và Krathwohl — xếp các hoạt động tư duy theo sáu bậc: Nhớ, Hiểu, Vận dụng, Phân tích, Đánh giá, Sáng tạo. Chương trình GDPT 2018 dùng bốn mức gọn hơn, và chúng ứng khá sát:
| Mức trong chương trình Việt Nam | Bậc Bloom tương ứng | Học sinh làm gì |
|---|---|---|
| Nhận biết | Nhớ | Gọi lại một định nghĩa, đọc ra một giá trị |
| Thông hiểu | Hiểu | Giải thích, so sánh, diễn đạt lại bằng lời mình |
| Vận dụng | Vận dụng | Áp dụng vào tình huống quen thuộc |
| Vận dụng cao | Phân tích, Đánh giá, Sáng tạo | Tình huống mới, chọn phương pháp, phản biện một cách giải |
Điều thang này đem lại không phải một cách gắn nhãn. Nó cho phép cắt phổ điểm theo mức thay vì gộp: thay vì "lớp đạt 6,2", ta có bốn con số — tỷ lệ đúng ở Nhận biết, ở Thông hiểu, ở Vận dụng, ở Vận dụng cao. Và bốn con số ấy có hình dạng, còn hình dạng thì đọc được.
Bốn hình dạng, và hành động ứng với mỗi hình dạng
Đây là phần dùng được ngay, không cần công cụ gì ngoài một máy tính bỏ túi.
| Hình dạng tỷ lệ đúng theo mức | Đọc ra điều gì | Làm gì tiếp |
|---|---|---|
| Giảm đều: 90 – 75 – 55 – 30 | Bình thường và lành mạnh. Đề phân tầng đúng, lớp tiến bộ theo bậc | Không phải chữa gì. Đây là hình dạng để so ở kỳ sau |
| Vách đứng ở Thông hiểu: 92 – 45 – 40 – 30 | Học sinh nhớ mà không hiểu. Thuộc được định nghĩa, không diễn đạt lại được | Dạy lại bằng ví dụ và phản ví dụ, không dạy lại bằng cách đọc lại định nghĩa |
| Vách đứng ở Vận dụng: 88 – 80 – 35 – 25 | Hiểu nhưng không chuyển được. Biết công thức, không nhận ra lúc nào dùng | Luyện nhận dạng tình huống: cho bài không nói phải dùng gì |
| Lên xuống thất thường: 70 – 85 – 50 – 65 | Gần như luôn là lỗi gán mức của đề, không phải hiện tượng của lớp | Đọc lại từng câu: có câu bị gán mức sai |
Hình dạng thứ tư là hình dạng quan trọng nhất để nhận ra, vì nó nói rằng dữ liệu chưa dùng được. Một lớp không thể làm câu Thông hiểu tốt hơn câu Nhận biết trên cùng một nội dung. Khi thấy nó, đừng kết luận gì về học sinh — đi kiểm mức độ đã gán cho từng câu.
Vì sao chuyện gán mức lại là mắt yếu nhất của cả phép phân tích
Cần nói thẳng điều này vì nó quyết định mức độ tin cậy của mọi báo cáo theo Bloom: mức độ của một câu hỏi là phán đoán của người soạn, không phải một thuộc tính đo được.
Người này coi "tính đạo hàm của hàm hợp" là Thông hiểu, người kia coi là Vận dụng. Cả hai đều có lý. Và trong các kho câu hỏi lớn — kể cả kho của chúng tôi — nhiều câu được gán mức bằng phỏng đoán từ những dấu hiệu gián tiếp chứ không phải do người soạn đề cân nhắc từng câu. Một báo cáo theo Bloom chỉ tốt đúng bằng chất lượng của phần gán nhãn ấy.
May là có một phép kiểm chéo rất mạnh và gần như miễn phí: so mức đã gán với độ khó ĐO ĐƯỢC.
- Câu gán Nhận biết mà chỉ 35% lớp làm đúng → hoặc câu bị gán sai mức, hoặc câu có lỗi.
- Câu gán Vận dụng cao mà 90% làm đúng → câu ấy thực ra là Nhận biết, hoặc đáp án lộ.
Phép so này không cần thêm dữ liệu gì — hai cột đã nằm sẵn cạnh nhau. Và nó thường sửa được nhãn của một vài câu mỗi kỳ, khiến báo cáo kỳ sau đáng tin hơn.
Bốn con số nên đọc thay cho điểm trung bình
| Chỉ số | Cách tính | Dải dùng được | Đọc thế nào khi nằm ngoài dải |
|---|---|---|---|
| Độ khó p | Tỷ lệ học sinh làm đúng câu đó | 0,3 – 0,8 | Trên 0,9: câu không phân biệt được ai. Dưới 0,2: quá khó hoặc câu có lỗi |
| Độ phân biệt D | Tỷ lệ đúng của nhóm 27% điểm cao trừ tỷ lệ đúng của nhóm 27% điểm thấp | Trên 0,3 | Dưới 0,2: câu không tách được trình độ. Âm: xem lại đáp án ngay |
| Tương quan điểm-nhị phân r | Tương quan giữa làm đúng câu này và tổng điểm | Trên 0,2 | Gần 0: câu này đo thứ khác với phần còn lại của đề |
| Hệ số tin cậy alpha | Độ nhất quán nội tại của cả đề | Trên 0,7 với đề tổng kết | Thấp: đề đang đo nhiều thứ rời rạc, hoặc quá ngắn |
Trong bốn con số, D âm là con số duy nhất đòi hành động ngay lập tức. Nó nghĩa là nhóm học sinh giỏi nhất làm sai câu đó nhiều hơn nhóm yếu nhất — điều gần như không xảy ra với một câu hỏi lành. Ba nguyên nhân thường gặp, theo thứ tự phổ biến: đáp án ghi sai, hai phương án đều đúng, và đề bài mơ hồ theo cách chỉ học sinh giỏi mới nhận ra. Câu D âm nằm trong kho sẽ trừ điểm đúng những em giỏi nhất, mỗi lần nó được dùng lại.
⚠️ Một lưu ý về alpha mà hay bị dùng sai: alpha tăng theo số câu. Một đề mười câu và một đề bốn mươi câu không so alpha với nhau được, và "nâng alpha" bằng cách thêm câu không làm đề tốt hơn. Alpha chỉ để so cùng một đề qua các kỳ, hoặc để phát hiện một đề đang trộn nhiều thứ không liên quan.
Phân tích phương án nhiễu: chỗ rẻ nhất để cải thiện một đề
Với câu trắc nghiệm, còn một lớp dữ liệu nữa gần như luôn bị bỏ: bao nhiêu học sinh chọn mỗi phương án sai.
| Điều thấy được | Nghĩa là gì | Làm gì |
|---|---|---|
| Một phương án không ai chọn | Nó quá vô lý, câu thực chất chỉ còn ba phương án — xác suất đoán bừa lên 33% | Thay bằng một cách hiểu sai có thật |
| Một phương án sai hút nhiều hơn đáp án | Đó là một cách hiểu sai rất phổ biến trong lớp | Đây là thông tin dạy học quý nhất của cả đề. Dạy lại đúng chỗ đó |
| Nhóm giỏi và nhóm yếu chọn cùng một phương án sai | Câu hỏi có vấn đề, không phải học sinh | Đọc lại đề bài và đáp án |
Dòng giữa là lý do đáng đọc bảng này nhất. Một phương án nhiễu hút được nhiều học sinh không phải một thất bại của đề — nó là một chẩn đoán đã hoàn thành: cả lớp đang hiểu sai theo đúng kiểu đó, và thầy cô biết chính xác phải chữa gì.
Ba bước đọc kết quả của bài kiểm tra tới
Bước 1 — Vẽ hình dạng trước khi tính gì cả (5 phút)
Chia câu theo bốn mức, tính tỷ lệ đúng của mỗi nhóm, viết ra bốn số. So với bảng bốn hình dạng ở trên.
Nếu ra hình dạng thứ tư — thất thường — dừng lại ở đây và đi kiểm nhãn mức độ. Mọi phân tích sâu hơn trên một bộ nhãn sai đều cho ra kết luận sai mà trông rất thuyết phục.
Bước 2 — Lọc ra các câu cần xem lại, theo đúng thứ tự này
Không đọc cả bốn mươi câu. Chỉ lấy những câu rơi vào ba rổ, theo thứ tự ưu tiên:
- D âm — xem đáp án ngay, trước cả khi trả bài nếu còn kịp.
- p dưới 0,2 kèm mức được gán là Nhận biết hoặc Thông hiểu — mâu thuẫn giữa nhãn và số đo.
- Có một phương án nhiễu hút nhiều hơn đáp án — không phải lỗi, mà là nội dung cần dạy lại.
Ba rổ này thường gom lại chỉ ba tới bảy câu trên một đề bốn mươi câu. Đó là lượng đọc được trong mười lăm phút.
Bước 3 — Viết hai dòng vào biên bản tổ, và giữ lại con số để so kỳ sau
Hai dòng, không cần dài:
- Nội dung cần dạy lại, kèm bằng chứng: "Quy tắc đổi chiều bất phương trình — 62% lớp chọn phương án quên đổi chiều ở câu 17."
- Câu cần sửa trong kho, kèm lý do: "Câu 23 có D = −0,15, hai phương án B và C đều đúng."
Và ghi lại bốn con số hình dạng. Chúng chỉ có nghĩa khi có cái để so — bốn số của kỳ này đặt cạnh bốn số của kỳ trước mới cho biết việc dạy lại có tác dụng hay không.
Rào cản thật: một nghìn sáu trăm ô, mỗi kỳ, bốn lớp
Mọi phép tính trên đây làm được bằng bảng tính. Nhưng phải nói thật về chi phí: dựng ma trận bốn mươi câu × bốn mươi em, tính p cho từng cột, chia nhóm 27% trên và dưới để tính D, đếm phân bố từng phương án — đó là một buổi cho một đề của một lớp. Nhân bốn lớp và hai kỳ thì nó không xảy ra, và vì thế dữ liệu vẫn nằm đó không được đọc.
Đây đúng là loại việc nên để máy làm, vì nó hoàn toàn cơ học. Grade có sẵn phân tích câu hỏi cho mọi đề đã có người làm, trả về đúng bộ chỉ số ở bảng trên: độ khó p, độ phân biệt D theo nhóm 27% trên và dưới, tương quan điểm-nhị phân r, phân tích từng phương án nhiễu, và hệ số tin cậy alpha cho cả đề.
Hai chi tiết về cách nó được dựng, đáng nói vì chúng ảnh hưởng tới việc tin con số:
- Câu bỏ trống được tính tỷ lệ đúng bằng 0, không bị loại khỏi mẫu. Loại chúng ra sẽ làm mọi câu khó trông dễ hơn thực tế.
- Phép tính được kiểm bằng một bộ tính lại từ định nghĩa, không phải bằng cách so với ảnh chụp kết quả cũ — vì p, D, r và alpha đều là số thực trông hợp lý ở mọi giá trị, nên một sai lệch sẽ không lộ ra ở đâu nếu chỉ so với chính mình.
Kho dùng chung hiện có gần 1.500 đề công khai và hơn 28.000 câu hỏi trên 23 môn. Và đúng theo cảnh báo ở giữa bài: mức độ của nhiều câu trong kho là phỏng đoán, nên phép so "mức đã gán với độ khó đo được" là việc nên làm với bất kỳ đề nào lấy từ kho chung.
Thầy cô có thể bắt đầu bằng bước 1 — năm phút, bốn con số: chia câu theo bốn mức, tính tỷ lệ đúng từng nhóm, và xem lớp mình ra hình dạng nào trong bốn hình dạng. Tạo đề miễn phí trên Grade để có sẵn bộ chỉ số cho bài kiểm tra tới.
Đọc thêm: khảo thí thích ứng — bộ chỉ số ở bài này chính là bước đầu để hiệu chuẩn một kho câu, và đánh giá quá trình cho cách phát hiện chỗ hổng trước khi hết chương.
Nguồn tham khảo
- Lorin W. Anderson & David R. Krathwohl (chủ biên) — A Taxonomy for Learning, Teaching, and Assessing, bản sửa của thang Bloom (2001)
- Tài liệu kỹ thuật về phân tích câu hỏi: độ khó, độ phân biệt nhóm cực biên 27% và tương quan điểm-nhị phân — Educational Testing Service (Hoa Kỳ)
- Lee J. Cronbach — Coefficient alpha and the internal structure of tests (1951)
- Chương trình giáo dục phổ thông 2018 — Thông tư 32/2018/TT-BGDĐT, Bộ GD&ĐT
- Quy định đánh giá học sinh THCS và THPT — Thông tư 22/2021/TT-BGDĐT, Bộ GD&ĐT
Ảnh minh hoạ: Pexels.
Bắt đầu học cùng Grade
Luyện tập, kiểm tra trình độ và theo dõi tiến độ học tập đa môn — trên web và điện thoại.


