Máy Tính Thống Kê Mô Tả

Tính toàn bộ các chỉ số thống kê mô tả cho một dãy số chỉ trong một lần: trung bình, trung vị, mốt, phương sai, độ lệch chuẩn, độ lệch, độ nhọn và tứ phân vị.

Loading calculator…

Một dãy số, đầy đủ mọi chỉ số

Đây là trang thống kê mô tả tổng hợp: dán dãy số của bạn vào một lần, nhận về mọi chỉ số thống kê tóm tắt thường dùng, được nhóm thành bốn nhóm:

NhómTrả lời câu hỏi gìCác chỉ số trên trang
Trung tâm"Điểm giữa" của dữ liệu ở đâu?Tổng, trung bình, trung vị, mốt, trung độ
Độ phân tánDữ liệu phân tán ra sao?Khoảng biến thiên, phương sai (tổng thể/mẫu), độ lệch chuẩn (tổng thể/mẫu), MAD, RMS, SEM, hệ số biến thiên
Vị tríMột giá trị đứng ở đâu trong dữ liệu đã sắp xếp?Nhỏ nhất, lớn nhất, Q1, Q2 (trung vị), Q3, IQR
Hình dạngPhân phối có đối xứng không, đuôi phân phối nặng đến đâu?Độ lệch (skewness), độ nhọn (kurtosis)

Để xem cách tính từng bước đầy đủ cho một nhóm cụ thể, trang này có liên kết tới các công cụ chuyên biệt bên dưới kết quả — trang này đánh đổi chiều sâu từng bước để lấy sự đầy đủ, hiển thị mọi thứ cùng lúc.

Mạch "độ lệch lũy thừa bậc k"

Bốn chỉ số kể trên — độ lệch tuyệt đối trung bình, phương sai, độ lệch và độ nhọn — thật ra chỉ là cùng một ý tưởng lặp lại ở các lũy thừa tăng dần. Mỗi chỉ số đều xuất phát từ cùng một khối xây dựng, độ lệch của một giá trị so với trung bình cộng (xᵢ − x̄), và chỉ khác nhau ở lũy thừa mà độ lệch đó được nâng lên trước khi lấy trung bình:

Chỉ sốLũy thừa của (xᵢ − x̄)Vì sao dùng lũy thừa đó
Độ lệch tuyệt đối trung bình (MAD)Bậc 1 (dạng |xᵢ − x̄|)Giá trị tuyệt đối tránh triệt tiêu dương/âm mà không đổi đơn vị
Phương saiBậc 2Bình phương cũng tránh triệt tiêu, đồng thời làm độ lệch lớn có trọng số nặng hơn
Độ lệch (skewness)Bậc 3Lập phương giữ nguyên dấu, nên có thể phát hiện phía nào của trung bình bị kéo dài hơn
Độ nhọn (kurtosis)Bậc 4Lũy thừa bậc 4 tăng nhanh nhất, nên độ nhọn bị chi phối mạnh bởi các giá trị cực đoan nhất (phần đuôi)
Mẹo: Đây là lý do phương sai có đơn vị "bình phương" và cần lấy căn bậc hai (độ lệch chuẩn) để trở về đơn vị gốc — nhưng độ lệch và độ nhọn là các tỷ số (độ lệch lũy thừa ÷ độ lệch chuẩn cùng lũy thừa đó), nên đơn vị tự triệt tiêu và cả hai đều đã là số không đơn vị.

Từng chỉ số nâng cao, lần lượt

Với dãy số ví dụ 42, 54, 65, 47, 59, 40, 53 (7 giá trị, trung bình ≈ 51,4286):

Trung độ (midrange) — trung bình cộng của giá trị nhỏ nhất và lớn nhất: (40 + 65) ÷ 2 = 52,5. Đây là cách ước lượng "trung tâm" nhanh nhất có thể, nhưng chỉ dùng hai trong bảy giá trị, nên một giá trị ngoại lai duy nhất cũng có thể làm nó lệch nhiều.

Độ lệch tuyệt đối trung bình (MAD) — khoảng cách trung bình so với trung bình cộng, không bình phương: 7,2245. Nó trả lời câu hỏi "trung bình, một giá trị điển hình lệch bao xa?" theo đúng đơn vị gốc của dữ liệu, và ít nhạy với giá trị ngoại lai hơn phương sai hay độ lệch chuẩn vì không bình phương độ lệch.

Căn quân phương (RMS) — căn bậc hai của trung bình cộng các giá trị bình phương (không phải độ lệch bình phương so với trung bình): 52,1043. RMS xuất hiện thường xuyên trong vật lý và kỹ thuật (điện áp RMS, tốc độ RMS) vì việc bình phương trước khi lấy trung bình xử lý đúng các đại lượng đổi dấu liên tục.

Sai số chuẩn của trung bình (SEM) — độ lệch chuẩn mẫu chia cho √n: 9,034 ÷ √7 ≈ 3,4147. SEM ước lượng mức độ biến động của chính trung bình mẫu nếu bạn lặp lại việc lấy mẫu — SEM càng nhỏ, trung bình mẫu càng là ước lượng chính xác cho trung bình tổng thể thực sự.

Hệ số biến thiên (CV) — độ lệch chuẩn biểu diễn dưới dạng phần trăm của trung bình cộng: (8,364 ÷ 51,4286) × 100 ≈ 16,26%. Vì CV không có đơn vị, đây là công cụ đúng để so sánh độ phân tán tương đối giữa hai dãy số đo bằng đơn vị khác nhau hoặc có thang đo chênh lệch lớn — độ lệch chuẩn đơn thuần không làm được điều này một cách công bằng.

Độ lệch (skewness) — mức độ bất đối xứng của phân phối: 0,1040 ở đây, gần bằng 0, nghĩa là dãy số này gần như đối xứng (đuôi phải dài hơn sẽ đẩy độ lệch dương lên; đuôi trái dài hơn sẽ đẩy nó âm).

Độ nhọn (kurtosis) — phần đuôi của phân phối nặng đến đâu, so với phân phối chuẩn (đường cong hình chuông), vốn có độ nhọn đúng bằng 3: 1,3426 ở đây, thấp hơn hẳn 3, nghĩa là dãy số nhỏ này có phần đuôi mỏng hơn rõ rệt và đỉnh phẳng hơn so với phân phối chuẩn.

Khi nào nên xem tóm tắt đầy đủ

Tính mọi chỉ số cùng lúc rất hữu ích để có cái nhìn đầu tiên về dữ liệu chưa quen thuộc — mẫu kiểm soát chất lượng, kết quả khảo sát, điểm thi, số liệu cảm biến — trước khi quyết định chỉ số nào thực sự quan trọng cho câu hỏi cụ thể. Khi đã biết cần nhóm nào, các công cụ chuyên biệt sẽ đi sâu hơn vào đúng nhóm đó: trung bình cộng, trung vị, mốt cho xu hướng trung tâm, độ lệch chuẩn cho phương sai tổng thể-mẫu và độ phân tán, tứ phân vị & IQR cho tứ phân vị theo phương pháp loại trừ và ngưỡng ngoại lai, phân vị cho phân vị theo nội suy tuyến tính và thứ hạng phân vị, và z-score cho số độ lệch chuẩn mà một giá trị cách trung bình cộng.

Câu hỏi thường gặp

"Thống kê mô tả" nghĩa là gì, và công cụ này tính những gì?
Thống kê mô tả tóm tắt một dãy số bằng vài con số thay vì liệt kê từng giá trị. Công cụ này tính cả bốn nhóm cùng lúc — trung tâm (tổng, trung bình, trung vị, mốt, trung độ), độ phân tán (khoảng biến thiên, phương sai, độ lệch chuẩn, MAD, RMS, SEM, hệ số biến thiên), vị trí (nhỏ nhất, lớn nhất, tứ phân vị, IQR) và hình dạng (độ lệch, độ nhọn) — để bạn có bức tranh đầy đủ trong một lần thay vì phải dùng nhiều công cụ riêng lẻ.
Vì sao trang này hiển thị cả phương sai/độ lệch chuẩn tổng thể lẫn mẫu?
Mỗi dãy số đều có hai công thức phương sai và độ lệch chuẩn hợp lệ, tùy vào việc dữ liệu của bạn LÀ toàn bộ nhóm bạn quan tâm (tổng thể, chia cho n) hay chỉ là một mẫu lấy từ nhóm lớn hơn (mẫu, chia cho n − 1, hiệu chỉnh Bessel). Vì công cụ không thể biết bạn đang ở trường hợp nào, nó hiển thị song song cả hai.
Vì sao độ lệch, độ nhọn, hoặc hệ số biến thiên đôi khi hiển thị "—" thay vì một con số?
Cả ba chỉ số đều chia cho độ lệch chuẩn (độ lệch và độ nhọn chia cho độ lệch chuẩn mẫu lũy thừa 3 và 4; hệ số biến thiên chia cho trung bình cộng). Khi mọi giá trị trong dãy số giống hệt nhau, độ lệch chuẩn bằng đúng 0, và phép chia cho 0 là không xác định — về mặt toán học đây là dạng "0/0" chưa xác định, không phải một số rất lớn hay rất nhỏ. Công cụ hiển thị "—" cho trường hợp này thay vì một kết quả vô nghĩa. Riêng phương sai và độ lệch chuẩn vẫn được tính đúng bằng 0 trong trường hợp đó, vì "không có sự phân tán" là một câu trả lời hoàn toàn có ý nghĩa cho hai chỉ số này.
Ý tưởng "độ lệch lũy thừa bậc k" đằng sau MAD, phương sai, độ lệch và độ nhọn là gì?
Bốn chỉ số khác nhau đều xuất phát từ cùng một khối xây dựng — khoảng cách của mỗi giá trị so với trung bình cộng (xᵢ − x̄) — và chỉ khác nhau ở lũy thừa mà độ lệch đó được nâng lên trước khi lấy trung bình. Độ lệch tuyệt đối trung bình dùng lũy thừa bậc 1 (dưới dạng giá trị tuyệt đối, để tránh triệt tiêu). Phương sai dùng lũy thừa bậc 2 (bình phương cũng tránh triệt tiêu, đồng thời làm độ lệch lớn có trọng số nặng hơn). Độ lệch (skewness) dùng lũy thừa bậc 3, vốn nhạy với hướng bất đối xứng vì phép lập phương giữ nguyên dấu. Độ nhọn (kurtosis) dùng lũy thừa bậc 4, vốn bị chi phối mạnh bởi các giá trị cực đoan nhất vì lũy thừa bậc 4 tăng rất nhanh.
Công cụ này dùng phương pháp tứ phân vị nào — loại trừ hay nội suy tuyến tính?
Phương pháp loại trừ — giống hệt công cụ tứ phân vị & IQR chuyên biệt. Nó tìm trung vị chung, rồi tìm trung vị của nửa dưới và trung vị của nửa trên (loại trung vị chung ra khỏi cả hai nửa khi số lượng giá trị là số lẻ). Công cụ phân vị chuyên biệt lại dùng phép nội suy tuyến tính giữa các giá trị đã xếp hạng — một quy ước khác, cũng hoàn toàn hợp lệ; hai cách có thể lệch nhau đôi chút với dãy số nhỏ, đó là điều bình thường, không phải lỗi.
Vì sao cần nhập ít nhất hai số?
Nhiều chỉ số trên trang này — phương sai mẫu, độ lệch chuẩn mẫu, sai số chuẩn của trung bình, độ lệch và độ nhọn — đều chia cho (n − 1) hoặc cho độ lệch chuẩn tính theo mẫu, nên cần ít nhất hai giá trị để mọi chỉ số trên trang đều xác định được.

Công cụ liên quan