Khủng hoảng tái lập là phát hiện rằng một tỷ lệ đáng kể các kết quả đã công bố, nhất là trong tâm lý học và một số ngành y sinh, không lặp lại được khi các nhóm độc lập làm lại theo cùng phương pháp. Nó không có nghĩa khoa học vô giá trị, mà cho thấy cách khoa học được làm và được công bố có những lỗ hổng hệ thống.
Chào bạn, đây là Nhà Học Thuật. Tái lập được là một trong những đòi hỏi căn bản nhất của khoa học: một kết quả chỉ đáng tin khi người khác làm lại cũng thấy. Khoảng hơn một thập niên trước, nhiều ngành phát hiện rằng đòi hỏi ấy bị bỏ qua lâu hơn họ tưởng. Tập này mình kể chuyện đó.
Những tiếng chuông báo động
Năm hai nghìn không trăm linh năm, nhà nghiên cứu y học John Ioannidis công bố một bài báo với tiêu đề khiêu khích, đại ý vì sao phần lớn các kết quả nghiên cứu được công bố là sai. Ông lập luận bằng mô hình thống kê rằng với mẫu nhỏ, hiệu ứng yếu, và nhiều cách phân tích, phần lớn kết quả dương tính có thể là dương tính giả.
Đầu thập niên trước, một công ty dược thông báo họ chỉ xác nhận được một phần nhỏ trong mấy chục nghiên cứu ung thư quan trọng mà họ thử làm lại trước khi đầu tư.
Cùng thời gian ấy, một tạp chí tâm lý học uy tín đăng một loạt thí nghiệm tuyên bố tìm thấy bằng chứng con người cảm nhận trước được tương lai. Bài báo tuân thủ mọi chuẩn mực thông thường. Nhiều nhà tâm lý học kết luận rằng nếu chuẩn mực ấy cho ra kết quả như vậy, thì chính chuẩn mực có vấn đề.
Những sự kiện này mở đầu một giai đoạn tự soát xét lớn.
Dự án làm lại một trăm nghiên cứu
Năm hai nghìn không trăm mười lăm, một nhóm hợp tác gồm hàng trăm nhà nghiên cứu công bố kết quả làm lại khoảng một trăm thí nghiệm tâm lý học đã đăng trên các tạp chí hàng đầu.
Chỉ khoảng một phần ba số thí nghiệm làm lại cho kết quả có ý nghĩa thống kê như bản gốc, và độ lớn của hiệu ứng trung bình chỉ còn khoảng một nửa.
Một số hiệu ứng nổi tiếng, từng xuất hiện trong sách phổ biến khoa học và các bài nói truyền cảm hứng, không đứng vững khi được làm lại với mẫu lớn ở nhiều phòng thí nghiệm cùng lúc. Ví dụ là hiệu ứng cho rằng ý chí là nguồn lực bị cạn dần sau khi dùng, hay những tư thế cơ thể làm thay đổi nội tiết.
Cần nói cho công bằng: không tái lập được không chứng minh kết quả gốc chắc chắn sai. Có thể khác biệt về mẫu, về bối cảnh. Nhưng khi quá nhiều kết quả cùng không tái lập, vấn đề nằm ở hệ thống.
Vì sao kết quả sai lại được công bố?
Nguyên nhân thứ nhất là thiên lệch công bố. Tạp chí thích kết quả mới, bất ngờ, có ý nghĩa thống kê. Kết quả không tìm thấy gì nằm trong ngăn kéo. Vậy những gì được công bố là một mẫu lệch của mọi thứ đã được làm.
Nguyên nhân thứ hai là cách phân tích linh hoạt. Một nhà nghiên cứu có thể chọn loại bỏ vài người tham gia, chọn đo biến này thay biến kia, dừng thu thập dữ liệu khi thấy kết quả đẹp. Mỗi lựa chọn đều có vẻ hợp lý, nhưng gộp lại, chúng làm tăng mạnh khả năng tìm ra kết quả tình cờ.
Nguyên nhân thứ ba là mẫu nhỏ. Với ít người tham gia, chỉ những hiệu ứng tình cờ rất lớn mới đạt ý nghĩa thống kê, nên kết quả được công bố thường thổi phồng độ lớn thật.
Phía sau tất cả là áp lực nghề nghiệp: công bố để được tuyển, được thăng tiến, được tài trợ. Không cần ai gian lận, chỉ cần mọi người làm theo thói quen thông thường, hệ thống đã tự sinh ra nhiều kết quả không vững.
Tranh luận về giá trị p
Giá trị p là con số dùng để đánh giá một kết quả có thể do tình cờ hay không. Thông lệ lâu nay là lấy ngưỡng năm phần trăm: dưới ngưỡng thì gọi là có ý nghĩa thống kê.
Năm hai nghìn không trăm mười sáu, Hiệp hội Thống kê Hoa Kỳ ra một tuyên bố hiếm hoi nhắc lại rằng giá trị p không đo xác suất giả thuyết đúng, không đo độ lớn hiệu ứng, và không nên dùng một ngưỡng duy nhất để quyết định đúng sai.
Từ đó có nhiều đề xuất: hạ ngưỡng xuống thấp hơn nhiều cho các khám phá mới, báo cáo khoảng tin cậy và độ lớn hiệu ứng, dùng phương pháp Bayes, hoặc bỏ hẳn khái niệm có ý nghĩa thống kê. Giới thống kê vẫn chưa thống nhất.
Điều mọi phía đồng ý là con số nào cũng không thay được việc hiểu thiết kế nghiên cứu và lặp lại kết quả.
Khoa học tự sửa mình thế nào?
Điều đáng khích lệ là chính cộng đồng khoa học phát hiện và công khai vấn đề, và cải cách đang diễn ra. Đăng ký trước, tức ghi lại giả thuyết và kế hoạch phân tích trước khi thu dữ liệu, ngày càng phổ biến.
Một số tạp chí áp dụng hình thức báo cáo đăng ký: bài được duyệt dựa trên câu hỏi và phương pháp, trước khi có kết quả, nên kết quả không tìm thấy gì cũng được công bố. Dữ liệu và mã phân tích được chia sẻ công khai để người khác kiểm tra.
Những dự án làm lại quy mô lớn, nhiều phòng thí nghiệm ở nhiều nước cùng làm một thí nghiệm, trở thành công cụ thường xuyên. Mức độ khủng hoảng cũng khác nhau giữa các ngành, và đang được đo đạc kỹ hơn.
Bài học cho người đọc tin khoa học là: một nghiên cứu đơn lẻ, nhất là với kết quả quá đẹp hay quá lạ, nên được xem là một manh mối, chưa phải kết luận. Bạn có thể hỏi: đã có ai làm lại chưa.
Câu hỏi thường gặp
Khủng hoảng tái lập có phải là gian lận khoa học không?
Phần lớn không phải. Gian lận có tồn tại nhưng hiếm. Khủng hoảng chủ yếu do những thói quen phân tích và công bố được chấp nhận rộng rãi nhưng làm tăng khả năng kết quả tình cờ được đăng.
Ngành nào bị ảnh hưởng nhiều nhất?
Tâm lý học xã hội được nhắc nhiều nhất vì chính ngành này tự kiểm tra sớm và công khai. Các vấn đề tương tự cũng được ghi nhận ở y sinh, kinh tế học thực nghiệm và một số ngành khác, ở mức độ khác nhau.
Đăng ký trước nghiên cứu là gì?
Đó là việc ghi lại công khai giả thuyết, cách thu thập dữ liệu và cách phân tích trước khi bắt đầu nghiên cứu. Nó giúp phân biệt rõ phát hiện được dự đoán trước với phát hiện tìm ra sau khi xem dữ liệu.
Người không chuyên đọc tin khoa học nên lưu ý gì?
Nên để ý cỡ mẫu, xem kết quả đã được nhóm khác xác nhận chưa, và cảnh giác với những tuyên bố quá mạnh từ một nghiên cứu duy nhất. Những bài tổng quan gộp nhiều nghiên cứu thường đáng tin hơn một nghiên cứu lẻ.
Khủng hoảng tái lập có làm giảm niềm tin vào khoa học không?
Nó có thể làm vậy nếu bị hiểu sai. Nhưng việc khoa học tự phát hiện và sửa lỗi của mình chính là điều làm nó khác với những hệ thống niềm tin không bao giờ tự kiểm tra.