Applied Data Studies - Nghiên cứu Dữ liệu Ứng dụng

  • Home
  • Vietnam
  • Hanoi
  • Applied Data Studies - Nghiên cứu Dữ liệu Ứng dụng

Applied Data Studies - Nghiên cứu Dữ liệu Ứng dụng Giữa một Facebook ồn ào và hời hợt, đây là nơi một giảng viên Kinh tế kiên trì chia sẻ nghiên cứu nghiêm túc về ứng dụng dữ liệu.

📊 Ép dữ liệu ngoại lai vào khuôn khổ: Giải pháp chuẩn hóa đơn giản với Percentile Scaling.(Học máy A-Z, Tiền xử lý dữ li...
08/10/2026

📊 Ép dữ liệu ngoại lai vào khuôn khổ: Giải pháp chuẩn hóa đơn giản với Percentile Scaling.

(Học máy A-Z, Tiền xử lý dữ liệu - Phần 29)

Khi xây dựng mô hình ML, các giá trị ngoại lai (outliers) luôn là một vấn đề với vô số cách giải quyết. Một trong những cách đó là Percentile Scaling (hay còn gọi là Rank Scaling hoặc Quantile Scaling) là một giải pháp có thể cân nhắc đến

💡 Percentile Scaling hoạt động như thế nào ?

Phương pháp này sắp xếp toàn bộ dữ liệu của bạn từ nhỏ đến lớn và thay thế mỗi con số bằng vị trí phần trăm (percentile hay còn gọi là phân vị) của chính nó dựa trên tập huấn luyện

Lấy ví dụ trong ảnh:

📌Đầu tiên, toàn bộ các số trong tập dữ liệu được sắp xếp theo thứ tự tăng dần từ nhỏ đến lớn.

📌Tiếp theo, dãy số có thể được thể hiện thông qua phân vị ví dụ như 10% (10th) đến 90% (90th).

📌Cuối cùng, giá trị của mỗi con số sẽ được chuyển đổi và xác định dựa trên vị trí phần trăm (thứ hạng) của nó trong tập hợp, chứ không còn phụ thuộc vào độ lớn thực tế ban đầu

🔥 Các ưu điểm của phương pháp này

📌Miễn nhiễm với Outliers: Dù một giá trị ngoại lai có lớn bất thường đến mức nào, nó cũng chỉ được xếp hạng ở vị trí cao nhất (1.0). Sự chênh lệch khổng lồ về mặt độ lớn bị triệt tiêu hoàn toàn.

📌Đóng khung dữ liệu chuẩn xác: Tất cả các đặc trưng (features) tự động được giới hạn gọn gàng trong khoảng [0, 1].

📌Tạo phân phối đồng đều: Nếu tập dữ liệu Test bám sát phân phối của tập Train, dữ liệu sau khi biến đổi sẽ trải đều từ 0 đến 1, giúp các thuật toán khai thác thông tin dễ dàng hơn.

⚠️ Các điểm yếu cần thận trọng

📌Không thể "biên dịch ngược": Vì dữ liệu bị biến đổi theo thứ hạng (rank) chứ không theo công thức tỷ lệ cố định, bạn không thể khôi phục lại con số thực tế ban đầu một cách chính xác từ giá trị đã scale

📌Kém đối với dữ liệu ít sự khác biệt: Phương pháp này sẽ hoạt động rất kém hiệu quả nếu tập dữ liệu của bạn có quá ít các giá trị duy nhất (unique values) hoặc chứa lượng lớn các con số trùng lặp nhau.

👉Trên thực tế dự án của bạn đã dùng phươnng pháp này cho khâu tiền xử lý dữ liệu chưa, hãy chia sẻ về góc nhìn của bạn nhé

Ảnh: miêu tả lại cách thực hiện và gán phân vị cho dữ liệu (Nguồn: data36)

⭐PHÉP BIẾN ĐỔI YEO-JOHNSON: BẢN NÂNG CẤP HOÀN HẢO CỦA BOX-COX ?(Học máy A-Z, Tiền xử lý dữ liệu - Phần 28)❌Nếu bạn đã qu...
08/10/2026

⭐PHÉP BIẾN ĐỔI YEO-JOHNSON: BẢN NÂNG CẤP HOÀN HẢO CỦA BOX-COX ?

(Học máy A-Z, Tiền xử lý dữ liệu - Phần 28)

❌Nếu bạn đã quen dùng Box-Cox để đưa dữ liệu về dạng phân phối đối xứng hơn, chắc hẳn bạn từng gặp rắc rối vì Box-Cox không thể hoạt động với các giá trị âm. Đây chính là lúc phương pháp Yeo-Johnson phát huy tác dụng

📌Về cơ bản, Yeo-Johnson hoạt động cực kỳ giống Box-Cox

Thuật toán tìm kiếm một tham số biến đổi tối ưu lamda thông qua phương pháp ước lượng cực đại (maximum likelihood estimation) để tối ưu hóa tính phân phối chuẩn của dữ liệu.

👉Điểm khác biệt ăn tiền nhất của Yeo-Johnson là nó xử lý mượt mà cả các giá trị âm mà không gặp bất kỳ rào cản nào.

🚨Tuy nhiên tương tự Box Cox, sẽ cho bạn thấy rõ điểm yếu của phương pháp này ở trong ảnh

Khi nhìn vào ảnh, bạn sẽ thấy Yeo-Johnson hoàn toàn bất lực trước một số phân phối đặc thù. Khi áp dụng biến đổi trên dữ liệu phân bố ngẫu nhiên đồng đều (uniform) ở hàng đầu tiên, hay dữ liệu có nhiều đỉnh (bi-modal) ở hai hàng dưới, kết quả đầu ra không hề trở nên chuẩn hóa hơn.

Yeo-Johnson linh hoạt hơn Box-Cox vì nhận được cả số âm, nhưng nó không phải giải pháp có thể sửa chữa mọi loại dữ liệu. Nó chỉ thực sự mang lại phân phối chuẩn hơn nếu bản thân dữ liệu gốc có thể được làm mịn thông qua công thức toán học của nó.

Nguồn anh: Feature Engineering A-Z

⭐Vượt qua giới hạn của phép biến đổi Logarit: Tối ưu hóa biến số luỹ thừa với Box-Cox(Học máy A-Z, Tiền xử lý dữ liệu - ...
07/10/2026

⭐Vượt qua giới hạn của phép biến đổi Logarit: Tối ưu hóa biến số luỹ thừa với Box-Cox

(Học máy A-Z, Tiền xử lý dữ liệu - Phần 27)

Khi đọc về các mô hình ML, chúng ta thường nghe nhiều về kỳ vọng: "Dữ liệu đầu vào nên có phân phối chuẩn (Normal Distribution)". Thực tế thì không phải thuật toán nào cũng khắt khe đòi hỏi điều này

Tuy nhiên, việc nắn các biến số sao cho đối xứng và bớt bị lệch (skewed) luôn mang lại lợi thế lớn, giúp các mô hình học được các quy luật ẩn một cách dễ dàng và chính xác hơn.

🚨Nếu bài toán đơn giản, bạn có thể dùng phép biến đổi Logarit. Nhưng Logarit có một nhược điểm đó là nó không phải vạn năng và đôi khi không đủ sức kéo dữ liệu về trạng thái đối xứng tối ưu.

👉 Đó là lúc chúng ta cần đến một công cụ mạnh mẽ và linh hoạt hơn mang tên Box-Cox Transformation

💡 Box-Cox hoạt động như thế nào ?

Thay vì áp dụng một công thức cố định (như lấy log hay căn bậc hai), Box-Cox tự động tìm kiếm một tham số lũy thừa tối ưu (gọi là lamda). Thông qua phương pháp ước lượng cực đại (Maximum Likelihood), Box-Cox sẽ thử nghiệm để tìm ra giá trị lamda giúp biến đổi tập dữ liệu của bạn trở nên đối xứng nhất có thể.

Điểm nổi bật ở đây là bạn không cần tự mò mẫm giá trị luỹ thừa phù hợp, mà Box-Cox và thuật toán sẽ làm phần việc toán học nặng nhọc đó cho bạn

⚠️ Một số lưu ý khi sử dụng Box Cox

📌Cẩn thận trong việc rò rỉ dữ liệu (Data Leakage)

Khác với Logarit, Box-Cox là một phương pháp tiền xử lý cần được ước lượng tham số từ trước. Bạn bắt buộc phải tìm ra giá trị lamda tối ưu trên tập train. Sau đó, dùng chính giá trị lamda này để biến đổi tập test.

❌Nếu bạn áp dụng thuật toán tìm lamda trên toàn bộ dữ liệu ngay từ đầu, bạn đã vô tình để thông tin của tập Test rò rỉ vào quá trình huấn luyện

📌Không hoạt động với số âm

Box-Cox nguyên bản chỉ hoạt động với các giá trị dương. Nếu tập dữ liệu của bạn chứa số 0 hoặc số âm, bạn sẽ cần cộng thêm một hằng số (offset) hoặc chuyển sang sử dụng người anh em của nó là phương pháp Yeo-Johnson

📌Không phải phương pháp toàn năng

Box-Cox chỉ hiệu quả nếu phân phối gốc có thể được làm mịn bằng các phép biến đổi lũy thừa (như dữ liệu bị lệch trái/phải). Nếu dữ liệu của bạn phân bố hoàn toàn ngẫu nhiên (Uniform) hoặc có nhiều đỉnh, Box-Cox không những không giúp ích mà đôi khi còn làm dữ liệu bị lệch hướng hơn.

⭐Như các bạn có thể thấy, Box-Cox là một công cụ cực kỳ linh hoạt để nắn chỉnh các đặc trưng (features) dạng số, vượt trội hơn hẳn so với việc chọn bừa một phép biến đổi luỹ thừa thủ công. Hãy thử đưa nó vào pipeline tiền xử lý dữ liệu trong dự án mới nhất của bạn, nhưng hãy nhớ nguyên tắc áp dụng đúng cho tập Train/Test

👉Ảnh thể hiện kết quả biến đổi BoxCox của các phân phối dư liệu khác nhau (Nguồn ảnh và bài viết: Feature Engineering A-Z)

⭐Bản chất của phép biến đổi Logarit trong Học Máy: Khi tỷ lệ quan trọng hơn độ lớn(Học máy A-Z, Tiền xử lý dữ liệu - Phầ...
06/10/2026

⭐Bản chất của phép biến đổi Logarit trong Học Máy: Khi tỷ lệ quan trọng hơn độ lớn

(Học máy A-Z, Tiền xử lý dữ liệu - Phần 26)

✅Các thuật toán AI nhiều khi có một cách hiểu rất máy móc đó là chúng mặc định việc cộng thêm một đơn vị luôn mang lại tác động y hệt nhau dù ở bất kỳ hoàn cảnh nào

❌Vậy nên chúng ta có phép biến đổi Logarit ép mô hình phải tư duy theo tỷ lệ nhân lên thay vì phép cộng. Phép toán học này có thể ngay lập tức nắn thẳng những phân phối dữ liệu lệch phải thành thứ mà máy móc có thể dễ dàng phân tích và hiểu được

⭐Hãy thử lấy ví dụ đơn giản về việc dự đoán giá bất động sản.

Nếu bạn mở rộng thêm 50m2 cho một căn nhà nhỏ 50m2, giá trị căn nhà sẽ tăng vọt. Nhưng nếu bạn cộng thêm 50m2 đó vào một căn nhà rộng 5.000m2, sự khác biệt về giá gần như không đáng kể. Tuy nhiên, một mô hình cơ bản như hồi quy tuyến tính có thể sẽ ngây thơ đánh giá hai mức tăng "+50m2" này là hoàn toàn như nhau.

Nhưng khi bạn biến đổi dữ liệu bằng Logarit (cơ số 2), thì mọi thứ sẽ thay đổi. Mô hình không nhìn vào lượng mét vuông cộng thêm nữa, mà nhìn vào số lần nhân đôi. Mô hình giờ đây hiểu rõ rằng: sự tăng trưởng từ 50m2 lên 100m2 (gấp đôi) cũng mang lại sức mạnh tác động hệt như từ 5.000m2 lên 10.000m2

🚨Tuy nhiên như chúng ta đã biết, logarit chỉ chơi với số dương. Nếu dữ liệu của bạn chứa số 0 hoặc số âm, chỉ cần cộng thêm một hằng số nhỏ gọi là offset trước khi chạy phép biến đổi là xong.

🚨Thêm nữa sẽ chỉ có tác động tích cực lên dữ liệu bị lệch phải, nếu dữ liệu bị lệch trái hoặc không lệch thì phép biến đổi này sẽ không còn phù hợp và phải sử dụng phương pháp khác

Có lẽ bạn cũng nên thử dùng Logarit để biến đổi những phép nhân khổng lồ thành những phép cộng mượt mà và dễ đoán trong dự án mới nhất của mình thử xem và cùng chia sẻ cảm nghi của bạn dưới cmt nhé

Ảnh: Log Transformations and their Implications for Linear Regression -
Mihail Yonchev

🔥 GS. HỒ TÚ BẢO - TỪ NGƯỜI LÍNH THÀNH CỔ QUẢNG TRỊ ĐẾN LÁ CỜ TIÊN PHONG VỀ TRÍ TUỆ NHÂN TẠO(Hồ sơ học thuật - Phần 22)Hà...
04/10/2026

🔥 GS. HỒ TÚ BẢO - TỪ NGƯỜI LÍNH THÀNH CỔ QUẢNG TRỊ ĐẾN LÁ CỜ TIÊN PHONG VỀ TRÍ TUỆ NHÂN TẠO

(Hồ sơ học thuật - Phần 22)

Hành trình 50 năm của vị Giáo sư đáng kính này là một cuốn phim điện ảnh sống động. Ở đó, nhân vật chính đi từ một chàng sinh viên gác bút nghiên lên đường nhập ngũ, vào sinh ra tử tại Thành cổ Quảng Trị, cho đến khi trở thành một trong những khai quốc công thần đặt nền móng cho ngành Trí tuệ nhân tạo (AI) tại Việt Nam.

Hãy cùng lật mở cuốn biên niên sử của một người lính - người thầy - nhà khoa học lỗi lạc này

🪖CHÀNG TRINH SÁT VÀ NHIỆM VỤ "THU THẬP DỮ LIỆU" GIỮA MƯA BOM BÃO ĐẠN

Năm 1971, khi đang là sinh viên năm 2 khoa Toán trường Đại học Sư phạm Hà Nội, chàng thanh niên Hồ Tú Bảo cùng hàng nghìn trí thức trẻ miền Bắc xếp lại trang sách để lên đường nhập ngũ.

Thuộc biên chế đại đội trinh sát của Sư đoàn 325, ông đã có mặt trong 81 ngày đêm bảo vệ thị xã Quảng Trị lịch sử (1972). Nhiệm vụ của ông khi ấy là ngày đêm bám đài quan sát bên bờ sông Thạch Hãn, theo dõi hỏa lực địch và bơi qua sông giữa màn đêm để lấy tin tức từ thành cổ.

Sau này, khi đã là một chuyên gia hàng đầu về dữ liệu, ông mỉm cười nhớ lại: "Theo cách nói bây giờ, nhiệm vụ trinh sát của chúng tôi khi đó chính là thu thập dữ liệu để cấp trên ra quyết định".

Cuối năm 1973, trong một chuyến luồn sâu vào vùng địch hậu, xe chở phân đội trinh sát gặp tai nạn lao xuống vực. Đồng đội hy sinh gần hết, ông Bảo mang trên mình vết thương nghiêm trọng vỡ nát hàm dưới. Trở về cõi chết, người lính ấy xuất ngũ ra Bắc. Nhưng ông không chọn nghỉ ngơi mà chọn tiếp tục học.

💻 CÚ RẼ NGANG LỊCH SỬ VÀ NIỀM TIN VÀO THỨ "KHOA HỌC VIỄN TƯỞNG"

Trở về bục giảng, ông chuyển sang học Toán điều khiển tại Đại học Bách khoa Hà Nội. Những năm tháng sống sót sau chiến tranh khiến ông trân quý từng giây phút được học tập.

Bước ngoặt lớn nhất đến vào mùa hè năm 1984, khi ông đang học thạc sĩ tại Pháp. Giáo sư Phan Đình Diệu gửi cho ông một lá thư với lời nhắn nhủ định mệnh: "Hãy làm về Trí tuệ nhân tạo. Đó là tương lai của tin học".

Vào những năm 80, AI với thế giới vẫn là một khái niệm xa vời, mông lung như "khoa học viễn tưởng". Với một lưu học sinh Việt Nam, đó càng là một vùng đất vô tận chưa ai khai phá. Bỏ lại những nền tảng cũ, ông lao vào nghiên cứu từ con số 0. Sau 3 năm quên ăn quên ngủ, thuật toán Machine Learning (Học máy) mang tên CABRO ra đời, đánh dấu tên tuổi của một Tiến sĩ người Việt trên bản đồ khoa học.

Năm 1987, ông mang tri thức về nước và trong những đêm Hà Nội thiếu điện chập chờn, bên những chiếc máy tính hiếm hoi phải chia nhau dùng, ông cùng cộng sự đã viết ra những phần mềm xuất khẩu sang châu Âu, với chất lượng không thua kém gì các cường quốc công nghệ.

🌉 CÂY CẦU KẾT NỐI VIỆT - NHẬT VÀ TẦM NHÌN THẾ KỶ

Từ năm 1993, GS. Hồ Tú Bảo sang làm việc và trở thành giáo sư phụ trách một phòng thí nghiệm về AI tại Viện Khoa học và Công nghệ tiên tiến Nhật Bản (JAIST). Nhưng ông chưa bao giờ quên cội nguồn của mình

Trong suốt 25 năm làm việc tại xứ sở mặt trời mọc, ông đã biến mình thành cây cầu vững chắc nối liền tri thức hai nước. Hơn 200 Tiến sĩ khoa học người Việt đã được đào tạo tại JAIST dưới sự hỗ trợ và dẫn dắt của ông. Rất nhiều người trong số đó hiện đang là những trụ cột tại các trường Đại học, Viện nghiên cứu lớn trải dài từ Bắc chí Nam.

Năm 2018, ông chính thức trở về Việt Nam, mang theo trăn trở: Làm sao để doanh nghiệp Việt, sinh viên Việt ứng dụng được AI vào thực tiễn ? Cùng các đồng nghiệp, ông đã và đang đưa Phân tích kinh doanh (Business Analytics) vào giảng dạy tại các trường đại học hàng đầu, hướng tới mục tiêu bình dân hóa dữ liệu cho các doanh nghiệp vừa và nhỏ.

⭐LÒNG YÊU NƯỚC THỜI ĐẠI SỐ: DÙNG TRI THỨC ĐỂ PHỤNG SỰ

Khi được hỏi về năng lực AI của Việt Nam, GS. Bảo nhìn nhận rất thực tế. Ông cho rằng phát triển "công nghệ lõi AI" (như tạo ra mô hình như ChatGPT, phần cứng chuyên dụng) là cuộc chơi tốn kém mà ta đang đi sau. Nhưng, tạo ra SẢN PHẨM VÀ DỊCH VỤ AI ỨNG DỤNG thì người Việt cực kỳ xuất sắc, nhờ sự cần cù, thông minh và nhạy bén của thế hệ trẻ

Với ông, tinh thần cống hiến không bao giờ mất đi, nó chỉ chuyển hóa theo thời đại:
"Lòng yêu nước của thế hệ trẻ hôm nay không chỉ là ký ức lịch sử, mà là khát vọng đóng góp bằng tri thức, sáng tạo và hội nhập. Họ yêu nước bằng cách khởi nghiệp, học công nghệ mới, mang tên tuổi Việt Nam ra thế giới".

⭐Từ một trinh sát bơi qua sông Thạch Hãn dưới làn đạn pháo, đến vị Giáo sư đứng trên bục giảng về Machine Learning; từ việc thu thập dữ liệu trên chiến trường, đến việc xử lý hàng triệu điểm dữ liệu (Big Data) – GS. Hồ Tú Bảo là minh chứng sống động nhất cho một thế hệ người Việt: Kiên cường trong gian khó, và rực rỡ vươn tầm trong kỷ nguyên tri thức.

Chặng đường vạn dặm của AI Việt Nam hôm nay, chắc chắn không thể thiếu những viên gạch nền móng kiên cố mà người lính năm xưa đã lặng thầm đặt xuống.

Ảnh và nội dung được trích trong bài báo liên quan của DanTri

🔥 Tự code lại Mạng Học Sâu, GPT từ con số 0 cùng nhà sáng lập của OpenAI và cựu giám đốc Tesla(Học cùng chuyên gia - Phầ...
03/10/2026

🔥 Tự code lại Mạng Học Sâu, GPT từ con số 0 cùng nhà sáng lập của OpenAI và cựu giám đốc Tesla

(Học cùng chuyên gia - Phần 32)

❓Bạn đang lạc lối giữa một rừng tài liệu Deep Learning, nơi lý thuyết toán học quá hàn lâm và thiếu những project code thực tế

✅Đừng bỏ lỡ playlist học thuật đỉnh cao "Neural Networks: Zero to Hero" gồm 10 bài giảng từ chuyên gia Andrej Karpathy.

📌Khác biệt hoàn toàn với các khóa học thông thường, series này sẽ dẫn dắt bạn đi từ những khái niệm căn bản nhất của mạng nơ-ron và thuật toán lan truyền ngược (backpropagation) bằng cách tự tay xây dựng thư viện và mạng Học Sâu chi tiết ngay trên môi trường Jupyter Notebook.

📌Thay vì chỉ sử dụng các hàm có sẵn, bạn sẽ được hướng dẫn viết code từ con số 0 để xây dựng mô hình ngôn ngữ , tối ưu hóa Activation/Gradients, hiểu sâu cấu trúc WaveNet, và đỉnh cao là tự code lại một mô hình GPT thu nhỏ.

📌Phương pháp tiếp cận trực quan này giúp phá vỡ rào cản giữa lý thuyết toán học phức tạp và lập trình thực chiến, rất phù hợp để cộng đồng Data Science rèn luyện tư duy nền tảng sâu sắc.

Đừng chỉ dừng lại ở việc gọi hàm thư viện, hãy thực sự hiểu cách dữ liệu chảy qua từng nơ-ron trong mạng học sâu

📌 Lưu ngay tài nguyên cực và tag cả những người bạn đang có đam mê về Deep Learning vào học cùng nhé!

👉 Link playlist mình để ở phần cmt dưới bài viết gốc trên page

⭐ Trọn bộ miễn phí 150 kỹ thuật tiền xử lý dữ liệu cho Học Máy gói gọn trong chỉ 1 trang web !Nhiều nghiên cứu đã chỉ ra...
03/10/2026

⭐ Trọn bộ miễn phí 150 kỹ thuật tiền xử lý dữ liệu cho Học Máy gói gọn trong chỉ 1 trang web !

Nhiều nghiên cứu đã chỉ ra rằng: Việc thực hiện Feature Engineering (Kỹ thuật trích xuất đặc trưng) cẩn thận và tỉ mỉ thậm chí còn đóng vai trò quan trọng hơn cả bản thân thuật toán Machine Learning mà bạn lựa chọn

👉Nếu bạn đang tìm kiếm một bách khoa toàn thư cho bước này, "Feature Engineering A-Z" chính là cẩm nang hoàn hảo.

📌Tài liệu hệ thống hóa 148 kỹ thuật xử lý chuyên sâu cho mọi định dạng dữ liệu: từ Numeric, Categorical, Text, Time-Series cho đến Hình Ảnh

📌Không chỉ cung cấp công cụ từ cơ bản (Logarithms, Binning) đến nâng cao (Word2vec, BERT), tài liệu còn giúp bạn chuẩn hóa tư duy, phân biệt rõ các phương pháp "trained/untrained" để tránh lỗi rò rỉ dữ liệu

👉Lưu ngay tài liệu tuyệt vời này để nắm được toàn bộ những kĩ thuật xử lý đặc trưng hữu dụng nhất, link trang web ở dưới cmt trong bài viết gốc trên page nhé

🚨 KHI MÔ HÌNH AI CŨNG LƯƠN LẸO CHẢ KÉM GÌ CON NGƯỜI (Dựa theo nghiên cứu gần 2K trích dẫn)Hầu hết các mô hình học máy ph...
02/10/2026

🚨 KHI MÔ HÌNH AI CŨNG LƯƠN LẸO CHẢ KÉM GÌ CON NGƯỜI

(Dựa theo nghiên cứu gần 2K trích dẫn)

Hầu hết các mô hình học máy phi tuyến tính hiện nay vẫn hoạt động như những hộp đen bí ẩn, nơi sự thiếu minh bạch trong quá trình đưa ra quyết định có thể cản trở việc ứng dụng rộng rãi của chúng

🔍 VẠCH TRẦN MẸO "GIAN LẬN" CỦA AI BẰNG BẢN ĐỒ NHIỆT (LRP)

Để vạch trần các chiến lược gian lận này, nghiên cứu nổi tiếng trên tạp chí Nature Communications đã sử dụng phương pháp Lan truyền Tương quan theo Lớp (LRP - Layer-wise Relevance Propagation) để trực quan hóa bản đồ nhiệt (heatmap) thể hiện lý do đằng sau mỗi quyết định của AI

👉Dưới đây là những phát hiện thực nghiệm trong nghiên cứu

🐎 1. Nhận diện con ngựa nhờ thẻ bản quyền

Mô hình phân loại hình ảnh Fisher Vector đạt độ chính xác rất cao trên tập dữ liệu PASCAL VOC, nhưng bản đồ nhiệt LRP lại tiết lộ nó không nhìn vào con ngựa mà chỉ tập trung vào thẻ bản quyền (source tag) ở góc dưới bên trái bức ảnh

Khi xóa thẻ bản quyền này, AI không thể nhận diện được con ngựa; ngược lại, khi dán thẻ bản quyền đó vào ảnh một chiếc xe Ferrari, AI liền phán đoán ngay đó là một con ngựa ! Các bạn có thể xem ảnh đính kèm để hiểu rõ hơn

🕹️ 2. Chơi game Pinball nhờ rung bàn

Trong trò chơi Atari Pinball, mô hình mạng nơ-ron sâu đạt điểm số vượt xa con người, nhưng bản đồ nhiệt LRP cho thấy nó hoàn toàn phớt lờ các cần gạt (flippers)

Thay vì chơi theo luật, AI đã phát hiện ra lỗ hổng phần mềm bằng cách liên tục rung bàn (nudging) để quả bóng chạm vào điểm thưởng vô số lần mà không làm bàn bị khóa (tilt)

🧱 3. Học chiến lược thực sự trong Atari Breakout

Trái ngược với Pinball, ở trò chơi Atari Breakout, phương pháp LRP ghi nhận AI đã tự học được chiến lược thông minh như con người: tự đào đường hầm ở góc bàn chơi để quả bóng nảy liên tục phía sau các viên gạch

🛠️ PHÂN TÍCH TỰ ĐỘNG BẰNG SpRAy VÀ CẢNH BÁO TỪ "MẸO LỀ ẢNH"

Để phân tích tự động trên toàn bộ tập dữ liệu lớn mà không cần con người kiểm tra thủ công từng bức ảnh, nghiên cứu đã đề xuất công cụ Phân tích Tương quan Phổ (SpRAy - Spectral Relevance Analysis)

Nhờ SpRAy, các nhà nghiên cứu tiếp tục phát hiện mô hình mạng nơ-ron sâu khi nhận diện máy bay lại không nhìn vào thân máy bay, mà học vẹt từ phần lề xanh (padding) được thêm vào xung quanh ảnh do yêu cầu định dạng kỹ thuật

⭐Nghiên cứu đưa ra lời cảnh báo quan trọng rằng một mô hình AI có độ chính xác 99% không đồng nghĩa với việc nó đã thực sự thông minh hay hiểu đúng bản chất vấn đề. Việc hiểu rõ "tại sao" và "như thế nào" trong việc AI đưa ra quyết định là bước đi bắt buộc để đảm bảo tính tin cậy, sự minh bạch và tính công bằng của AI trước khi triển khai vào thực tế.

Nguồn nghiên cứu: Lapuschkin, S., Wäldchen, S., Binder, A., Montavon, G., Samek, W., & Müller, K. R. (2019). Unmasking Clever Hans predictors and assessing what machines really learn. Nature communications, 10(1), 1096.

Ảnh đính kèm minh hoạ các ví dụ trong bài viết

🚀 HIGH CORRELATION FILTER: PHƯƠNG PHÁP LỌC ĐẶC TRƯNG NHIỀU NGƯỜI DÙNG MÀ ÍT NGƯỜI HIỂU❌Trong Machine Learning, nhiều ngư...
01/10/2026

🚀 HIGH CORRELATION FILTER: PHƯƠNG PHÁP LỌC ĐẶC TRƯNG NHIỀU NGƯỜI DÙNG MÀ ÍT NGƯỜI HIỂU

❌Trong Machine Learning, nhiều người lầm tưởng nhồi nhét càng nhiều dữ liệu thì mô hình càng thông minh. Thực tế, nếu hai biến số cung cấp lượng thông tin y hệt nhau, chúng chỉ làm mô hình thêm cồng kềnh.

⭐Để giải quyết vấn đề này, High Correlation Filter (Lọc Tương Quan) ra đời để loại bỏ các đặc trưng có tính tương quan cao với nhau. Thông thường phương pháp này hay nhắc đến hệ số Pearson, nhưng bạn hoàn toàn có thể áp dụng bất kỳ phương pháp đo lường nào khác

🔹 1. Đọc vị ma trận tương quan qua ảnh thực tế
Hãy xem bức ảnh đính kèm để hiểu rõ hơn, việc xem xét ma trận tương quan luôn là bước khởi đầu vô cùng hữu ích.

📌Màu xanh dương đậm: Tương quan dương tuyệt đối (mức 1.0).
📌Màu đỏ đậm: Tương quan âm tuyệt đối (mức -1.0).

Đối chiếu các ô xanh đậm với dữ liệu, ta thấy cặp biến Garage_Cars (sức chứa ô tô) và Garage_Area (diện tích gara) có tương quan lên tới 0.890. Rõ ràng, gara càng rộng thì càng chứa được nhiều xe.

Tương tự, Gr_Liv_Area và TotRms_AbvGrd có hệ số 0.808. Các biến này tạo thành cụm đặc trưng tương quan chéo cao, việc đưa tất cả vào mô hình là một sự dư thừa.

🔹 2. Hai cách phổ biến để thanh trừng các biến dư thừa

👉 Phương pháp lặp (Iterative approach): Bạn chọn một ngưỡng (threshold) cố định, tìm cặp biến có độ tương quan cao nhất vượt ngưỡng và xóa đi một trong hai. Quá trình lặp lại liên tục đến khi không còn cặp nào vượt ngưỡng.

✅Điểm cộng: Tốn rất ít tài nguyên vì chỉ tính ma trận một lần.
❌Điểm trừ: Phải tự tinh chỉnh ngưỡng vì không biết trước mức nào tối ưu.

👉 Phương pháp phân cụm (Clustering approach): Áp dụng mô hình phân cụm lên ma trận để gom các nhóm biến tương quan cao thành từng cụm. Các biến không tương quan sẽ đứng một mình. Sau đó, trong mỗi cụm chỉ giữ lại duy nhất một biến.

✅Điểm cộng: Nắm bắt cấu trúc tổng thể tốt hơn
❌Điểm trừ: Đòi hỏi phải fit và tinh chỉnh thêm một mô hình phân cụm nữa.

⚠️ 3. Ưu và nhược điểm cần cân nhắc với correlation filter

✅ Ưu điểm: Tính toán cực nhanh, đơn giản. Giúp tạo ra mô hình tinh gọn, chạy nhanh hơn và rất dễ giải thích

❌ Nhược điểm: Khó biện luận lý do "Tại sao lại giữ biến này mà không phải biến kia?". Hơn nữa, việc loại bỏ nhiều biến dự báo luôn đi kèm rủi ro vứt nhầm tín hiệu (signal) thay vì nhiễu (noise), dẫn đến mất mát thông tin và giảm hiệu suất.

💡 Ngưỡng (threshold) bạn thường chọn khi lọc tương quan là bao nhiêu ? Cùng thảo luận dưới phần bình luận nhé! 👇

Nguồn: feaz-book

🚀 CHON LỰA ĐẶC TRƯNG CHỈ VỚI 1 PHÚT: BẠN ĐÃ BIẾT ĐẾN KỸ THUẬT LOW VARIANCE FILTER ?(Học máy A-Z, Tiền xử lý dữ liệu - Ph...
30/09/2026

🚀 CHON LỰA ĐẶC TRƯNG CHỈ VỚI 1 PHÚT: BẠN ĐÃ BIẾT ĐẾN KỸ THUẬT LOW VARIANCE FILTER ?

(Học máy A-Z, Tiền xử lý dữ liệu - Phần 24)

Trong Machine Learning, không phải cứ đưa càng nhiều đặc trưng (features) vào thì thuật toán sẽ càng thông minh. Đôi khi, những cột dữ liệu vô bổ lại chính là nguyên nhân làm tăng độ phức tạp tính toán và gây nhiễu cho mô hình.

Để xử lý bài toán này, Low Variance Filter (Lọc dựa vào phương sai) là một kỹ thuật Feature Selection đơn giản dành cho những người mới bắt đầu.

🔹 1. Bản chất của Low Variance Filter là gì?

Phương sai (Variance) đo lường mức độ phân tán của các điểm dữ liệu so với giá trị trung bình. Nếu một biến số có phương sai bằng 0 hoặc rất thấp, điều đó có nghĩa là các giá trị trong cột đó gần như không thay đổi giữa các quan sát. Một biến số không có sự biến thiên thì "có thể" không mang lại bất kỳ thông tin hữu ích nào để giúp mô hình dự đoán biến mục tiêu (target variable)

🔹 2. Ví dụ trực quan
Hãy cùng phân tích ví dụ trong bức ảnh đính kèm. Đây là một trích xuất từ tập dữ liệu gồm các biến như nhiệt độ, độ ẩm, tốc độ gió và biến mục tiêu là số lượng đếm (count).

Nếu bạn nhìn vào cột f5 được đánh dấu bằng khung đỏ đứt nét, bạn sẽ nhận thấy một điều đặc biệt đó là tất cả các hàng đều mang cùng một giá trị là 7. Vì không có bất kỳ sự thay đổi hay phân tán dữ liệu nào trong cột này, phương sai của cột f5 chắc chắn bằng 0.

Giá trị cố định này có thể sẽ không tạo ra tác động nào đến sự biến thiên của biến mục tiêu (count), do đó, ta có thể cân nhắc loại bỏ cột f5 ra khỏi pipeline huấn luyện mô hình để giảm chiều dữ liệu. Trên thực tế chúng ta có thể có một ngưỡng (threshold) về phương sai để lấy làm căn cứ loại bỏ các đặc trưng không cần thiết

🔹 3. Lưu ý trước khi áp dụng phương pháp

Kỹ thuật này rất dễ thực hiện bằng hàm .var() trong Python, nhưng có hai quy tắc cốt lõi bạn phải nhớ:

👉 Chỉ áp dụng cho dữ liệu dạng số (Numerical Variables): Đối với dữ liệu phân loại (Categorical), bạn cần xét đến phân phối tần suất thay vì phương sai.

👉 Bắt buộc phải Chuẩn hóa (Normalization): Phương sai phụ thuộc rất lớn vào phạm vi (range) của dữ liệu. Nếu không chuẩn hóa, những cột có thang đo lớn sẽ tự động có phương sai khổng lồ so với các cột có thang đo nhỏ, làm sai lệch hoàn toàn quá trình lọc.

⚠️ 4. Những mặt hạn chế của phương pháp cần đặc biệt lưu ý:

Dù đơn giản và nhanh gọn, Low Variance Filter vẫn tồn tại những nhược điểm mà chúng ta cần cân nhắc trước khi áp dụng:

📌Mất mát thông tin: Kỹ thuật này có thể vô tình loại bỏ những đặc trưng dù ít biến thiên nhưng lại chứa các tín hiệu quan trọng của tập dữ liệu.

📌Bỏ qua các mối quan hệ phi tuyến tính: Lọc phương sai ngầm giả định mối quan hệ tuyến tính giữa các biến. Phương pháp này sẽ hoạt động kém hiệu quả đối với các tập dữ liệu mà mối liên hệ giữa các feature là phi tuyến tính phức tạp.

📌Ảnh hưởng tiêu cực đến biến phụ thuộc: Nếu lỡ tay xóa bỏ các biến có sức mạnh dự báo cao đối với biến mục tiêu, hiệu suất của toàn bộ mô hình sẽ sụt giảm nghiêm trọng.

📌Gây ra thiên lệch: Việc tự động loại bỏ các biến quan trọng chỉ vì chúng có phương sai thấp có thể đưa "thiên lệch chọn mẫu" vào mô hình, làm mất đi tính khách quan của dữ liệu đầu vào.

Mọi người thường ưu tiên sử dụng phương pháp Feature Selection nào trong các bài toán dữ liệu của mình? Hãy để lại bình luận cùng thảo luận nhé! 👇

Address

Hanoi

Website

Alerts

Be the first to know and let us send you an email when Applied Data Studies - Nghiên cứu Dữ liệu Ứng dụng posts news and promotions. Your email address will not be used for any other purpose, and you can unsubscribe at any time.

Shortcuts

Share