messenger_logo
Liên hệ qua Messenger
SciEco
Bài viết.
Bài viết từ trang scienceforeconomics.com
cover
Gói deltatest vừa phát hành phiên bản 0.2.0 với hai cập nhật quan trọng: phương thức tidy() cho đối tượng deltatest và sửa lỗi tính giá trị p cho kiểm định một phía. Trước khi đi vào chi tiết, hãy nhắc lại nhanh mục đích của gói này. deltatest giải quyết bài toán gì deltatest cung cấp hàm deltatest() để thực hiện kiểm định Z hai mẫu dựa trên phương pháp Delta. Gói này thiết kế cho bối cảnh phổ biến trong thử nghiệm A/B trực tuyến: ngẫu nhiên hóa ở mức người dùng nhưng chỉ số đo lường ở đơn vị tốt hơn như lượt xem trang hoặc phiên làm việc. Trong thiết lập này, các kiểm định ngây thơ (Z-test chuẩn, kiểm định chi-bình phương, kiểm định hiệu tỷ lệ) thường thấp 추정 độ không chắc chắn vì các quan sát trong cùng một người dùng không độc lập. deltatest() khắc phục vấn đề này bằng bộ ước lượng phương sai dựa trên phương pháp Delta.
cover
Trong bối cảnh các tổ chức chính phủ và tổ chức phi lợi nhuận ngày càng cần công cụ trực quan hóa dữ liệu minh bạch, mở và bền vững, việc lựa chọn công cụ phù hợp không chỉ ảnh hưởng đến chất lượng báo cáo mà còn quyết định tính khả thi trong dài hạn. D3po và Tabler – hai dự án mã nguồn mở được phát triển bởi pacha.dev – chính là giải pháp lý tưởng cho những ai cần biểu đồ tương tác mà không lo rủi ro pháp lý từ giấy phép GPL. D3po là một gói R thay thế miễn phí cho Highcharter, với thiết kế hướng đến sự đơn giản và hiệu suất cao. Thay vì bao gồm hàng trăm tùy chọn phức tạp, D3po tập trung vào các tính năng cốt lõi: biểu đồ dạng cây (treemap), biểu đồ đường, biểu đồ cột – tất cả đều được xây dựng trên nền tảng JavaScript mạnh mẽ nhưng không yêu cầu giấy phép trả phí cho mục đích tổ chức. Điều này đặc biệt quan trọng khi các cơ quan nhà nước hoặc NGO phải tuân thủ nghiêm ngặt về nguồn gốc phần mềm. Một trong những câu hỏi thường gặp sau khi giới thiệu D3po là: Liệu có thể tạo biểu đồ treemap lồng ghép (nested treemap) không? Câu trả lời là có. Trong gói demo được cung cấp, người dùng có thể khám phá cách xây dựng cấu trúc phân cấp rõ ràng, từ cấp quốc gia đến tỉnh thành, thể hiện dữ liệu phân bổ ngân sách hoặc dân số theo từng tầng. Sự linh hoạt này giúp người dùng truyền tải thông tin phức tạp một cách trực quan mà không cần đến các công cụ thương mại đắt đỏ.
cover
Khi phân tích dữ liệu không gian, một câu hỏi thường gặp là: làm thế nào để đo lường và trực quan hóa tác động của một thay đổi tại một vị trí lan tỏa đến các vùng lân cận? Bài viết này trình bày quy trình xây dựng mô hình tự hồi quy không gian (SAR), giải thích cơ chế sinh ra hiệu ứng lan truyền, và hướng dẫn chi tiết cách tạo một ảnh động (animated GIF) minh họa quá trình này bằng Stata. Kết quả cuối cùng là một biểu đồ động cho thấy tác động của việc tăng tỷ lệ thất nghiệp tại Dallas lan rộng ra các hạt lân cận ở Texas. Mô hình tự hồi quy không gian (SAR) Giả sử chúng ta muốn nghiên cứu tỷ lệ giết người (hrate) ở các hạt Texas như một hàm của tỷ lệ thất nghiệp (unemployment). Mô hình hồi quy tuyến tính chuẩn chỉ xem xét mối quan hệ trong cùng một đơn vị quan sát: hrateᵢ = β₀ + β₁ unemploymentᵢ + εᵢ
cover
Khi học R, hầu hết mọi người tập trung vào các hàm, mô hình và trực quan hóa. Tuy nhiên, nhiều vấn đề thực tế bắt đầu sớm hơn rất nhiều — ở giai đoạn nhập dữ liệu — và kết thúc muộn hơn — ở việc xuất kết quả. Nếu dữ liệu bị đọc sai, không phương pháp thống kê nào có thể cứu vãn được phân tích. Trong bài viết này, chúng ta tập trung vào logic của việc nhập và xuất dữ liệu trong R, sử dụng tệp CSV và Excel. Thay vì học vẹt các hàm, chúng ta sẽ xây dựng một mô hình tư duy về cách R tương tác với tệp tin. Tại sao nhập xuất dữ liệu lại quan trọng
cover
Gaussian Processes và Tối Ưu Hóa Bayes: Khi Mô Hình Biết Dự Đoán Cả Trái Tim
Tháng 09/2026
Trong hành trình học hỏi về khoa học dữ liệu, có những khái niệm như thể được khắc sâu vào trí nhớ — cho đến khi bạn bất ngờ quên sạch. Nhưng rồi, khi quay lại đọc lại những dòng viết cũ, một “rãnh” nhỏ lại được khơi lại, giúp ta trôi theo dòng chảy kiến thức một cách nhẹ nhàng. Có lẽ chính vì thế mà người ta mới nói “get back in the groove” — không phải vì nhạc funk, mà vì sự trôi chảy của tư duy đã từng tồn tại. Một trong những khái niệm như thế là Gaussian Process (GP) — một công cụ mạnh mẽ trong học thống kê, đặc biệt khi đối mặt với hàm mục tiêu bí ẩn, đắt đỏ để đánh giá. Hôm nay, chúng ta sẽ cùng nhau hồi sinh lại khái niệm này, đi sâu hơn một bước vào lĩnh vực tối ưu hóa Bayes (Bayesian Optimisation) — nơi GP không chỉ mô hình hóa hàm số, mà còn lên kế hoạch cho những bước tiếp theo. Chúng ta sẽ dùng R như vũ khí chính, cùng với Stan để triển khai mô hình Bayes chính xác, và một chút code để chứng minh rằng, dù hàm là bí ẩn, ta vẫn có thể tìm ra hướng đi thông minh.
cover
Tạo gói R với mã C++ và Armadillo (video hướng dẫn)
Tháng 09/2026
Bài viết này tóm tắt nội dung video hướng dẫn cách xây dựng một gói R tích hợp mã C++ và thư viện Armadillo. Video tập trung vào quy trình trên Windows — hệ điều hành phổ biến nhất בקרב người dùng R — bắt đầu từ cài đặt R và RTools (công cụ biên dịch bắt buộc cho C++), sau đó trình bày cách sử dụng mẫu gói có sẵn kèm theo armadillo4r. Chuẩn bị môi trường trên Windows Trước khi viết bất kỳ dòng mã C++ nào, máy tính cần bộ công cụ biên dịch hoạt động. Trên Windows, nghĩa là bạn phải cài đặt RTools phiên bản tương ứng với bản R đang dùng. Video minh hoạ từng bước: Tải bản cài đặt R mới nhất từ CRAN.
cover
Dự báo bản đồ không gian bằng R: Những bài học quan trọng từ buổi chia sẻ
Tháng 09/2026
Trong thế giới dữ liệu địa không gian, việc tạo ra bản đồ dự đoán từ các điểm quan sát là một thao tác phổ biến và ngày càng dễ dàng nhờ sự phong phú của các công cụ trong R. Tuy nhiên, điều gì khiến một bản đồ “đẹp” thật sự đáng tin cậy? Chìa khóa nằm ở việc hiểu rõ ranh giới của dữ liệu, công cụ và đặc điểm của mô hình – thay vì chỉ dừng lại ở vẻ đẹp hình ảnh bên ngoài. Trong buổi thuyết trình tại nhóm người dùng R Rome (ngày 27 tháng 11 năm 2025), Jakub Nowosad đã trình bày một quy trình thực hành hiệu quả để xây dựng và đánh giá các bản đồ dự đoán không gian, sử dụng dữ liệu về đa dạng loài thực vật ở Nam Mỹ làm ví dụ. Qua đó, ông nhấn mạnh rằng: tạo bản đồ không phải là kết thúc, mà là bước khởi đầu cho một quá trình suy luận cẩn trọng. Từ điểm quan sát đến bề mặt dự đoán: Những phương pháp phổ biến Việc chuyển đổi từ tập hợp điểm dữ liệu (chẳng hạn như địa điểm ghi nhận loài thực vật) thành bản đồ liên tục – nơi mỗi vị trí trên bản đồ đều có một giá trị dự đoán – là một bài toán tiêu biểu trong phân tích không gian. Các phương pháp được ứng dụng bao gồm:
cover
Hướng dẫn phân tích và trực quan hóa dữ liệu cầu thủ nba bằng r với hoopr và ggplot2
Tháng 08/2026
Phân tích số liệu thể thao hiện đại, đặc biệt là giải bóng rổ nhà nghề Mỹ NBA, là một trong những mảng ứng dụng trực quan và cuốn hút nhất của khoa học dữ liệu. Thay vì phải tải về các tệp tin bảng tính thủ công hoặc tự viết các bộ cào dữ liệu phức tạp, hệ sinh thái ngôn ngữ R cung cấp cho người dùng những công cụ mạnh mẽ để kết nối trực tiếp với nguồn dữ liệu thể thao uy tín. Chỉ với vài dòng mã lệnh đơn giản kết hợp giữa gói hoopR và bộ công cụ tidyverse, bạn hoàn toàn có thể trích xuất các thông số thi đấu chi tiết từ ESPN và tạo ra biểu đồ xếp hạng cầu thủ chuyên nghiệp. Thiết lập môi trường và tải dữ liệu từ hoopR Gói hoopR là cầu nối dữ liệu chuyên dụng, cho phép tải toàn bộ thông tin chi tiết từng trận đấu của giải đấu một cách nhanh chóng. Để bắt đầu, chúng ta cần nạp hai thư viện nền tảng là tidyverse phục vụ cho việc xử lý cấu trúc dữ liệu và hoopR để lấy thông số cầu thủ cho mùa giải gần nhất.
cover
Mô hình hóa biến động giá bitcoin qua các điểm gãy cấu trúc: góc nhìn dữ liệu thành phần
Tháng 08/2026
Những bước tiến gần đây trong mô hình hóa chuỗi thời gian đã nhấn mạnh tầm quan trọng của các điểm gãy cấu trúc, tức những thay đổi đột ngột trong động thái cốt lõi của dữ liệu tài chính hoặc kinh tế tế vi mô. Thị trường tiền mã hóa, đặc biệt là Bitcoin, thường xuyên trải qua các cú sốc lớn dẫn đến sự thay đổi trạng thái rủi ro. Việc tiếp cận thị trường dưới góc nhìn dữ liệu thành phần kết hợp phát hiện điểm gãy giúp lượng hóa các giai đoạn biến động một cách chuẩn xác và liền mạch hơn. Bản Chất Của Điểm Gãy Cấu Trúc Trong Dữ Liệu Tài Chính Khi phân tích chuỗi thời gian, một cú sốc từ thị trường có thể làm thay đổi hoàn toàn phân phối của các chỉ số tài chính. Cách tiếp cận theo khung suy diễn Bayes giúp nắm bắt những bước chuyển dịch này thông qua ba tham số có khả năng diễn giải cao: Hướng dịch chuyển: Xác định thành phần nào trong cấu trúc tổng thể có xu hướng tăng hoặc giảm sau khi xuất hiện điểm gãy.
cover
Sức mạnh của tự động hóa trong stata: xây dựng các lệnh tùy chỉnh từ do-file
Tháng 08/2026
Tự động hóa các tác vụ phổ biến là yếu tố then chốt để phân tích dữ liệu hiệu quả. Nó không chỉ giúp bạn tiết kiệm rất nhiều thời gian khỏi việc lặp đi lặp lại cùng một chuỗi thao tác, mà còn giảm thiểu lỗi bằng cách hạn chế những gì bạn phải thực hiện thủ công. Trong bài viết này, chúng ta sẽ cùng nhau tự động hóa một tác vụ đơn giản: chuẩn hóa một biến số. Chuẩn hóa ở đây có nghĩa là trừ đi giá trị trung bình của biến số đó và chia cho độ lệch chuẩn của nó. Điều quan trọng không phải là tác vụ cụ thể chúng ta tự động hóa, mà là việc làm quen với cách thức tự động hóa các tác vụ. Cần lưu ý rằng đã có những lệnh do cộng đồng phát triển để thực hiện việc này và với độ linh hoạt cao hơn nhiều so với phương pháp chúng ta sẽ thực hiện. Bạn có thể gõ `search normalize variable` trong Stata để tìm hiểu thêm. Ngoài ra, bạn cũng có thể chuẩn hóa một biến số bằng lệnh `egen` của Stata. Tuy nhiên, mục tiêu của chúng ta là đi xa hơn thế, xây dựng hiểu biết sâu sắc về tự động hóa. Tôi giả định độc giả mới làm quen với việc tự động hóa tác vụ trong Stata. Viết Mã Lệnh Trực Tiếp (Scripting)
cover
Tối ưu hóa mã lệnh stata: củng cố các lệnh ước lượng với thư viện mata và lệnh bao bọc
Tháng 08/2026
Khi phát triển các công cụ ước lượng tùy chỉnh trong Stata, việc quản lý mã lệnh là một thách thức không nhỏ. Đặc biệt, nếu bạn xây dựng nhiều lệnh tương tự nhau, rủi ro trùng lặp mã lệnh sẽ rất cao. Mã trùng lặp không chỉ làm tăng công sức bảo trì mà còn dễ gây ra lỗi nếu bạn quên cập nhật ở tất cả các vị trí. Bài viết này sẽ giới thiệu cách củng cố mã lệnh Stata bằng cách sử dụng thư viện Mata để chia sẻ các hàm Mata và lệnh bao bọc (wrapper command) để chia sẻ mã ado-command. Phương pháp này giúp mã lệnh của bạn gọn gàng, dễ quản lý và mạnh mẽ hơn. Lệnh Ado cho Mô Hình Kỳ Vọng Có Điều Kiện Hàm Mũ (ECM) và Probit (PCM) Chúng ta hãy xem xét hai lệnh ado-command ước lượng tham số của mô hình kỳ vọng có điều kiện hàm mũ (ECM) và mô hình kỳ vọng có điều kiện Probit (PCM) bằng phương pháp bình phương nhỏ nhất phi tuyến tính (NLS). Ban đầu, các lệnh này được viết riêng lẻ. Lệnh Mynlexp1.ado
cover
Giải thích dự báo chuỗi thời gian với giá trị shapley chính xác trong r
Tháng 08/2026
Trong học máy có giám sát, giá trị Shapley là phương pháp tiêu chuẩn để đo lường mức độ đóng góp của từng biến giải thích vào kết quả dự đoán của mô hình. Tuy nhiên, việc áp dụng giá trị Shapley vào bài toán chuỗi thời gian có biến ngoại sinh lại ít phổ biến hơn dù mang lại giá trị thực tiễn rất cao. Bài viết này sẽ hướng dẫn bạn cách tính toán và trực quan hóa giá trị Shapley chính xác nhằm bóc tách các kịch bản dự báo chuỗi thời gian thông qua mô hình dynrmf trong gói ahead của R. Bản chất của giá trị Shapley trong bài toán chuỗi thời gian Giá trị Shapley bắt nguồn từ lý thuyết trò chơi hợp tác, phân chia phần thưởng công bằng cho các bên tham gia dựa trên đóng góp cận biên của họ. Khi chuyển giao sang dự báo chuỗi thời gian, mỗi biến hồi quy đóng vai trò như một người chơi cùng tác động lên giá trị dự báo tương lai. Thông thường, việc tính toán giá trị Shapley đòi hỏi xấp xỉ vì độ phức tạp hàm mũ khi số lượng biến tăng lên. Tuy nhiên, trong phân tích kinh tế lượng và chuỗi thời gian vĩ mô, số lượng biến hồi quy bên ngoài thường khá nhỏ, thường dưới 15 biến. Điều này cho phép chúng ta tính toán trực tiếp giá trị Shapley chính xác mà không cần xấp xỉ, đảm bảo tính toàn vẹn và độ tin cậy tuyệt đối cho phân tích kịch bản.
cover
Tích hợp stata và python: hướng dẫn thu thập dữ liệu từ api và xử lý định dạng json
Tháng 08/2026
Dữ liệu hiện diện ở khắp mọi nơi trong kỷ nguyên số. Rất nhiều cơ quan chính phủ, tổ chức tài chính, trường đại học và nền tảng mạng xã hội cung cấp quyền truy cập vào kho dữ liệu của họ thông qua giao diện lập trình ứng dụng API. Các API này thường phản hồi và trả về dữ liệu dưới định dạng JSON. Trong bài viết này, chúng ta sẽ cùng khám phá cách tận dụng sức mạnh của Python ngay bên trong Stata để gửi yêu cầu truy xuất dữ liệu qua API, bóc tách cấu trúc dữ liệu JSON lồng nhau và chuyển đổi thành tập dữ liệu Stata sẵn sàng cho phân tích. Tìm hiểu về API và cấu trúc dữ liệu JSON Một API cho phép hệ thống này yêu cầu và nhận dữ liệu từ một hệ thống máy tính khác. Cú pháp của mỗi API có thể khác biệt tùy theo nhà cung cấp, nhưng thông thường cấu trúc truy vấn sẽ bao gồm một đường dẫn URL gốc đi kèm các tham số điều kiện. Chẳng hạn, đường dẫn dưới đây sử dụng openFDA API để truy xuất thông tin về các biến cố bất lợi của thuốc từ Cục Quản lý Thực phẩm và Dược phẩm Hoa Kỳ:
cover
Bùng nổ home run trong bóng chày: trực quan hóa dữ liệu cùng r
Tháng 08/2026
Bóng chày luôn không ngừng biến đổi qua thời gian, nhưng ít có xu hướng nào thể hiện sự chuyển mình rõ rệt như sự gia tăng của những cú home run. Một thế kỷ trước, việc ghi được vài cú home run trong cả mùa giải đã là thành tích đáng kinh ngạc. Ngày nay, đó lại là kỳ vọng tối thiểu đối với mỗi đội bóng. Nhờ sự cải tiến trong huấn luyện, kỹ thuật phân tích dữ liệu và thậm chí là sự thay đổi cấu trúc quả bóng, số lượng home run đã tăng vọt qua từng mốc lịch sử. Hãy cùng khám phá câu chuyện này qua dữ liệu giải bóng chày chuyên nghiệp Mỹ từ năm 1901 đến nay bằng ngôn ngữ lập trình R. Chuẩn bị và xử lý dữ liệu lịch sử với Lahman Để thực hiện bài phân tích, chúng ta sử dụng bộ dữ liệu Lahman, một trong những cơ sở dữ liệu lịch sử toàn diện nhất về bóng chày. Dữ liệu chứa thông tin chi tiết về từng mùa giải, đội bóng và cầu thủ qua hơn một thế kỷ.
cover
Tích hợp stata/python: dùng giao diện chức năng của stata (sfi) để sao chép dữ liệu từ stata sang python
Tháng 08/2026
Trong các bài viết trước, chúng ta đã sử dụng phương thức `read_stata()` để đọc toàn bộ các tập dữ liệu của Stata vào các data frame của pandas. Điều này hoạt động hiệu quả khi bạn muốn đọc toàn bộ một tập dữ liệu của Stata vào Python. Tuy nhiên, đôi khi chúng ta muốn đọc một tập con của các biến số hoặc các quan sát, hoặc cả hai, từ một tập dữ liệu của Stata vào Python. Bài viết này sẽ giới thiệu mô-đun Giao diện Chức năng của Stata (SFI) và chỉ cho bạn cách sử dụng nó để đọc các tập dữ liệu một phần vào một data frame của pandas. Nếu bạn chưa quen với Python, việc tham khảo bốn bài viết đầu tiên trong chuỗi tích hợp Stata/Python có thể hữu ích trước khi tiếp tục. Sử Dụng Mô-đun SFI Để Chuyển Dữ Liệu Từ Stata Sang Python SFI là một mô-đun Python cho phép bạn truyền thông tin qua lại giữa Stata và Python. Bạn có thể sao chép toàn bộ hoặc một phần các tập dữ liệu, data frame, macro cục bộ và toàn cục, scalar và ma trận, thậm chí cả ma trận Mata toàn cục. Có quá nhiều tính năng để trình bày trong một bài blog. Vì vậy, hôm nay chúng ta sẽ tìm hiểu một tính năng mà bạn có thể sẽ sử dụng: đọc các tập dữ liệu Stata một phần vào Python. Chúng ta sẽ khám phá thêm các tính năng khác của SFI trong các bài viết sau.
cover
Tích hợp stata và python phần 4: hướng dẫn sử dụng các thư viện python trong stata
Tháng 08/2026
Trong bài viết trước, chúng ta đã tìm hiểu cách cài đặt các thư viện Python bằng pip. Hôm nay, chúng ta sẽ đi sâu vào những thao tác cơ bản nhất để nạp và sử dụng các thư viện này ngay trong môi trường Stata. Thông qua các ví dụ thực hành với thư viện pandas, bài viết sẽ giúp bạn nắm vững những khái niệm quan trọng cùng cú pháp cốt lõi có thể áp dụng cho hầu hết thư viện Python hiện nay. Kiểm tra và nạp thư viện Python Thư viện pandas là một công cụ rất phổ biến dùng để xử lý, nhập và xuất dữ liệu trong Python. Thư viện này chứa nhiều module khác nhau phục vụ công việc tương tác với các cấu trúc dữ liệu như series hay data frame. Trước tiên, bạn có thể kiểm tra xem pandas đã được cài đặt trên hệ thống hay chưa bằng câu lệnh sau trong Stata:
cover
Các kiểm định thống kê gần đúng để so sánh tỷ lệ lỗi của bộ phân loại nhị phân sử dụng h2oml
Tháng 07/2026
Bạn vừa huấn luyện một máy tăng cường gradient (GBM) và một bộ phân loại rừng ngẫu nhiên (RF) trên dữ liệu của mình bằng cách sử dụng bộ lệnh h2oml mới của Stata. Mô hình GBM của bạn đạt độ chính xác 87% trên dữ liệu kiểm định, trong khi mô hình RF đạt 85%. Có vẻ như GBM là bộ phân loại ưu tiên, phải không? Khoan đã. Tại Sao Độ Chính Xác Thôi Là Chưa Đủ Độ chính xác, diện tích dưới đường cong, và sai số căn bậc hai trung bình là những chỉ số phổ biến, nhưng chúng chỉ cung cấp các ước lượng điểm. Những con số này phản ánh mức độ tốt của một mô hình khi hoạt động trên một mẫu kiểm định cụ thể, nhưng chúng không tính đến biến thiên có thể phát sinh từ mẫu này sang mẫu khác. Nói cách khác, chúng không trả lời câu hỏi cốt lõi này: liệu sự khác biệt về hiệu suất giữa các phương pháp này có duy trì ở cấp độ tổng thể, hay nó chỉ có thể xảy ra do ngẫu nhiên trong tập dữ liệu kiểm định cụ thể này? Khi so sánh các phương pháp như GBM và RF, một vài phần trăm điểm khác biệt về hiệu suất có thể chưa đủ thuyết phục. Nếu không xem xét mức độ kết quả có thể thay đổi trên các mẫu khác nhau, thật khó để biết liệu một phương pháp có liên tục vượt trội hơn phương pháp kia hay liệu sự khác biệt quan sát được chỉ là sản phẩm của biến thiên ngẫu nhiên trong dữ liệu. Các kiểm định thống kê là yếu tố cần thiết trong vấn đề này, vì chúng cung cấp một khuôn khổ để đánh giá liệu các khác biệt quan sát được có khả năng tồn tại trong tổng thể hay không.
cover
Tích hợp stata và python phần 3: cách cài đặt các thư viện python
Tháng 07/2026
Trong bài viết trước, chúng ta đã khám phá ba phương pháp cơ bản để thực thi mã Python trực tiếp trong Stata. Mặc dù các ví dụ ban đầu khá đơn giản, chúng đã tạo nền tảng vững chắc để bạn bắt đầu kết hợp hai công cụ này. Tuy nhiên, sức mạnh thực sự của Python lại đến từ hệ sinh thái hàng nghìn thư viện mã nguồn mở phong phú. Bài viết này sẽ hướng dẫn bạn chi tiết cách quản lý, tải xuống và cài đặt các thư viện Python để mở rộng tối đa khả năng xử lý dữ liệu trong Stata. Kiểm tra cấu hình Python trong Stata Trước khi tiến hành cài đặt các gói mở rộng, chúng ta cần xác nhận rằng Python đã được tích hợp chính xác vào hệ thống và Stata đã sẵn sàng làm việc với môi trường này. Từ cửa sổ lệnh của Stata, bạn hãy chạy lệnh kiểm tra cấu hình:
cover
Bảng biểu tuỳ chỉnh trong stata 17: quản lý và thiết kế chuyên nghiệp với lệnh collect
Tháng 07/2026
Khi trình bày kết quả nghiên cứu, việc tạo ra các bảng biểu trực quan và đúng chuẩn xuất bản là tiêu chí vô cùng quan trọng. Trong các phiên bản Stata trước đây, việc định dạng bảng thường đòi hỏi nhiều thao tác thủ công hoặc chỉnh sửa lại trên các phần mềm xử lý văn bản. Stata 17 đã giải quyết triệt để thách thức này bằng hệ thống lệnh collect, cho phép người dùng tùy biến toàn bộ cấu trúc, nhãn hiển thị, đường viền và xuất bảng trực tiếp sang các định dạng tài liệu phổ biến. Khởi đầu với bảng thống kê cơ bản Để hiểu rõ cơ chế hoạt động của collect, hãy bắt đầu bằng việc tạo một bảng thống kê mô tả cơ bản kết hợp giữa hai biến số giới tính và huyết áp cao. Lệnh table dưới đây thu thập các thông số bao gồm tần suất, tỷ lệ phần trăm, giá trị trung bình và độ lệch chuẩn của tuổi tác.
cover
Tạo bảng tùy chỉnh cho nhiều mô hình hồi quy trong stata 17: sức mạnh của bộ lệnh collect
Tháng 07/2026
Việc trình bày kết quả từ nhiều mô hình hồi quy khác nhau trên cùng một bảng dữ liệu là yêu cầu thường gặp trong các báo cáo nghiên cứu khoa học. Trong Stata 17, thay vì phải sao chép thủ công hoặc sử dụng các công cụ bên ngoài, bạn có thể tận dụng bộ lệnh collect để tự động hóa hoàn toàn quy trình này. Bài viết này sẽ hướng dẫn bạn cách xây dựng một bảng so sánh kết quả của ba mô hình hồi quy logistic, tích hợp các tiêu chí thông tin và xuất trực tiếp sang định dạng tài liệu PDF chuyên nghiệp. Khởi động với bộ dữ liệu sức khỏe quốc gia Để bắt đầu hành trình, chúng ta sẽ mở bộ dữ liệu khảo sát sức khỏe và dinh dưỡng quốc gia bằng lệnh webuse. Sau đó, chúng ta kiểm tra các biến số cần thiết bao gồm huyết áp cao, tuổi, giới tính và tình trạng tiểu đường.
cover
Chế ngự biến động: dự báo hiệu suất cao cho chỉ số stoxx 600 bằng h2o automl
Tháng 07/2026
Dự báo các thị trường tài chính, ví dụ như chỉ số STOXX Europe 600, là một thử thách kinh điển trong ngành khoa học dữ liệu. Dữ liệu tài chính vốn dĩ chứa nhiều nhiễu, không dừng và cực kỳ nhạy cảm trước các sự kiện thị trường đột ngột. Để giải quyết vấn đề này, chúng ta có thể áp dụng học máy tự động, cụ thể là khung làm việc hiệu năng cao của H2O kết hợp cùng hệ sinh thái modeltime trong ngôn ngữ R. Bài viết này phân tích chi tiết toàn bộ quy trình vận hành học máy từ khâu thu thập dữ liệu, kỹ nghệ đặc trưng cho đến huấn luyện và đánh giá mô hình thực tế để tìm ra giải pháp tối ưu trước sự biến động của thị trường. Quy Trình Dự Báo Và Xây Dựng Tập Đặc Trưng Chiến lược cốt lõi ở đây là chuyển đổi bài toán chuỗi thời gian đơn biến thành bài toán học máy có giám sát bằng cách tạo ra các biến dự báo có giá trị giải thích cao. Thu thập và phân chia dữ liệu
cover
Tự hồi quy véc-tơ — mô phỏng, ước lượng và suy diễn trong stata
Tháng 07/2026
Mô hình tự hồi quy véc-tơ là một công cụ mạnh mẽ và phổ biến để phân tích động thái của nhiều chuỗi thời gian cùng lúc. Mô hình này biểu diễn một véc-tơ gồm các biến quan sát dưới dạng một hàm số theo các trễ của chính chúng. Trong bài viết này, chúng ta sẽ tìm hiểu cách mô phỏng dữ liệu từ một quy trình tự hồi quy véc-tơ bậc hai với hai biến số, tiến hành ước lượng tham số bằng Stata và thực hiện suy diễn thống kê thông qua các hàm phản ứng đẩy. Mô phỏng dữ liệu Hãy bắt đầu bằng việc mô phỏng một quy trình tự hồi quy véc-tơ bậc hai với hai biến số. Phương trình tổng quát có dạng hệ phương trình tuyến tính, trong đó các biến hiện tại phụ thuộc vào giá trị trễ bậc một và bậc hai của chính chúng và biến còn lại, cộng với một véc-tơ nhiễu trắng tuân theo phân phối chuẩn đa biến với trung bình bằng không và ma trận hiệp phương sai cho trước. Chúng ta thiết lập kích thước mẫu ban đầu là 1100 quan sát, sau đó tạo biến thời gian và các biến chứa chuỗi quan sát cũng như các biến nhiễu.
cover
Cách tự động hóa thu thập dữ liệu twitter trực tiếp vào phần mềm stata
Tháng 07/2026
Trong nghiên cứu khoa học dữ liệu và phân tích mạng xã hội, việc thu thập dữ liệu thực tế từ các nền tảng trực tuyến đóng vai trò vô cùng quan trọng. Trước đây, nhiều người dùng thường thắc mắc liệu phần mềm Stata có khả năng nhập trực tiếp dữ liệu từ mạng xã hội Twitter hay không. Để giải quyết nhu cầu này, việc phát triển các lệnh mở rộng tận dụng giao diện lập trình ứng dụng Java cải tiến trên các phiên bản Stata hiện đại đã mang lại lời giải hoàn hảo. Bài viết này sẽ hướng dẫn bạn cách sử dụng công cụ twitter2stata để kết nối, xác thực và khai thác dữ liệu từ Twitter về môi trường làm việc Stata một cách nhanh chóng. Cài đặt công cụ twitter2stata Trước khi tiến hành khai thác thông tin, bạn cần thực hiện cài đặt bộ công cụ này trực tiếp từ kho lưu trữ SSC của cộng đồng Stata. Hãy mở phần mềm và chạy dòng lệnh sau trong cửa sổ dòng lệnh.
cover
Phân tích văn bản trong r với quanteda (phần 1)
Tháng 07/2026
Trong kỷ nguyên dữ liệu lớn, khả năng trích xuất thông tin có giá trị từ dữ liệu văn bản phi cấu trúc là một kỹ năng vô cùng quan trọng đối với các nhà khoa học dữ liệu. Dù là phân tích phản hồi của khách hàng, nghiên cứu tin tức hay khám phá các chủ đề trong tài liệu khoa học, phân tích văn bản cung cấp cái nhìn sâu sắc giúp định hình các quyết định kinh doanh và nghiên cứu. Bài viết này sẽ giới thiệu bạn đến với `quanteda`, một gói phần mềm mạnh mẽ và hiệu quả trong R, được thiết kế đặc biệt cho việc phân tích văn bản. Đây là phần đầu tiên trong chuỗi bài viết, tập trung vào các khái niệm cơ bản và các bước tiền xử lý chính. Các Gói Phần Mềm Cần Thiết Nắm Vững Kiến Thức Cơ Bản Về Phân Tích Văn Bản
cover
Trích xuất dữ liệu nba bằng lệnh nba2stata trong stata
Tháng 07/2026
Việc tiếp cận và phân tích dữ liệu thể thao chuyên nghiệp đã trở nên dễ dàng hơn bao giờ hết nhờ vào các công cụ web scraping mạnh mẽ. Trong lĩnh vực khoa học dữ liệu, Stata nổi bật là một phần mềm thống kê mạnh mẽ, và khi kết hợp với các lệnh tùy chỉnh như `nba2stata`, nó cho phép các nhà phân tích nhanh chóng thu thập và khám phá các bộ dữ liệu phức tạp. Lệnh `nba2stata` được thiết kế để trích xuất dữ liệu từ https://stats.nba.com, cung cấp một cầu nối trực tiếp để nghiên cứu các khía cạnh khác nhau của bóng rổ chuyên nghiệp. Tuy nhiên, điều quan trọng cần lưu ý là kể từ tháng 11 năm 2019, lệnh này không còn hoạt động do các hạn chế từ https://stats.nba.com. Khái Quát Về nba2stata Lệnh `nba2stata` được phát triển bởi Chris Hassell, người trước đó đã hoàn thành lệnh `nfl2stata`. Đây là một công cụ hữu ích cho những ai muốn phân tích dữ liệu bóng rổ chuyên nghiệp trực tiếp trong môi trường Stata. Để cài đặt lệnh này, người dùng cần chạy dòng lệnh sau trong Stata:
cover
Giới thiệu về thống kê bayes phần 2: mcmc và thuật toán metropolis-hastings
Tháng 07/2026
Trong bài viết này, chúng ta sẽ cùng tìm hiểu một cách trực quan và dễ tiếp cận về phương pháp chuỗi Markov Monte Carlo, thường được gọi tắt là MCMC. Đây là công cụ được sử dụng rất phổ biến để khớp các mô hình thống kê Bayes. MCMC có nhiều biến thể khác nhau, nhưng nội dung hôm nay sẽ tập trung sâu vào thuật toán Metropolis-Hastings. Để giữ cho bài viết ngắn gọn và trực quan, một số chi tiết kỹ thuật chuyên sâu sẽ được lược bớt. Bạn nên tham khảo tài liệu hướng dẫn sử dụng phân tích Bayes của Stata để có thêm thông tin chi tiết trước khi áp dụng vào thực tế. Hãy tiếp tục với ví dụ tung đồng xu từ phần trước về các khái niệm cơ bản của thống kê Bayes. Mục tiêu của chúng ta là tìm ra phân phối hậu nghiệm của tham số theta, đại diện cho xác suất đồng xu xuất hiện mặt ngửa. Phân phối tiền nghiệm được lựa chọn là phân phối beta phẳng, không mang thông tin với các tham số là 1 và 1. Chúng ta sẽ sử dụng hàm hợp lý nhị thức để định lượng dữ liệu thực nghiệm thu được từ quá trình tung đồng xu, cụ thể là có 4 lần ngửa trong tổng số 10 lần tung. Chúng ta có thể áp dụng phương pháp MCMC kết hợp thuật toán Metropolis-Hastings để tạo ra một mẫu ngẫu nhiên từ phân phối hậu nghiệm của theta. Từ mẫu thu được này, việc ước lượng các đặc trưng như giá trị trung bình của phân phối hậu nghiệm sẽ trở nên dễ dàng. Kỹ thuật này được cấu thành từ ba phần cơ bản bao gồm phương pháp Monte Carlo, chuỗi Markov và thuật toán Metropolis-Hastings.
cover
[[img_1]]: image 1
Tháng 07/2026
SO SÁNH NHÓM TRONG MÔ HÌNH PHƯƠNG TRÌNH CẤU TRÚC: KIỂM ĐỊNH TÍNH BẤT BIẾN ĐO LƯỜNG Khi xây dựng hầu hết các mô hình thống kê, chúng ta thường quan tâm đến việc liệu các tham số có sự khác biệt giữa các nhóm đối tượng hay không, ví dụ như giữa các thời kỳ, nhóm tuổi, giới tính hoặc trường học. Nói cách khác, chúng ta muốn kiểm định vai trò điều tiết khi biến điều tiết là một biến phân loại. Đối với mô hình hồi quy, việc này vô cùng đơn giản bằng cách đưa các biến chỉ báo nhóm vào mô hình và cho chúng tương tác với các biến dự báo khác. Chúng ta cũng có những giả thuyết tương tự về sự khác biệt tham số giữa các nhóm khi thực hiện ước lượng mô hình phương trình cấu trúc. Khi các mô hình này chứa các biến ẩn và các biến quan sát tương ứng, chúng ta có thể kiểm định xem các phép đo lường đó có đồng nhất giữa các nhóm hay không. Quá trình đánh giá tính bất biến đo lường (measurement invariance) thường bao gồm một chuỗi các kiểm định về tính bằng nhau của các hệ số đo lường, tính bằng nhau của các hệ số chặn và tính bằng nhau của các phương sai sai số giữa các nhóm đối tượng. Trong bài viết này, chúng tôi sẽ hướng dẫn cách sử dụng tùy chọn group và ginvariant của lệnh sem, cùng với lệnh hậu ước lượng estat ginvariant trong phần mềm Stata để thực hiện các kiểm định tính bất biến đo lường một cách nhanh chóng và chính xác.
cover
Sử dụng lệnh margins trong stata với các dạng hàm khác nhau: thay đổi tỷ lệ và thay đổi logarith tự nhiên
Tháng 07/2026
Lệnh margins là một công cụ mạnh mẽ trong phần mềm Stata giúp chúng ta tính toán các giá trị dự báo, sai số cận biên và tác động cận biên. Điểm đặc biệt là lệnh này có thể xử lý hầu như mọi dạng hàm của các tham số ước lượng thông qua tùy chọn expression. Bài viết này sẽ hướng dẫn bạn cách xác định mức thay đổi tỷ lệ của biến kết quả khi các biến độc lập thay đổi, sử dụng cả hai phương pháp cho mô hình tuyến tính và phi tuyến tính. Mô hình tuyến tính với biến nhị phân Sau khi ước lượng một mô hình hồi quy tuyến tính với kỳ vọng của y khi biết x bằng a cộng b nhân x, chúng ta có thể ước lượng mức thay đổi tỷ lệ của các giá trị dự báo đối với sự thay đổi của x, hay còn gọi là bán co giãn, bằng lệnh margins kèm tùy chọn eydx. Công thức tính bán co giãn sẽ khác nhau tùy thuộc vào việc x là biến liên tục hay biến rời rạc. Nếu x là biến liên tục, trị số eydx được tính bằng đạo hàm của logarith tự nhiên của y dự báo theo x, bằng đạo hàm của y theo x nhân với một phần y dự báo, và bằng hệ số b chia cho y dự báo.
cover
Ước lượng mô hình svar với ràng buộc dài hạn trên stata
Tháng 06/2026
Mô hình hồi quy tự vectơ cấu trúc là một công cụ mạnh mẽ trong kinh tế lượng vĩ mô, giúp chúng ta nhận diện các cú sốc kinh tế và đánh giá tác động của chúng qua thời gian. Trong bài viết này, chúng ta sẽ tìm hiểu cách thiết lập các ràng buộc dài hạn trong mô hình này bằng cách tái hiện lại nghiên cứu kinh điển của hai tác giả Blanchard và Quah năm 1989 trên phần mềm Stata. Khung Lý Thuyết Cơ Bản Trong các nghiên cứu trước đây về hồi quy tự vectơ cấu trúc, việc nhận diện các tham số thường dựa trên các ràng buộc ngắn hạn, tức là cách các cú sốc tác động ngay lập tức lên các biến nội sinh tại thời điểm xảy ra cú sốc. Ngược lại, Blanchard và Quah đạt được sự nhận diện bằng cách áp dụng các ràng buộc lên tác động dài hạn của các cú sốc, tức là phản ứng giới hạn của một biến nội sinh khi thời gian tiến về vô hạn. Trong một hệ hồi quy tự vectơ dừng, phản ứng của mỗi biến đối với từng cú sốc phải tiến về không trong dài hạn. Blanchard và Quah phân tích một hệ thống gồm tổng sản phẩm quốc gia thực tế GNP và tỷ lệ thất nghiệp, trong đó tốc độ tăng trưởng GNP và mức thất nghiệp được giả định là các chuỗi dừng. Hệ thống này có hai cú sốc là cú sốc cung và cú sốc cầu. Phản ứng dài hạn của tăng trưởng GNP và thất nghiệp đối với các cú sốc này phải bằng không vì các biến này là dừng.
SciEco
Science for Economics
Định hướng đào tạo phân tích dữ liệu, xây dựng chính sách, tối ưu hoá danh mục tài chính cá nhân và dự báo thị trường.
Liên hệ
Địa chỉ: Số 60, ngõ 41, Phố Thái Hà, Trung Liệt, Đống Đa, Hà Nội (Google Map)
Email: [email protected]
Hotline: 03.57.94.7680 (Mrs. Hà)
Mạng xã hội