messenger_logo
Liên hệ qua Messenger
SciEco
Bài viết.
Bài viết từ trang scienceforeconomics.com
cover
Trong các bài viết trước, chúng ta đã sử dụng phương thức `read_stata()` để đọc toàn bộ các tập dữ liệu của Stata vào các data frame của pandas. Điều này hoạt động hiệu quả khi bạn muốn đọc toàn bộ một tập dữ liệu của Stata vào Python. Tuy nhiên, đôi khi chúng ta muốn đọc một tập con của các biến số hoặc các quan sát, hoặc cả hai, từ một tập dữ liệu của Stata vào Python. Bài viết này sẽ giới thiệu mô-đun Giao diện Chức năng của Stata (SFI) và chỉ cho bạn cách sử dụng nó để đọc các tập dữ liệu một phần vào một data frame của pandas. Nếu bạn chưa quen với Python, việc tham khảo bốn bài viết đầu tiên trong chuỗi tích hợp Stata/Python có thể hữu ích trước khi tiếp tục. Sử Dụng Mô-đun SFI Để Chuyển Dữ Liệu Từ Stata Sang Python SFI là một mô-đun Python cho phép bạn truyền thông tin qua lại giữa Stata và Python. Bạn có thể sao chép toàn bộ hoặc một phần các tập dữ liệu, data frame, macro cục bộ và toàn cục, scalar và ma trận, thậm chí cả ma trận Mata toàn cục. Có quá nhiều tính năng để trình bày trong một bài blog. Vì vậy, hôm nay chúng ta sẽ tìm hiểu một tính năng mà bạn có thể sẽ sử dụng: đọc các tập dữ liệu Stata một phần vào Python. Chúng ta sẽ khám phá thêm các tính năng khác của SFI trong các bài viết sau.
cover
Trong bài viết trước, chúng ta đã tìm hiểu cách cài đặt các thư viện Python bằng pip. Hôm nay, chúng ta sẽ đi sâu vào những thao tác cơ bản nhất để nạp và sử dụng các thư viện này ngay trong môi trường Stata. Thông qua các ví dụ thực hành với thư viện pandas, bài viết sẽ giúp bạn nắm vững những khái niệm quan trọng cùng cú pháp cốt lõi có thể áp dụng cho hầu hết thư viện Python hiện nay. Kiểm tra và nạp thư viện Python Thư viện pandas là một công cụ rất phổ biến dùng để xử lý, nhập và xuất dữ liệu trong Python. Thư viện này chứa nhiều module khác nhau phục vụ công việc tương tác với các cấu trúc dữ liệu như series hay data frame. Trước tiên, bạn có thể kiểm tra xem pandas đã được cài đặt trên hệ thống hay chưa bằng câu lệnh sau trong Stata:
cover
Bạn vừa huấn luyện một máy tăng cường gradient (GBM) và một bộ phân loại rừng ngẫu nhiên (RF) trên dữ liệu của mình bằng cách sử dụng bộ lệnh h2oml mới của Stata. Mô hình GBM của bạn đạt độ chính xác 87% trên dữ liệu kiểm định, trong khi mô hình RF đạt 85%. Có vẻ như GBM là bộ phân loại ưu tiên, phải không? Khoan đã. Tại Sao Độ Chính Xác Thôi Là Chưa Đủ Độ chính xác, diện tích dưới đường cong, và sai số căn bậc hai trung bình là những chỉ số phổ biến, nhưng chúng chỉ cung cấp các ước lượng điểm. Những con số này phản ánh mức độ tốt của một mô hình khi hoạt động trên một mẫu kiểm định cụ thể, nhưng chúng không tính đến biến thiên có thể phát sinh từ mẫu này sang mẫu khác. Nói cách khác, chúng không trả lời câu hỏi cốt lõi này: liệu sự khác biệt về hiệu suất giữa các phương pháp này có duy trì ở cấp độ tổng thể, hay nó chỉ có thể xảy ra do ngẫu nhiên trong tập dữ liệu kiểm định cụ thể này? Khi so sánh các phương pháp như GBM và RF, một vài phần trăm điểm khác biệt về hiệu suất có thể chưa đủ thuyết phục. Nếu không xem xét mức độ kết quả có thể thay đổi trên các mẫu khác nhau, thật khó để biết liệu một phương pháp có liên tục vượt trội hơn phương pháp kia hay liệu sự khác biệt quan sát được chỉ là sản phẩm của biến thiên ngẫu nhiên trong dữ liệu. Các kiểm định thống kê là yếu tố cần thiết trong vấn đề này, vì chúng cung cấp một khuôn khổ để đánh giá liệu các khác biệt quan sát được có khả năng tồn tại trong tổng thể hay không.
cover
Trong bài viết trước, chúng ta đã khám phá ba phương pháp cơ bản để thực thi mã Python trực tiếp trong Stata. Mặc dù các ví dụ ban đầu khá đơn giản, chúng đã tạo nền tảng vững chắc để bạn bắt đầu kết hợp hai công cụ này. Tuy nhiên, sức mạnh thực sự của Python lại đến từ hệ sinh thái hàng nghìn thư viện mã nguồn mở phong phú. Bài viết này sẽ hướng dẫn bạn chi tiết cách quản lý, tải xuống và cài đặt các thư viện Python để mở rộng tối đa khả năng xử lý dữ liệu trong Stata. Kiểm tra cấu hình Python trong Stata Trước khi tiến hành cài đặt các gói mở rộng, chúng ta cần xác nhận rằng Python đã được tích hợp chính xác vào hệ thống và Stata đã sẵn sàng làm việc với môi trường này. Từ cửa sổ lệnh của Stata, bạn hãy chạy lệnh kiểm tra cấu hình:
cover
Bảng biểu tuỳ chỉnh trong stata 17: quản lý và thiết kế chuyên nghiệp với lệnh collect
Tháng 07/2026
Khi trình bày kết quả nghiên cứu, việc tạo ra các bảng biểu trực quan và đúng chuẩn xuất bản là tiêu chí vô cùng quan trọng. Trong các phiên bản Stata trước đây, việc định dạng bảng thường đòi hỏi nhiều thao tác thủ công hoặc chỉnh sửa lại trên các phần mềm xử lý văn bản. Stata 17 đã giải quyết triệt để thách thức này bằng hệ thống lệnh collect, cho phép người dùng tùy biến toàn bộ cấu trúc, nhãn hiển thị, đường viền và xuất bảng trực tiếp sang các định dạng tài liệu phổ biến. Khởi đầu với bảng thống kê cơ bản Để hiểu rõ cơ chế hoạt động của collect, hãy bắt đầu bằng việc tạo một bảng thống kê mô tả cơ bản kết hợp giữa hai biến số giới tính và huyết áp cao. Lệnh table dưới đây thu thập các thông số bao gồm tần suất, tỷ lệ phần trăm, giá trị trung bình và độ lệch chuẩn của tuổi tác.
cover
Tạo bảng tùy chỉnh cho nhiều mô hình hồi quy trong stata 17: sức mạnh của bộ lệnh collect
Tháng 07/2026
Việc trình bày kết quả từ nhiều mô hình hồi quy khác nhau trên cùng một bảng dữ liệu là yêu cầu thường gặp trong các báo cáo nghiên cứu khoa học. Trong Stata 17, thay vì phải sao chép thủ công hoặc sử dụng các công cụ bên ngoài, bạn có thể tận dụng bộ lệnh collect để tự động hóa hoàn toàn quy trình này. Bài viết này sẽ hướng dẫn bạn cách xây dựng một bảng so sánh kết quả của ba mô hình hồi quy logistic, tích hợp các tiêu chí thông tin và xuất trực tiếp sang định dạng tài liệu PDF chuyên nghiệp. Khởi động với bộ dữ liệu sức khỏe quốc gia Để bắt đầu hành trình, chúng ta sẽ mở bộ dữ liệu khảo sát sức khỏe và dinh dưỡng quốc gia bằng lệnh webuse. Sau đó, chúng ta kiểm tra các biến số cần thiết bao gồm huyết áp cao, tuổi, giới tính và tình trạng tiểu đường.
cover
Chế ngự biến động: dự báo hiệu suất cao cho chỉ số stoxx 600 bằng h2o automl
Tháng 07/2026
Dự báo các thị trường tài chính, ví dụ như chỉ số STOXX Europe 600, là một thử thách kinh điển trong ngành khoa học dữ liệu. Dữ liệu tài chính vốn dĩ chứa nhiều nhiễu, không dừng và cực kỳ nhạy cảm trước các sự kiện thị trường đột ngột. Để giải quyết vấn đề này, chúng ta có thể áp dụng học máy tự động, cụ thể là khung làm việc hiệu năng cao của H2O kết hợp cùng hệ sinh thái modeltime trong ngôn ngữ R. Bài viết này phân tích chi tiết toàn bộ quy trình vận hành học máy từ khâu thu thập dữ liệu, kỹ nghệ đặc trưng cho đến huấn luyện và đánh giá mô hình thực tế để tìm ra giải pháp tối ưu trước sự biến động của thị trường. Quy Trình Dự Báo Và Xây Dựng Tập Đặc Trưng Chiến lược cốt lõi ở đây là chuyển đổi bài toán chuỗi thời gian đơn biến thành bài toán học máy có giám sát bằng cách tạo ra các biến dự báo có giá trị giải thích cao. Thu thập và phân chia dữ liệu
cover
Tự hồi quy véc-tơ — mô phỏng, ước lượng và suy diễn trong stata
Tháng 07/2026
Mô hình tự hồi quy véc-tơ là một công cụ mạnh mẽ và phổ biến để phân tích động thái của nhiều chuỗi thời gian cùng lúc. Mô hình này biểu diễn một véc-tơ gồm các biến quan sát dưới dạng một hàm số theo các trễ của chính chúng. Trong bài viết này, chúng ta sẽ tìm hiểu cách mô phỏng dữ liệu từ một quy trình tự hồi quy véc-tơ bậc hai với hai biến số, tiến hành ước lượng tham số bằng Stata và thực hiện suy diễn thống kê thông qua các hàm phản ứng đẩy. Mô phỏng dữ liệu Hãy bắt đầu bằng việc mô phỏng một quy trình tự hồi quy véc-tơ bậc hai với hai biến số. Phương trình tổng quát có dạng hệ phương trình tuyến tính, trong đó các biến hiện tại phụ thuộc vào giá trị trễ bậc một và bậc hai của chính chúng và biến còn lại, cộng với một véc-tơ nhiễu trắng tuân theo phân phối chuẩn đa biến với trung bình bằng không và ma trận hiệp phương sai cho trước. Chúng ta thiết lập kích thước mẫu ban đầu là 1100 quan sát, sau đó tạo biến thời gian và các biến chứa chuỗi quan sát cũng như các biến nhiễu.
cover
Cách tự động hóa thu thập dữ liệu twitter trực tiếp vào phần mềm stata
Tháng 07/2026
Trong nghiên cứu khoa học dữ liệu và phân tích mạng xã hội, việc thu thập dữ liệu thực tế từ các nền tảng trực tuyến đóng vai trò vô cùng quan trọng. Trước đây, nhiều người dùng thường thắc mắc liệu phần mềm Stata có khả năng nhập trực tiếp dữ liệu từ mạng xã hội Twitter hay không. Để giải quyết nhu cầu này, việc phát triển các lệnh mở rộng tận dụng giao diện lập trình ứng dụng Java cải tiến trên các phiên bản Stata hiện đại đã mang lại lời giải hoàn hảo. Bài viết này sẽ hướng dẫn bạn cách sử dụng công cụ twitter2stata để kết nối, xác thực và khai thác dữ liệu từ Twitter về môi trường làm việc Stata một cách nhanh chóng. Cài đặt công cụ twitter2stata Trước khi tiến hành khai thác thông tin, bạn cần thực hiện cài đặt bộ công cụ này trực tiếp từ kho lưu trữ SSC của cộng đồng Stata. Hãy mở phần mềm và chạy dòng lệnh sau trong cửa sổ dòng lệnh.
cover
Phân tích văn bản trong r với quanteda (phần 1)
Tháng 07/2026
Trong kỷ nguyên dữ liệu lớn, khả năng trích xuất thông tin có giá trị từ dữ liệu văn bản phi cấu trúc là một kỹ năng vô cùng quan trọng đối với các nhà khoa học dữ liệu. Dù là phân tích phản hồi của khách hàng, nghiên cứu tin tức hay khám phá các chủ đề trong tài liệu khoa học, phân tích văn bản cung cấp cái nhìn sâu sắc giúp định hình các quyết định kinh doanh và nghiên cứu. Bài viết này sẽ giới thiệu bạn đến với `quanteda`, một gói phần mềm mạnh mẽ và hiệu quả trong R, được thiết kế đặc biệt cho việc phân tích văn bản. Đây là phần đầu tiên trong chuỗi bài viết, tập trung vào các khái niệm cơ bản và các bước tiền xử lý chính. Các Gói Phần Mềm Cần Thiết Nắm Vững Kiến Thức Cơ Bản Về Phân Tích Văn Bản
cover
Trích xuất dữ liệu nba bằng lệnh nba2stata trong stata
Tháng 07/2026
Việc tiếp cận và phân tích dữ liệu thể thao chuyên nghiệp đã trở nên dễ dàng hơn bao giờ hết nhờ vào các công cụ web scraping mạnh mẽ. Trong lĩnh vực khoa học dữ liệu, Stata nổi bật là một phần mềm thống kê mạnh mẽ, và khi kết hợp với các lệnh tùy chỉnh như `nba2stata`, nó cho phép các nhà phân tích nhanh chóng thu thập và khám phá các bộ dữ liệu phức tạp. Lệnh `nba2stata` được thiết kế để trích xuất dữ liệu từ https://stats.nba.com, cung cấp một cầu nối trực tiếp để nghiên cứu các khía cạnh khác nhau của bóng rổ chuyên nghiệp. Tuy nhiên, điều quan trọng cần lưu ý là kể từ tháng 11 năm 2019, lệnh này không còn hoạt động do các hạn chế từ https://stats.nba.com. Khái Quát Về nba2stata Lệnh `nba2stata` được phát triển bởi Chris Hassell, người trước đó đã hoàn thành lệnh `nfl2stata`. Đây là một công cụ hữu ích cho những ai muốn phân tích dữ liệu bóng rổ chuyên nghiệp trực tiếp trong môi trường Stata. Để cài đặt lệnh này, người dùng cần chạy dòng lệnh sau trong Stata:
cover
Giới thiệu về thống kê bayes phần 2: mcmc và thuật toán metropolis-hastings
Tháng 07/2026
Trong bài viết này, chúng ta sẽ cùng tìm hiểu một cách trực quan và dễ tiếp cận về phương pháp chuỗi Markov Monte Carlo, thường được gọi tắt là MCMC. Đây là công cụ được sử dụng rất phổ biến để khớp các mô hình thống kê Bayes. MCMC có nhiều biến thể khác nhau, nhưng nội dung hôm nay sẽ tập trung sâu vào thuật toán Metropolis-Hastings. Để giữ cho bài viết ngắn gọn và trực quan, một số chi tiết kỹ thuật chuyên sâu sẽ được lược bớt. Bạn nên tham khảo tài liệu hướng dẫn sử dụng phân tích Bayes của Stata để có thêm thông tin chi tiết trước khi áp dụng vào thực tế. Hãy tiếp tục với ví dụ tung đồng xu từ phần trước về các khái niệm cơ bản của thống kê Bayes. Mục tiêu của chúng ta là tìm ra phân phối hậu nghiệm của tham số theta, đại diện cho xác suất đồng xu xuất hiện mặt ngửa. Phân phối tiền nghiệm được lựa chọn là phân phối beta phẳng, không mang thông tin với các tham số là 1 và 1. Chúng ta sẽ sử dụng hàm hợp lý nhị thức để định lượng dữ liệu thực nghiệm thu được từ quá trình tung đồng xu, cụ thể là có 4 lần ngửa trong tổng số 10 lần tung. Chúng ta có thể áp dụng phương pháp MCMC kết hợp thuật toán Metropolis-Hastings để tạo ra một mẫu ngẫu nhiên từ phân phối hậu nghiệm của theta. Từ mẫu thu được này, việc ước lượng các đặc trưng như giá trị trung bình của phân phối hậu nghiệm sẽ trở nên dễ dàng. Kỹ thuật này được cấu thành từ ba phần cơ bản bao gồm phương pháp Monte Carlo, chuỗi Markov và thuật toán Metropolis-Hastings.
cover
[[img_1]]: image 1
Tháng 07/2026
SO SÁNH NHÓM TRONG MÔ HÌNH PHƯƠNG TRÌNH CẤU TRÚC: KIỂM ĐỊNH TÍNH BẤT BIẾN ĐO LƯỜNG Khi xây dựng hầu hết các mô hình thống kê, chúng ta thường quan tâm đến việc liệu các tham số có sự khác biệt giữa các nhóm đối tượng hay không, ví dụ như giữa các thời kỳ, nhóm tuổi, giới tính hoặc trường học. Nói cách khác, chúng ta muốn kiểm định vai trò điều tiết khi biến điều tiết là một biến phân loại. Đối với mô hình hồi quy, việc này vô cùng đơn giản bằng cách đưa các biến chỉ báo nhóm vào mô hình và cho chúng tương tác với các biến dự báo khác. Chúng ta cũng có những giả thuyết tương tự về sự khác biệt tham số giữa các nhóm khi thực hiện ước lượng mô hình phương trình cấu trúc. Khi các mô hình này chứa các biến ẩn và các biến quan sát tương ứng, chúng ta có thể kiểm định xem các phép đo lường đó có đồng nhất giữa các nhóm hay không. Quá trình đánh giá tính bất biến đo lường (measurement invariance) thường bao gồm một chuỗi các kiểm định về tính bằng nhau của các hệ số đo lường, tính bằng nhau của các hệ số chặn và tính bằng nhau của các phương sai sai số giữa các nhóm đối tượng. Trong bài viết này, chúng tôi sẽ hướng dẫn cách sử dụng tùy chọn group và ginvariant của lệnh sem, cùng với lệnh hậu ước lượng estat ginvariant trong phần mềm Stata để thực hiện các kiểm định tính bất biến đo lường một cách nhanh chóng và chính xác.
cover
Sử dụng lệnh margins trong stata với các dạng hàm khác nhau: thay đổi tỷ lệ và thay đổi logarith tự nhiên
Tháng 07/2026
Lệnh margins là một công cụ mạnh mẽ trong phần mềm Stata giúp chúng ta tính toán các giá trị dự báo, sai số cận biên và tác động cận biên. Điểm đặc biệt là lệnh này có thể xử lý hầu như mọi dạng hàm của các tham số ước lượng thông qua tùy chọn expression. Bài viết này sẽ hướng dẫn bạn cách xác định mức thay đổi tỷ lệ của biến kết quả khi các biến độc lập thay đổi, sử dụng cả hai phương pháp cho mô hình tuyến tính và phi tuyến tính. Mô hình tuyến tính với biến nhị phân Sau khi ước lượng một mô hình hồi quy tuyến tính với kỳ vọng của y khi biết x bằng a cộng b nhân x, chúng ta có thể ước lượng mức thay đổi tỷ lệ của các giá trị dự báo đối với sự thay đổi của x, hay còn gọi là bán co giãn, bằng lệnh margins kèm tùy chọn eydx. Công thức tính bán co giãn sẽ khác nhau tùy thuộc vào việc x là biến liên tục hay biến rời rạc. Nếu x là biến liên tục, trị số eydx được tính bằng đạo hàm của logarith tự nhiên của y dự báo theo x, bằng đạo hàm của y theo x nhân với một phần y dự báo, và bằng hệ số b chia cho y dự báo.
cover
Ước lượng mô hình svar với ràng buộc dài hạn trên stata
Tháng 06/2026
Mô hình hồi quy tự vectơ cấu trúc là một công cụ mạnh mẽ trong kinh tế lượng vĩ mô, giúp chúng ta nhận diện các cú sốc kinh tế và đánh giá tác động của chúng qua thời gian. Trong bài viết này, chúng ta sẽ tìm hiểu cách thiết lập các ràng buộc dài hạn trong mô hình này bằng cách tái hiện lại nghiên cứu kinh điển của hai tác giả Blanchard và Quah năm 1989 trên phần mềm Stata. Khung Lý Thuyết Cơ Bản Trong các nghiên cứu trước đây về hồi quy tự vectơ cấu trúc, việc nhận diện các tham số thường dựa trên các ràng buộc ngắn hạn, tức là cách các cú sốc tác động ngay lập tức lên các biến nội sinh tại thời điểm xảy ra cú sốc. Ngược lại, Blanchard và Quah đạt được sự nhận diện bằng cách áp dụng các ràng buộc lên tác động dài hạn của các cú sốc, tức là phản ứng giới hạn của một biến nội sinh khi thời gian tiến về vô hạn. Trong một hệ hồi quy tự vectơ dừng, phản ứng của mỗi biến đối với từng cú sốc phải tiến về không trong dài hạn. Blanchard và Quah phân tích một hệ thống gồm tổng sản phẩm quốc gia thực tế GNP và tỷ lệ thất nghiệp, trong đó tốc độ tăng trưởng GNP và mức thất nghiệp được giả định là các chuỗi dừng. Hệ thống này có hai cú sốc là cú sốc cung và cú sốc cầu. Phản ứng dài hạn của tăng trưởng GNP và thất nghiệp đối với các cú sốc này phải bằng không vì các biến này là dừng.
cover
Thiết kế biểu đồ chuyên nghiệp trong stata: bí quyết tùy biến phong cách trực quan hóa dữ liệu
Tháng 06/2026
Một biểu đồ xuất sắc không chỉ dừng lại ở việc hiển thị số liệu chính xác mà còn phải truyền tải thông điệp một cách hiệu quả nhất. Tùy thuộc vào mục đích truyền thông, bạn có thể cần một biểu đồ phù hợp với tiêu chuẩn nghiêm ngặt của các tạp chí khoa học, một biểu đồ có màu sắc tương phản cao để người đọc dễ dàng phân biệt, hoặc đơn giản là một biểu đồ tối giản với tông màu xám cổ điển. Hành trình thiết kế này thường bắt đầu từ việc vẽ một biểu đồ thô từ dữ liệu nghiên cứu, sau đó từng bước biến đổi diện mạo của nó để đạt được phong cách mong muốn. Stata cung cấp cho người dùng những công cụ vô cùng mạnh mẽ để thực hiện việc này một cách nhanh chóng và có hệ thống. Khởi đầu với biểu đồ mặc định trong Stata Để minh họa cho quá trình tùy biến, chúng ta sẽ bắt đầu với một biểu đồ kết hợp nhiều thành phần bao gồm biểu đồ phân tán của các điểm dữ liệu thực tế, đường xu hướng từ mô hình ước lượng và vùng biểu diễn khoảng tin cậy.
cover
Kết nối sức mạnh r và python trong phân tích dữ liệu với rtopy
Tháng 06/2026
Trong giới khoa học dữ liệu, cuộc tranh luận giữa việc sử dụng Python hay R chưa bao giờ kết thúc. Python sở hữu thế mạnh vượt trội về khả năng tích hợp hệ thống, xử lý học sâu và xây dựng ứng dụng thực tế. Trong khi đó, R lại là ông vua trong lĩnh vực phân tích thống kê chuyên sâu, dự báo chuỗi thời gian và sở hữu các gói thư viện được thiết kế tối ưu bởi cộng đồng các nhà thống kê học. Thay vì phải đau đầu lựa chọn một trong hai ngôn ngữ, việc kết hợp sức mạnh của cả hai ngay trong một quy trình làm việc là giải pháp tối ưu nhất. Thư viện rtopy chính là cầu nối hiện đại giúp bạn thực hiện điều này một cách mượt mà. Bài viết này sẽ giới thiệu những cải tiến mới nhất của thư viện rtopy, giúp việc chuyển dịch và gọi mã nguồn R từ Python trở nên đơn giản hơn bao giờ hết. Cài đặt các công cụ cần thiết Để bắt đầu, bạn cần cài đặt thư viện rtopy trong môi trường Python và một số gói thư viện R phổ biến phục vụ cho việc tính toán thống kê và học máy.
cover
Bản đồ hóa hướng chụp ảnh với dấu mốc định hướng trên r và leaflet
Tháng 06/2026
Việc hiển thị các tọa độ địa lý trên bản đồ tương tác là một kỹ thuật quen thuộc đối với các nhà phân tích dữ liệu không gian. Bằng cách sử dụng công cụ dòng lệnh exiftool, chúng ta có thể dễ dàng trích xuất toàn bộ thông tin định vị toàn cầu từ một thư mục chứa ảnh định dạng JPG và xuất ra tệp CSV để xử lý. Tuy nhiên, bên cạnh vĩ độ và kinh độ, các thiết bị di động hiện đại còn ghi lại một thông số cực kỳ thú vị là hướng của ống kính camera tại thời điểm bấm máy, được lưu trữ trong thẻ siêu dữ liệu GPSImgDirection. Việc thể hiện được hướng nhìn này trên bản đồ bằng các biểu tượng có khả năng xoay tự động sẽ giúp trực quan hóa hành trình một cách sinh động và chính xác hơn nhiều. Bài viết này sẽ hướng dẫn cách hiện thực hóa ý tưởng đó bằng thư viện leaflet trong môi trường R. Chuẩn bị dữ liệu từ siêu dữ liệu ảnh chụp Bước đầu tiên là trích xuất các thông tin định vị từ ảnh chụp. Công cụ exiftool tỏ ra cực kỳ hiệu quả cho tác vụ này. Bạn có thể mở cửa sổ dòng lệnh và chạy cú pháp sau để quét toàn bộ thư mục ảnh và lưu kết quả vào tệp CSV.
cover
Kết hợp mô hình bất kỳ với garch(1,1) để dự báo xác suất giá chứng khoán
Tháng 06/2026
Trong lĩnh vực phân tích tài chính, việc dự báo giá trị tương lai của cổ phiếu luôn là một thách thức lớn do tính chất biến động liên tục và khó lường của thị trường. Dự báo điểm đơn thuần thường không cung cấp đủ thông tin cho các nhà đầu tư và nhà quản lý rủi ro, bởi vì nó bỏ qua mức độ bất định xung quanh dự báo đó. Để giải quyết vấn đề này, dự báo xác suất đã trở thành một công cụ quan trọng, giúp cung cấp cả giá trị kỳ vọng lẫn khoảng tin cậy của dự báo. Bài viết này sẽ hướng dẫn cách kết hợp một mô hình dự báo xu hướng trung bình bất kỳ với mô hình GARCH(1,1) để nắm bắt cả giá trị trung bình có điều kiện lẫn phương sai có điều kiện của tỷ suất sinh lời chứng khoán. Phương pháp này giúp tạo ra các khoảng dự báo xác suất động, phản ánh chân thực mức độ biến động của thị trường theo thời gian. Phương pháp tiếp cận linh hoạt trong dự báo tài chính Mô hình hóa chuỗi thời gian tài chính thường đòi hỏi phải giải quyết hai thành phần chính: xu hướng trung bình và cấu trúc biến động của sai số. Các mô hình truyền thống thường giả định phương sai của sai số là không đổi, điều này hoàn toàn không phù hợp với thực tế thị trường chứng khoán, nơi thường xuyên xảy ra hiện tượng cụm biến động.
cover
Nhập dữ liệu từ nền tảng wrds vào stata: hướng dẫn chi tiết
Tháng 06/2026
WRDS là một nền tảng nghiên cứu và công cụ thông tin kinh doanh hàng đầu, phục vụ hàng trăm tổ chức học thuật, doanh nghiệp và chính phủ trên toàn cầu. Nếu tổ chức của bạn đăng ký WRDS, bạn có thể dễ dàng truy cập dữ liệu từ WRDS từ xa thông qua lệnh `odbc` của Stata. Bài viết này sẽ hướng dẫn bạn từng bước thiết lập kết nối và nhập dữ liệu trực tiếp vào môi trường Stata để phục vụ cho các phân tích định lượng. Kết Nối WRDS Từ Stata WRDS cung cấp một kho dữ liệu khổng lồ, bao gồm thông tin tài chính, kinh tế, chứng khoán và dữ liệu doanh nghiệp từ nhiều nguồn uy tín. Việc có thể truy cập và xử lý trực tiếp các bộ dữ liệu này trong Stata không chỉ giúp các nhà nghiên cứu tiết kiệm thời gian mà còn nâng cao hiệu quả công việc. Lệnh `odbc` trong Stata đóng vai trò cầu nối, cho phép phần mềm này tương tác với các cơ sở dữ liệu bên ngoài như WRDS thông qua giao thức ODBC. Cài Đặt Trình Điều Khiển ODBC
cover
Mô phỏng dược động học quần thể để đánh giá khả năng đạt mục tiêu điều trị của piperacillin và tazobactam trên trực khuẩn mủ xanh
Tháng 06/2026
Trực khuẩn mủ xanh Pseudomonas aeruginosa là một trong những tác nhân gây nhiễm trùng bệnh viện nguy hiểm và thách thức nhất hiện nay. Trong thực hành lâm sàng, sự kết hợp giữa piperacillin và tazobactam là một trong những vũ khí chủ lực để đối phó với tác nhân này. Tuy nhiên, việc tối ưu hóa liều lượng để đảm bảo hiệu quả diệt khuẩn tối đa vẫn là một bài toán phức tạp đòi hỏi sự hỗ trợ của khoa học dữ liệu. Vào tháng hai năm 2024, Cơ quan Quản lý Thực phẩm và Dược phẩm Hoa Kỳ FDA đã đưa ra một tuyên bố quan trọng liên quan đến điểm gãy nhạy cảm phụ thuộc liều lượng của trực khuẩn mủ xanh ở mức 16 microgram trên mililit. FDA khuyến cáo nên sử dụng liều 4.5 gram mỗi 6 giờ truyền kéo dài trong 3 giờ thay vì phương pháp truyền tĩnh mạch tiêu chuẩn trong 30 phút, vì phương pháp tiêu chuẩn không đạt được khả năng đạt mục tiêu điều trị trên 90 phần trăm. Bài viết này sẽ sử dụng ngôn ngữ lập trình R và thư viện mrgsolve để xây dựng mô hình dược động học quần thể, tiến hành mô phỏng và phân tích sâu về vấn đề này. Xây dựng mô hình dược động học quần thể Để mô phỏng chính xác nồng độ thuốc trong cơ thể, chúng ta cần một mô hình dược động học quần thể tối ưu. Chúng ta sẽ sử dụng một mô hình gộp phức tạp được xây dựng từ nhiều nhóm bệnh nhân khác nhau từ trẻ sơ sinh đến người cao tuổi. Dưới đây là mã nguồn R để thiết lập mô hình mrgsolve tập trung vào nồng độ piperacillin tự do không liên kết với protein, vốn là thành phần quyết định hiệu quả kháng khuẩn.
cover
Hiệu chỉnh sai số gộp khi so sánh cặp bằng gói emmeans trong r
Tháng 06/2026
Trong nghiên cứu thực nghiệm, việc thực hiện nhiều phép so sánh cặp cùng một lúc là vô cùng phổ biến. Tuy nhiên, nếu chúng ta chỉ sử dụng các kiểm định t thông thường mà không hiệu chỉnh, tỷ lệ sai số loại một trên toàn bộ họ kiểm định sẽ tăng lên rất nhanh. Khi đó, việc sử dụng các giá trị p hiệu chỉnh là bắt buộc để đảm bảo tính tin cậy của các kết luận thống kê. Bài viết này sẽ hướng dẫn cách xử lý vấn đề đa so sánh bằng gói lệnh emmeans trong ngôn ngữ R, đồng thời giải thích bản chất thống kê từ phân phối đơn biến đến đa biến. Thực Nghiệm Và Mô Hình Phân Tích Phương Sai Một Chiều Chúng ta sẽ bắt đầu với một bộ dữ liệu thực tế về khả năng diệt cỏ của ba hỗn hợp hóa chất so với nhóm đối chứng không xử lý trên cây cỏ dại thuộc họ cà trong ruộng cà chua. Biến phản hồi là khối lượng của cây cỏ dại trong mỗi chậu, và biến giải thích là các công thức xử lý cỏ.
cover
Tạo dữ liệu giả lập đa biến với r-vine copula bằng thư viện esgtoolkit trong r
Tháng 06/2026
Trong phân tích tài chính và quản trị rủi ro, việc mô phỏng dữ liệu đồng thời của nhiều tài sản mà vẫn giữ nguyên được cấu trúc phụ thuộc phức tạp là một thách thức lớn. Các phương pháp mô hình hóa truyền thống thường dựa vào giả định phân phối chuẩn, vốn dễ dàng thất bại khi đối mặt với dữ liệu thực tế có phân phối đuôi dày hoặc mối quan hệ phi tuyến. Để giải quyết vấn đề này, phương pháp R-vine copula nổi lên như một công cụ mạnh mẽ, cho phép chúng ta ghép nối các phân phối biên khác nhau thành một phân phối chung một cách linh hoạt. Bài viết này sẽ hướng dẫn cách sử dụng thư viện esgtoolkit trong ngôn ngữ R để xây dựng mô hình R-vine copula và tạo dữ liệu giả lập chất lượng cao. Tìm hiểu về R-vine copula và thư viện esgtoolkit Copula là một hàm toán học dùng để liên kết các phân phối biên của các biến ngẫu nhiên đơn lẻ nhằm tạo ra một phân phối đồng thời. Trong số các cấu trúc copula, vine copula phân rã phân phối đồng thời đa chiều thành các cặp copula hai chiều thông qua một cấu trúc dạng cây liên kết. Điều này giúp kiểm soát tốt các mối quan hệ phụ thuộc không đối xứng ở vùng đuôi, một hiện tượng cực kỳ phổ biến trong dữ liệu tài chính khi thị trường sụt giảm mạnh cùng một lúc. Thư viện esgtoolkit cung cấp một giao diện lập trình trực quan và tối ưu hóa để ước lượng các tham số của mô hình R-vine copula, đồng thời chạy các lượt mô phỏng thử nghiệm để tìm ra bộ dữ liệu giả lập khớp nhất với dữ liệu thực tế.
cover
Cập nhật cực chất trên flextable 0.9.11: đồng bộ hóa biểu đồ và trình bày quarto đỉnh cao
Tháng 06/2026
Thư viện flextable phiên bản mới nhất 0.9.11 đã chính thức xuất hiện trên CRAN, mang lại những cải tiến vượt trội giúp đơn giản hóa quy trình báo cáo dữ liệu của bạn. Trong bản cập nhật lần này, hai tính năng nổi bật nhất chính là sự tích hợp mượt mà với patchwork và khả năng hỗ trợ định dạng Quarto trực tiếp trong từng ô dữ liệu thông qua hàm as_qmd. Hãy cùng khám phá xem những công cụ này sẽ thay đổi cách chúng ta thiết kế các bảng biểu báo cáo khoa học dữ liệu như thế nào. Tích hợp patchwork: Thiết kế bố cục biểu đồ và bảng số liệu chuyên nghiệp Trước đây, việc căn chỉnh một bảng số liệu nằm song song hoặc đồng bộ với một biểu đồ thường đòi hỏi rất nhiều công sức căn chỉnh thủ công. Giờ đây, với sự hỗ trợ của patchwork, quy trình này trở nên vô cùng đơn giản. Hàm mới wrap_flextable cho phép biến đổi các đối tượng flextable thành các thành phần có thể dễ dàng ghép nối bằng các toán tử cộng, vạch đứng hoặc gạch chéo của patchwork. Để minh họa, chúng ta sẽ xây dựng một biểu đồ quả tạ biểu diễn số liệu thống kê của các đội bóng tại giải Bundesliga, sau đó ghép nối nó với một bảng số liệu tương ứng.
cover
Khai thác dữ liệu facebook trên stata: phương pháp tích hợp và thiết lập hệ thống truy vấn
Tháng 06/2026
Dữ liệu mạng xã hội đã trở thành một nguồn tài nguyên vô giá cho các nghiên cứu xã hội học, hành vi người dùng và phân tích thị trường. Bên cạnh các nguồn dữ liệu truyền thống, việc thu thập thông tin từ Facebook luôn là mục tiêu quan trọng của các nhà nghiên cứu dữ liệu. Để hỗ trợ quá trình này, công cụ facebook2stata được phát triển nhằm giúp người dùng kết nối trực tiếp Stata với hệ thống dữ liệu của Facebook. Bài viết này sẽ hướng dẫn chi tiết cách cài đặt, cấu hình mã xác thực và thực hiện các truy vấn cơ bản từ Facebook vào môi trường làm việc của Stata. Cài đặt công cụ facebook2stata Để bắt đầu, bạn cần cài đặt gói lệnh facebook2stata từ máy chủ của Stata. Việc cài đặt vô cùng đơn giản bằng cách khởi chạy dòng lệnh sau trong cửa sổ dòng lệnh của phần mềm.
cover
Hiểu sâu về độ lệch phương sai và khả năng ước lượng song trùng bền vững của tmle qua giả lập dữ liệu bằng r
Tháng 06/2026
Phương pháp ước lượng tối đa khả dĩ mục tiêu thường được gọi là TMLE là một công cụ mạnh mẽ trong phân tích nhân quả. Nhiều nhà nghiên cứu từng nghe về đặc tính song trùng bền vững của phương pháp này nhưng chỉ thực sự thấu hiểu nó khi tiến hành giả lập dữ liệu thực tế. Phương pháp này hoạt động cực kỳ hiệu quả khi một trong hai mô hình kết quả hoặc mô hình điều trị được thiết lập chính xác. Việc kết hợp thuật toán XGBoost cùng TMLE giúp tự động bắt trọn các mối quan hệ phức tạp trong dữ liệu mà không cần phải khai báo các tương tác thủ công. Bài viết này sẽ đi sâu vào cơ chế vận hành của phương pháp thông qua việc giả lập dữ liệu cụ thể trong môi trường R. Khái Niệm Về Tmle TMLE là một phương pháp thống kê tiên tiến được sử dụng để ước lượng các tác động nhân quả trong các nghiên cứu quan sát và thử nghiệm lâm sàng. Phương pháp này kết hợp linh hoạt giữa các thuật toán học máy và kỹ thuật thống kê truyền thống nhằm mang lại các ước lượng vững cho hiệu quả tác động của can thiệp, đồng thời kiểm soát tốt các yếu tố nhiễu. Quy trình vận hành của TMLE gồm hai giai đoạn chính. Đầu tiên, hệ thống sẽ ước lượng mô hình kết quả và mô hình điều trị. Sau đó, các ước lượng này được sử dụng để hiệu chỉnh nhằm hướng trực tiếp đến tham số mục tiêu cần nghiên cứu. Cách tiếp cận này đặc biệt hữu ích trong các bối cảnh mà phương pháp truyền thống dễ bị lệch hoặc hoạt động kém hiệu quả do sự xuất hiện của các mối quan hệ phi tuyến phức tạp.
cover
Kiểm định thông số kỹ thuật mô hình và sử dụng phiên bản chương trình gmm
Tháng 06/2026
Trong phân tích khoa học dữ liệu, việc ước lượng tham số mô hình là một bước quan trọng, nhưng việc đảm bảo mô hình được chỉ định chính xác còn thiết yếu hơn. Bài viết này sẽ đi sâu vào cách kiểm định thông số kỹ thuật mô hình bằng phương pháp momen tổng quát (GMM) trong Stata, đặc biệt khi làm việc với các mô hình nhận dạng thừa. Chúng ta sẽ khám phá cách sử dụng phiên bản chương trình của lệnh GMM, vốn rất hữu ích cho các mô hình phức tạp, và cách kiểm định các ràng buộc nhận dạng thừa bằng thống kê J của Hansen. Mô Hình Poisson Với Biến Giải Thích Nội Sinh Chúng ta sẽ sử dụng GMM để ước lượng các tham số của một mô hình Poisson có biến giải thích nội sinh. Biến giải thích nội sinh là những biến có thể tương quan với thành phần sai số của mô hình, dẫn đến ước lượng không nhất quán nếu không được xử lý đúng cách. Mô hình hồi quy Poisson của biến phụ thuộc y_i trên các biến ngoại sinh x_i và biến nội sinh y_{2,i} có dạng kỳ vọng của y_i với điều kiện các biến x_i, y_{2,i} và biến nhiễu epsilon_i được biểu thị qua hàm mũ của tổng beta_1 nhân x_i cộng beta_2 nhân y_{2,i}, rồi cộng thêm biến nhiễu epsilon_i. Biến nhiễu epsilon_i có giá trị trung bình bằng 0. Các biến giải thích y_{2,i} có thể tương quan với epsilon_i. Công thức này tương tự như công thức của lệnh ivpoisson với các sai số cộng gộp.
cover
Tận dụng các mô hình ai trong stata: chạy chatgpt, claude, gemini và grok
Tháng 05/2026
Bài viết này khám phá cách cập nhật và tạo các lệnh Stata để tích hợp với những mô hình AI phổ biến như ChatGPT, Claude, Gemini và Grok. Sau khi bài đăng trước về lệnh Stata để chạy ChatGPT trở nên phổ biến, những thay đổi trong mã API của OpenAI đã khiến lệnh đó không còn hoạt động. Mục tiêu của chúng tôi là hướng dẫn bạn cách điều chỉnh mã API và viết các lệnh Stata tương tự để tận dụng sức mạnh của các công cụ AI khác nhau trực tiếp từ môi trường Stata. Trọng tâm của bài viết này, cũng như bài trước, là minh họa mức độ dễ dàng để tận dụng các tính năng của PyStata nhằm kết nối với ChatGPT và các công cụ AI khác, thay vì đưa ra lời khuyên về cách sử dụng các công cụ AI để trả lời các câu hỏi cụ thể của Stata. Do đó, các ví dụ chỉ đơn giản là yêu cầu một bài haiku về Stata. Tuy nhiên, bạn có thể truyền bất kỳ yêu cầu nào mà bạn thấy hữu ích trong quy trình làm việc của mình với Stata. Tổng Quan Về Tích Hợp Stata/Python Chúng tôi giả định rằng bạn đã quen thuộc với tích hợp Stata/Python và cách viết lệnh chatgpt ban đầu. Nếu các chủ đề này còn lạ lẫm, bạn nên đọc các bài đăng trên blog dưới đây:
cover
Lập trình lệnh ước lượng trong stata: kích hoạt chức năng predict
Tháng 05/2026
Trong lập trình các lệnh ước lượng tùy chỉnh trong Stata, việc đảm bảo chức năng `predict` hoạt động chính xác sau khi chạy mô hình là một yếu tố quan trọng để người dùng có thể trích xuất các dự đoán hiệu quả. Bài viết này sẽ hướng dẫn cách xây dựng một ado-command riêng biệt để tính toán các giá trị dự đoán và tích hợp nó vào lệnh ước lượng chính, từ đó mở rộng khả năng phân tích dữ liệu. Một Lệnh Ado Để Tính Toán Dự Đoán Theo quy ước, một ado-command dùng để tính toán các dự đoán cho lệnh ước lượng `mytest` sẽ được đặt tên là `mytest_p`. Trong trường hợp này, chúng ta sẽ xem xét `mypoisson5_p`, ado-command chịu trách nhiệm tính toán dự đoán sau khi chạy lệnh `mypoisson5`. Cú pháp của `mypoisson5_p` được định nghĩa như sau:
SciEco
Science for Economics
Định hướng đào tạo phân tích dữ liệu, xây dựng chính sách, tối ưu hoá danh mục tài chính cá nhân và dự báo thị trường.
Liên hệ
Địa chỉ: Số 60, ngõ 41, Phố Thái Hà, Trung Liệt, Đống Đa, Hà Nội (Google Map)
Email: science.for.economics@gmail.com
Hotline: 03.57.94.7680 (Mrs. Hà)
Mạng xã hội