Hôm nay, đội ngũ SciEco gửi tới các bạn bài viết về cách diễn giải hệ số hồi quy với dạng hàm log. Trong hàm log-log, cả biến đầu vào và biến phụ thuộc đều được lấy logarit tự nhiên. Do đó, tác động của hệ số góc β1 trong hàm log-log sẽ thay đổi như sau:
- Nếu β1 > 1: Khi giá trị của biến đầu vào X tăng lên, giá trị của biến phụ thuộc Y tăng với tốc độ nhanh hơn theo hàm mũ.
- Nếu 0 < β1< 1: Khi giá trị của biến đầu vào X tăng lên, giá trị của biến phụ thuộc Y tăng với tốc độ chậm hơn theo hàm mũ.
- Nếu β1 < 0 : Khi giá trị của biến đầu vào X tăng lên, giá trị của biến phụ thuộc Y giảm theo hàm mũ
Như vậy hàm log-log thường được sử dụng khi muốn phân tích tác động của biến đầu vào lên biến phụ thuộc theo cách tỷ lệ. Trong khi đó, hàm lin-lin thường được sử dụng khi muốn xem xét tác động của biến đầu vào lên biến phụ thuộc theo cách tuyến tính.
Dạng hàm lin-lin:
Y=β0+β1X+ε ⇒ Khi X tăng 1 đơn vị thì Y tăng β1 đơn vị
Dạng hàm log-log:
log(Y)=β0+β1log(X)+ε ⇒ Khi log(X) tăng 1 đơn vị thì log(Y) tăng β1 đơn vị
⇒ Khi log(X) tăng log(1.01) đơn vị thì log(Y) tăng β1×log(1.01) đơn vị
Biến đổi:
log(X)+log(1.01)=log(X×1.01) log(Y)+β1log(1.01)=log(Y)+log(1.01β1)=log(Y×1.01β1) ⇒ Khi X tăng 1% thì Y tăng 1.01β1 lần
Ví dụ: khi β1=2
Khi X tăng 1% thì Y tăng 1.012≈1.02 (lần) ∼ tăng 2%
Kết luận: Khi X tăng 1% thì Y tăng β1%

Khi học R, hầu hết mọi người tập trung vào các hàm, mô hình và trực quan hóa. Tuy nhiên, nhiều vấn đề thực tế bắt đầu sớm hơn rất nhiều — ở giai đoạn nhập dữ liệu — và kết thúc muộn hơn — ở việc xuất kết quả.
Nếu dữ liệu bị đọc sai, không phương pháp thống kê nào có thể cứu vãn được phân tích.
Trong bài viết này, chúng ta tập trung vào logic của việc nhập và xuất dữ liệu trong R, sử dụng tệp CSV và Excel. Thay vì học vẹt các hàm, chúng ta sẽ xây dựng một mô hình tư duy về cách R tương tác với tệp tin.
Tại sao nhập xuất dữ liệu lại quan trọng

Trong hành trình học hỏi về khoa học dữ liệu, có những khái niệm như thể được khắc sâu vào trí nhớ — cho đến khi bạn bất ngờ quên sạch. Nhưng rồi, khi quay lại đọc lại những dòng viết cũ, một “rãnh” nhỏ lại được khơi lại, giúp ta trôi theo dòng chảy kiến thức một cách nhẹ nhàng. Có lẽ chính vì thế mà người ta mới nói “get back in the groove” — không phải vì nhạc funk, mà vì sự trôi chảy của tư duy đã từng tồn tại.
Một trong những khái niệm như thế là Gaussian Process (GP) — một công cụ mạnh mẽ trong học thống kê, đặc biệt khi đối mặt với hàm mục tiêu bí ẩn, đắt đỏ để đánh giá. Hôm nay, chúng ta sẽ cùng nhau hồi sinh lại khái niệm này, đi sâu hơn một bước vào lĩnh vực tối ưu hóa Bayes (Bayesian Optimisation) — nơi GP không chỉ mô hình hóa hàm số, mà còn lên kế hoạch cho những bước tiếp theo.
Chúng ta sẽ dùng R như vũ khí chính, cùng với Stan để triển khai mô hình Bayes chính xác, và một chút code để chứng minh rằng, dù hàm là bí ẩn, ta vẫn có thể tìm ra hướng đi thông minh.