Bỏ qua tới nội dung chính
Quay lại tin tức

Liệu một mô hình ngôn ngữ lớn (LLM) có thể định giá một trận đấu World Cup tốt hơn thị trường (và kiếm lợi nhuận)?

Hacker News LLM· cbock90· 15/8/2026general

URL bài viết: https://christian.bock.bio/posts/frontier_xg_worldcup/ URL bình luận: https://news.ycombinator.com/item?id=49313812 Điểm: 2 Bình luận: 0

Một mô hình ngôn ngữ lớn (LLM) có thể định giá một trận đấu World Cup tốt hơn thị trường (và kiếm tiền) không? Ngày 30/7/2026 Thời gian đọc: 11 phút Học máy (Machine Learning) • Mô hình ngôn ngữ lớn (LLM) • Phân tích thể thao (Sports Analytics) Hai năm trước, tôi đã để GPT-4o dự đoán mọi kết quả Euro 2024 từ số liệu thống kê của SportMonks (SoccerGPT): mô hình này đã dự đoán đúng 28 trong số 51 đội thắng (55%) nhưng chỉ đúng hiệu số bàn thắng bại chính xác trong 8 trận (16%). World Cup 2026 và một thế hệ mô hình lập luận mới là cái cớ để đặt ra một câu hỏi sắc bén hơn. Không chỉ là một mô hình có thể dự đoán tỷ số tốt đến mức nào, mà còn liệu nó có thể lập luận để đưa ra một xác suất đánh bại giá của thị trường và biến điều đó thành tiền hay không. Vì vậy, lần này tôi đã che giấu tỷ lệ cược đối với mô hình, đặt cược thực tế dựa trên sự chênh lệch giữa xác suất của mô hình và giá của Kalshi, đồng thời ghi lại mọi hồ sơ và đặt cược công khai. Hệ thống hoàn toàn tự động; tôi chỉ bắt đầu mỗi phân tích và đưa ra "lệnh" cho các cược mà nó đề xuất. Sau 121 lần đặt cược, số vốn đã tăng từ 255 USD lên 771 USD. Trong bài viết này, chúng tôi sẽ trình bày phương pháp luận, do Claude phát triển, và xem xét lý do tại sao chúng tôi đã tăng gấp ba lần số tiền mặt trong khi thua gần một nửa số lần đặt cược. Kho lưu trữ đi kèm có thể được tìm thấy tại GitHub. Phương pháp Trước mỗi trận đấu, chúng tôi tổng hợp một hồ sơ $D$: đội hình, phong độ gần đây, đội hình xuất phát chính thức và bối cảnh giải đấu, được tập hợp một cách xác định và không chứa bất kỳ mức giá nào. Mô hình ngôn ngữ lớn (LLM) $f_\theta$ chỉ đọc hồ sơ này và xác định một phân phối trên các phân tích mà từ đó chúng tôi rút ra một phân tích, $$\big(p,\ \mathrm{xG}^{1},\ \mathrm{xG}^{2}\big) \sim f_\theta(D),$$ các xác suất kết quả $p = (p_1, p_{\mathrm{d}}, p_2)$ cho đội 1 thắng, hòa và đội 2 thắng, cùng với số bàn thắng kỳ vọng (expected goals) $\mathrm{xG}^{1}$ và $\mathrm{xG}^{2}$ mà mỗi đội ghi được. Tỷ số Hãy bắt đầu từ một điều mà một trận đấu tạo ra: số bàn thắng cuối cùng. Gọi $S = (S^1, S^2)$ là tỷ số, trong đó $S^1$ là số bàn thắng đội 1 ghi được và $S^2$ là số bàn thắng đội 2 ghi được. Trước khi trận đấu bắt đầu, $S$ là không xác định, vì vậy chúng ta coi nó là một biến ngẫu nhiên được rút ra từ một phân phối mà mô hình sẽ cung cấp. Mọi khoản đặt cược được đưa ra trong trận đấu đều là một tuyên bố về tỷ số đó: kết quả thắng/hòa/thắng, tổng số bàn thắng của trận đấu (trên/dưới 0,5 đến 3,5 bàn), kèo chấp (spreads), cả hai đội ghi bàn, giữ sạch lưới, tổng số bàn thắng của từng đội, v.v. Cụ thể, mỗi thị trường $m$ là một hợp đồng nhị phân Kalshi sẽ thanh toán một đô la nếu điều kiện của nó trên $S$ được thỏa mãn và không thanh toán gì nếu không. Viết điều kiện đó dưới dạng quy tắc thanh toán $r_m(S^1, S^2) \in \{0, 1\}$, bằng 1 chính xác khi tỷ số thực tế thỏa mãn nó. Ví dụ, đối với thị trường "trên 2,5 bàn thắng", $r_m(S^1, S^2) = \mathbf{1}[S^1 + S^2 \ge 3]$. Xác suất của mô hình rằng điều kiện được thỏa mãn đơn giản là $$q_m \ :=\ \Pr\big[\ r_m(S^1, S^2) = 1 \mid \mathrm{xG}^{1}, \mathrm{xG}^{2}\ \big].$$ Do đó, mọi thứ đều quy về một đối tượng: phân phối của tỷ số $S$ mà số bàn thắng kỳ vọng của mô hình ngụ ý. Từ số bàn thắng kỳ vọng đến tỷ số Chúng tôi coi số bàn thắng của mỗi đội là phân phối Poisson với tỷ lệ bằng số bàn thắng kỳ vọng của mô hình, $\lambda_1 = \mathrm{xG}^1$ và $\lambda_2 = \mathrm{xG}^2$. Một phân phối Poisson đơn lẻ đã nắm bắt được hình dạng cơ bản của việc ghi bàn: tỷ lệ thấp tập trung khối lượng vào 0 và 1 bàn thắng, trong khi tỷ lệ cao hơn đẩy đỉnh ra ngoài và trải rộng nó (Hình 1). Hình 1: Phân phối Poisson cho số bàn thắng của một đội, tại bốn giá trị bàn thắng kỳ vọng (xG). Số bàn thắng của mỗi đội được mô hình hóa theo cách này trước khi kết hợp hai đội thành một tỷ số trận đấu. Tỷ số trận đấu kết hợp một phân phối như vậy cho mỗi đội. Việc nhân hai phân phối Poisson độc lập là điểm khởi đầu rõ ràng, nhưng Dixon và Coles (1997) đã chỉ ra rằng phương pháp này định giá sai các tỷ số thấp nhất (quá ít trận hòa 0-0 và 1-1). Do đó, chúng tôi áp dụng hiệu chỉnh $\tau$ của họ, hiệu chỉnh này điều chỉnh trọng số của bốn ô tỷ số thấp nhất thông qua một tham số phụ thuộc duy nhất $\rho$: $$P(S^1 = i, S^2 = j) \ \propto\ \frac{\lambda_1^{i} e^{-\lambda_1}}{i!} \cdot \frac{\lambda_2^{j} e^{-\lambda_2}}{j!} \cdot \tau(i, j),$$ $$\tau(i, j) = \begin{cases} 1 - \lambda_1 \lambda_2 \rho & (i, j) = (0, 0) \\ 1 + \lambda_1 \rho & (i, j) = (0, 1) \\ 1 + \lambda_2 \rho & (i, j) = (1, 0) \\ 1 - \rho & (i, j) = (1, 1) \\ 1 & \text{otherwise.} \end{cases}$$ Chúng tôi đặt $\rho = -0,10$, cắt bớt ở mười bàn thắng mỗi bên và chuẩn hóa ma trận để tổng bằng một. Các kết quả đầu ra của mô hình hiện định giá các thị trường từ hai nguồn. Các thị trường thắng/hòa/thắng lấy trực tiếp các xác suất $p_1$, $p_{\mathrm{d}}$, $p_2$, và trong một trận đấu loại trực tiếp, xác suất đội 1 đi tiếp là $p_1 + \tfrac{1}{2} p_{\mathrm{d}}$ (một trận đấu hòa sẽ đi đến hiệp phụ và loạt sút luân lưu, chia đều). Mọi thị trường khác (tổng số bàn thắng, kèo chấp, cả hai đội ghi bàn, tổng số bàn thắng của đội) được định giá từ lưới tỷ số trận đấu được xây dựng ở trên từ hai bàn thắng kỳ vọng. Quy tắc $r_m$ là xác định và chỉ có tỷ số trận đấu là ngẫu nhiên, do đó xác suất $q_m$ là kỳ vọng của quy tắc đó trên lưới, được tính toán dưới dạng tổng có trọng số của các ô của nó, $$q_m = \mathbb{E}[r_m(S^1, S^2)] = \sum_{i, j} r_m(i, j) \cdot P(S^1 = i, S^2 = j).$$ Đẳng thức đầu tiên đúng vì $r_m$ chỉ nhận các giá trị $0$ và $1$, do đó kỳ vọng của nó chính xác là xác suất nó bằng $1$. Một lần tính toán duy nhất, chỉ với hai ước tính điểm, do đó định giá khoảng hai chục hợp đồng cùng một lúc. Hình 2 cho thấy một lưới như vậy cho một trận đấu thực tế, phân phối tỷ số chung mà mọi xác suất thị trường được đọc ra. Hình 2: Phân phối tỷ số của mô hình cho một trận đấu thực tế, Brazil đấu với Morocco, được xây dựng từ các bàn thắng kỳ vọng của nó (1,55 và 0,90) thông qua phân phối Poisson Dixon-Coles ở trên. Mỗi ô là xác suất của tỷ số chính xác đó. Xác suất tổng số bàn thắng hoặc kèo chấp $q_m$ chỉ là tổng các ô này: ví dụ, trên 2,5 bàn thắng, cộng tất cả các ô có $i + j \ge 3$. Thời điểm đặt cược: lợi thế và điểm neo Chỉ bây giờ thị trường mới tham gia. Trên Kalshi, một hợp đồng CÓ cho thị trường $m$ có một

Nguồn tin: Hacker News LLM — Tác giả: cbock90. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.