先把两个结果变量分开
在斯诺克语境中,首局是比赛中的一个 frame,而全场结果是整场比赛的胜负。两者的统计单位不同:首局只描述开局这一格,全场结果则要等比赛结束后才确定。若把“首局赢”直接当成“比赛赢”,就会把局结果和场结果混为一谈。
这组练习只记录两个已知字段:首局是赢还是输,全场是赢还是输。没有记录具体比分、比赛采用几局几胜、对手强度、比赛日期或首局的得分过程。因此,它适合演示交叉表和条件比例,不足以解释为什么某位球员会赢。
逐格建立二维交叉表
先把每场比赛放入一个同时由“首局结果”和“全场结果”决定的格子。行表示首局结果,列表示全场结果;行总数和列总数用于复核是否把八场都记录进去。
| 首局结果 | 全场赢 | 全场输 | 行总数 |
|---|---|---|---|
| 首局赢 | 3 | 2 | 5 |
| 首局输 | 1 | 2 | 3 |
| 列总数 | 4 | 4 | 8 |
表格的四个内部数字正好对应假设:3、2、1、2。行方向复核为首局赢的五场和首局输的三场;列方向复核为全场赢的四场和全场输的四场;最右下角的总数为八场。若逐格相加后不是八,就说明有记录遗漏、重复,或某场的两个字段没有配对。
计算三种不同的胜率
问题中的“先赢首局时,最后赢比赛的比例”是条件胜率,分母必须限定为首局赢的比赛。由表中第一行可得:
首局赢条件下的全场胜率 = 首局赢且全场赢的场数 ÷ 首局赢的总场数 = 3 ÷ 5 = 百分之60。
同理,首局输条件下仍然全场获胜的比例为:
首局输条件下的全场胜率 = 首局输且全场赢的场数 ÷ 首局输的总场数 = 1 ÷ 3 ≈ 百分之33.3。
还可以计算不附带首局条件的整体全场胜率:
整体全场胜率 = 全场赢的总场数 ÷ 总场数 = 4 ÷ 8 = 百分之50。
这三个分数回答的是三个不同问题:百分之60回答“首局赢之后,最终赢的比例是多少”;约百分之33.3回答“首局输之后,仍然最终赢的比例是多少”;百分之50回答“这八场整体最终赢的比例是多少”。不能用百分之50替代百分之60,也不能把3÷8误写成首局赢条件下的胜率。
如何理解“有关联”与“导致”
在这个假设样本中,首局赢组的全场胜率为百分之60,首局输组为约百分之33.3,两组相差约26.7个百分点。就这八场记录而言,首局结果与全场结果存在一种样本上的关联:首局赢的比赛,最终获胜比例更高。
但这不能证明“赢下首局导致赢下比赛”。可能影响全场结果的因素还包括比赛长度、对手水平、临场状态、后续局表现和赛制容错。八场样本也很小,新增一场或改变一场结果,比例就可能明显变化。尤其是短局制与长局制的容错空间不同,比较时应先确认比赛采用的赛制,而不能把不同长度的比赛直接混在一起。
因此,较准确的结论是:在这组原创假设的八场记录中,首局赢者的全场胜率为百分之60,高于首局输者的约百分之33.3;这说明样本关联,但不能单独推出因果关系,也不能据此预测下一场比赛。如果继续研究,应逐场保留首局、最终比分、赛制、对手层级和时间范围,并把未知项留空,不用推测填补。
首局结果缺失时怎样处理
上述八场的首局和全场结果都已知。如果真实资料另有比赛只记录了最终胜负,应另列“首局未知”,不能填进首局输或首局赢的行。只在两项字段都已知的样本内计算首局条件胜率;全场胜率可以使用已知最终结果的更大样本,但必须另报分母,不能把两个覆盖范围混写。