量子位 宣布 | "大众年夜众号 QbitAI
天下杯小组赛将收官,你还依然信AI吗?
冷门频出,黑马击败豪强。不少AI模型始料未及。
到底还能不能愉快找到科学规律?或者说足球比赛乃至其他竞技体育赛事,数据科学家在AI加持下,究竟能做到多大程度的预测?
如果让谢波回答这个问题,他会见告你:“单利用神经网络模型对天下杯的胜负、比分进行预测,存在一定难度。”
谢波是北京猜猜科技CEO,他认为天下杯预测难,最根本的缘故原由是核心数据的匮乏:比如国家队之间的历史征战记录非常稀疏,无法供应足够多的旗子暗记支持预测的结果。
以本届天下杯开幕战俄罗斯对阵沙特阿拉伯的比赛为例,两队上次比武是在1993年的一场友情赛,距今已经25年。神经网络模型很难在这样的数据根本上发挥它的威力。
但球赛预测也不是完备毫无办法,在动手实践后,谢波团队创造,如果把包括五大联赛在内的职业联赛当做预测样本,效果将大大不同。
五大联赛指的是欧洲五大职业足球联赛,分别包括英超、西甲、德甲、法甲和意甲联赛。这些联赛有比较完全的商业化体系,也有比较领先的数据采集和数据流转的商业化机制。
以是第一步,获取数据。
相对寻衅的是,体育行业的数据相对金融等其他领域,具有来源浩瀚、标准互异、置信度参差不齐等特点,导致很难从某个威信的数据公司获取到一份全面、准确并且标准化的数据。
举个例子,描述一场比赛的赔率数据和基本面数据存在于不同的来源。不同来源的数据须要通过一个非常严密数据流程进行关联和加工,仅仅队名这个最大略的字段在不同来源的叫法都不一样,任何一个小的数据偏差或者丢失都会导致终极神经网络预测结果偏差,影响准确率。这里面的技能活非常的具有寻衅性。
此外,还要考虑足球比赛的实时性。以是在已经积累了欧洲主流联赛近10年的数万场比赛历史数据后,猜猜科技的模型还加入了百万量级的赛中实时数据。
然后进入第二步,预测回报率导向。
体育竞猜领域有几个常见的误区。比如,比赛的赔率是博彩公司通过对付比赛本身的判断以及大众投注的选择等成分,综合考虑后给出的比赛投注回报。
例如博彩公司开出主队赢2.25的赔率,其意义便是投注者如果投主队得胜,且比赛结果真是主队得胜,则投注者可以得到其投注额的2.25倍的回报。
而比拟赛结果进行一定的判断,给出一定的概率估算,这里预测的是概率。
在此根本上,更为主要的一个观点是代价回报率,该指标则是综合考虑了赔率和结果概率,对付每场比赛的胜负平等结果,都是其对应赔率和预测概率的乘积。
代价回报率可以认为是赔率的可套利空间,或者说是赔率的期望回报值。
于是从预测回报率的角度出发,公式如下:
Returns = Max { Σ Odds | Pro, Val, α } ,个中Odds为预测结果的赔率,Pro为预测的概率,Val为预测的代价回报率,α为选择的策略。
紧接着,就可以看看这个专为预测而打造的模型了,分为两部分:
基于深度学习技能的比赛预测模型,以及基于代价回报率的投注策略模型。
一个个看。
基于深度学习的比赛结果预测模型深度学习技能作为传统神经网络算法的延伸和扩展,当前在图像识别、语音识别、自然措辞处理等领域得到了巨大的成功。
将深度学习技能引入到足球比赛的结果预测中,可以综合利用历史的比赛记录,以及各种实时的数据信息,进行演习和打算。经由数万场比赛的洗礼,弘大数据量的剖析,以学习节制决定胜负的关键成分。
无论是赛前球员的伤病,还是教练的奇招,浩瀚的线索都可以从海量的数据中能得到“蛛丝马迹”,帮助模型得到准确的预测结果。
△ 图:基于深度神经网络的比赛预测
当前猜猜科技的深度学习模型通过对过去两万多场比赛的演习,利用百余维特色,包括球队的基本面(射门数、抢断数、助攻数、控球率等等),几十个渠道(欧赔、亚赔等)的赔率信息,以及历史上的战绩。
经由神经网络的编码和序列解码,以及有效的把稳力机制的引入,可以比拟赛结果进行准确的预测(包括结果和比分)。
进一步,团队后续还利用多组子模型进行多层次的结果领悟,得到最大的性能收益。当前最优的模型可以稳定的达到68%的预测准确性。已经超过了人类专家的顶级水平。
引入代价回报率的最优投资组合的搜索在已知结果概率和赔率的情形下,选择哪些比赛进行投注,投注的比例又是如何,这是投注策略所关注的问题。
不同的预测概率,会有不同的代价回报值,根据不同的代价回报率,我们会采纳不同的下注策略,这就涉及到一个最优投资组合的搜索问题。
搜索的空间是根据赔率,预测的概率,代价回报率以及不同的预测模型等组合而成,如何在百万计的投资组合中进行最优搜索,成为核心问题。
△ 图:基于遗传算法的参数组合搜索
猜猜科技利用剪枝优化的策略,结合遗传算法等多种搜索策略,对最优参数空间进行检索。
遗传算法等并不基于梯度进行打算,算法本身能扩展到巨大的参数空间。重点设计并优化算法的初始条件、选择运算、交叉运算以及变异运算的关键步骤,并且将启示式的裁剪策略利用在遗传算子中,最大限度优化搜索的空间和韶光花费,终极得到最高投资回报比的投资组合参数。
为了测试这套模型, 猜猜科技对 2012 年到 2018 年期间 2 万场足球比赛进行了仿照演习,在测试集300场比赛进行测试,回报率为41%。
在足球领域,这个回报率已非常不俗。
背后团队末了,先容下该模型的核心打造团队——猜猜科技,CEO谢波和CTO郭杨,和包括首席科学家在内的神经网络团队,均来自“西二旗”,是前百度核心业务部门的技能和产品骨干。
CTO郭杨透露,打造该预测模型,只是随机应变的牛刀小试,希望打造一个类似AlphaGo的围棋培训和传授教化工具,终极目的是能够帮助海内的彩民群体提升他们的赛事剖析能力和投注技巧。
但只是一个机器赞助决策类的运用,后续更广泛的场景,是希望将能力运用到更多故意思的领域,比如电子竞技、创造101选秀竞猜、加密货币价格走势中……
— 完 —
演习生招聘
量子位正在招募市场运营演习生,策划实行AI明星公司CEO、高管等参与的线上/线下活动,有机会与AI行业大牛直接互换。一份丰富的演习经历等你解锁~
事情地点在北京中关村落。简历欢迎投递到quxin@qbitai.com
详细细节,请在量子位公众年夜众号(QbitAI)对话界面,回答“演习生”三个字。
量子位 QbitAI · 头条号签约作者
վ'ᴗ' ի 追踪AI技能和产品新动态