RM奖励模型用到的Elo评分系统

2023-10-14 10:30

本文主要是介绍RM奖励模型用到的Elo评分系统,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

你现在是大学教授,请详细讲述Elo排名,用公式表示

二、积分计算公式
Ra:A玩家当前的Rating
Rb:B玩家当前的Rating
Sa:实际胜负值,胜=1,平=0.5,负=0
Ea:预期A选手的胜负值,Ea=1/(1+10^[(Rb-Ra)/400])
Eb:预期B选手的胜负值,Eb=1/(1+10^[(Ra-Rb)/400])
因为E值也为预估,则Ea+ Eb=1

 

Elo排名系统是一种用于计算玩家相对技能水平的方法,通常用于竞技型游戏和运动比赛中。Arpad Elo博士最初设计了这个系统来评估国际象棋的玩家。

Elo系统的主要思想是:如果A在一场比赛中击败了B,那么系统将A的排名提高,B的排名降低。然而,改变的幅度取决于他们的预期胜率。如果A是高级选手,击败初级选手B,那么A的排名将稍微提高,B的排名将稍微降低。然而,如果B击败A,那么A的排名将大幅度下降,B的排名将大幅度上升。

Elo排名系统的基础公式如下:

1. 计算每位玩家的期望得分:

预期胜率:Ea = 1 / (1 + 10 ^ ((Rb - Ra) / 400)),同理,Eb = 1 / (1 + 10 ^ ((Ra - Rb) / 400))

 这里,Ra和Rb分别表示A和B的当前排名。Ea和Eb是A和B的预期胜率

 

2.排名更新:

新的Ra = 旧的Ra + K * (Sa - Ea),新的Rb = 旧的Rb + K * (Sb - Eb)

 

这里,K是K系数(一般取10到60,视具体情况而定),Sa和Sb是比赛结果(如果A赢了,Sa=1,Sb=0;如果B赢了,Sa=0,Sb=1;如果平局,Sa=Sb=0.5)。

  1. 其中R'_A和R'_B是更新后的Elo评分,S_A和S_B是实际得分(赢得比赛为1,平局为0.5,输掉比赛为0),K是影响评分变化幅度的系数。

K系数的选取

K系数的选择取决于一些因素,包括玩家的经验水平和比赛的重要性。选择合适的K值可以帮助Elo评分系统更好地反映玩家的实际实力。

K值较高(例如40)可能会使得玩家的评分波动性更高,更适合于初级或中级玩家,这样他们的评分可以更快地反映他们的技能提高。而K值较低(例如10或20)可能使评分更稳定,更适合于高级玩家。

在某些情况下,K值可以根据玩家的当前评分或比赛的类型进行调整。例如,对于国际象棋,初级玩家的K值可能为40,中级玩家的K值可能为20,而顶级玩家的K值可能为10。

记住,所有这些都只是一种近似的方式,试图量化玩家的实力。在现实中,任何比赛都有一定的随机性,所以任何评分系统都无法完全准确地反映玩家的实力。Elo评分系统只是一种尝试,试图通过历史比赛数据为每位玩家分配一个合理的评分。同时,由于每场比赛的结果都会影响玩家的Elo评分,因此这个系统也为比赛带来了额外的策略层面,玩家需要在维护或提高他们的Elo评分尝试新的策略之间进行权衡。"

以上就是Elo排名系统的基本原理和公式。

三、实例说明
若当前A玩家rating为1500,B玩家rating为1600
预估A玩家的胜负值Ea = 1/(1+10^[(1600-1500)/400])≈0.36
预估B玩家的胜负值Eb = 1-Ea = 1-0.36 = 0.64

假设A玩家获胜,实际胜负值为Sa = 1
A玩家最终得分为 R'a = 1500 + 32*(1-0.36) = 1500+20.5 = 1520,A玩家赢20分,B玩家输20分。

假设B玩家获胜,实际胜负值为Sa = 1
B队最终得分为 R'b = 1600 + 32*(1-0.64) = 1600 + 11.52 = 1612,B玩家赢12分,A玩家输12分。
PS:^符号代表次方运算。

四、天梯系统目的
1.保护新手不被有经验的玩家虐,让高手局中没有新手。
2.创造竞技和公平的游戏对局,使玩家的游戏乐趣最大化。
3.无需等待太久就能找到对手进入游戏。

五、具体实例
11对战平台的天梯实例。
下面的公式很好的说明了天梯积分的计算方法,而Si的计算则是取的ELO算法,虽然11的天梯还是存在Bug,但是不得不承认确实是很棒的设计。


 

公式里面除以400是什么原理

Elo的排名系统使用的公式中,除以400的部分,是为了将底数为10的对数尺度映射到合适的游戏或比赛的比例尺上。对于国际象棋来说,Arpad Elo选择了400,因为他发现这是一个适当的数值,使得一位排名高400分的棋手能以概率约0.75击败一位排名低400分的棋手。

为何选定400,具体原因还包括:在当时,棋手的排名在大约2000左右,他希望能有一个适当的区间,使得高手与新手之间的排名差距不会过大,也不会过小。而400这个数字可以满足他的需求。

然而,在其他的应用中,这个值可能会有所不同。例如,在线游戏可能会选择更大或更小的值,以适应更广泛的玩家群体和更快的游戏速度。

这篇关于RM奖励模型用到的Elo评分系统的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/209933

相关文章

防止Linux rm命令误操作的多场景防护方案与实践

《防止Linuxrm命令误操作的多场景防护方案与实践》在Linux系统中,rm命令是删除文件和目录的高效工具,但一旦误操作,如执行rm-rf/或rm-rf/*,极易导致系统数据灾难,本文针对不同场景... 目录引言理解 rm 命令及误操作风险rm 命令基础常见误操作案例防护方案使用 rm编程 别名及安全删除

JWT + 拦截器实现无状态登录系统

《JWT+拦截器实现无状态登录系统》JWT(JSONWebToken)提供了一种无状态的解决方案:用户登录后,服务器返回一个Token,后续请求携带该Token即可完成身份验证,无需服务器存储会话... 目录✅ 引言 一、JWT 是什么? 二、技术选型 三、项目结构 四、核心代码实现4.1 添加依赖(pom

基于Python实现自动化邮件发送系统的完整指南

《基于Python实现自动化邮件发送系统的完整指南》在现代软件开发和自动化流程中,邮件通知是一个常见且实用的功能,无论是用于发送报告、告警信息还是用户提醒,通过Python实现自动化的邮件发送功能都能... 目录一、前言:二、项目概述三、配置文件 `.env` 解析四、代码结构解析1. 导入模块2. 加载环

linux系统上安装JDK8全过程

《linux系统上安装JDK8全过程》文章介绍安装JDK的必要性及Linux下JDK8的安装步骤,包括卸载旧版本、下载解压、配置环境变量等,强调开发需JDK,运行可选JRE,现JDK已集成JRE... 目录为什么要安装jdk?1.查看linux系统是否有自带的jdk:2.下载jdk压缩包2.解压3.配置环境

Linux查询服务器系统版本号的多种方法

《Linux查询服务器系统版本号的多种方法》在Linux系统管理和维护工作中,了解当前操作系统的版本信息是最基础也是最重要的操作之一,系统版本不仅关系到软件兼容性、安全更新策略,还直接影响到故障排查和... 目录一、引言:系统版本查询的重要性二、基础命令解析:cat /etc/Centos-release详

更改linux系统的默认Python版本方式

《更改linux系统的默认Python版本方式》通过删除原Python软链接并创建指向python3.6的新链接,可切换系统默认Python版本,需注意版本冲突、环境混乱及维护问题,建议使用pyenv... 目录更改系统的默认python版本软链接软链接的特点创建软链接的命令使用场景注意事项总结更改系统的默

在Linux系统上连接GitHub的方法步骤(适用2025年)

《在Linux系统上连接GitHub的方法步骤(适用2025年)》在2025年,使用Linux系统连接GitHub的推荐方式是通过SSH(SecureShell)协议进行身份验证,这种方式不仅安全,还... 目录步骤一:检查并安装 Git步骤二:生成 SSH 密钥步骤三:将 SSH 公钥添加到 github

Linux系统中查询JDK安装目录的几种常用方法

《Linux系统中查询JDK安装目录的几种常用方法》:本文主要介绍Linux系统中查询JDK安装目录的几种常用方法,方法分别是通过update-alternatives、Java命令、环境变量及目... 目录方法 1:通过update-alternatives查询(推荐)方法 2:检查所有已安装的 JDK方

Linux系统之lvcreate命令使用解读

《Linux系统之lvcreate命令使用解读》lvcreate是LVM中创建逻辑卷的核心命令,支持线性、条带化、RAID、镜像、快照、瘦池和缓存池等多种类型,实现灵活存储资源管理,需注意空间分配、R... 目录lvcreate命令详解一、命令概述二、语法格式三、核心功能四、选项详解五、使用示例1. 创建逻

使用Python构建一个高效的日志处理系统

《使用Python构建一个高效的日志处理系统》这篇文章主要为大家详细讲解了如何使用Python开发一个专业的日志分析工具,能够自动化处理、分析和可视化各类日志文件,大幅提升运维效率,需要的可以了解下... 目录环境准备工具功能概述完整代码实现代码深度解析1. 类设计与初始化2. 日志解析核心逻辑3. 文件处