蒙特卡洛树方法MCTS中模拟阶段是怎么快速下一盘棋的?

MCTS模拟阶段蒙特卡洛树模式如何快速下一盘棋?
蒙特卡罗解决问题的过程可以概括为三个主要过程:结构或描述概率过程;从已知概率分布中取样;创建各种估计量。蒙特卡罗解决问题的三个主要过程:(1)结构或描述概率过程(2)从已知概率分布取样(3)创建各种估计应用到期权,但不完全一样,因为有时太简单,如果蒙特卡罗过程本身偏离具体,就没有意义,所以二叉树是一个理想的状态。
如果你能知道你喜欢什么,感觉很好,就用手机。
MCTS怎么考?
1.MCTS认证只有一个考试内容,只要通过考试,就可以获得MCTS资格,但MCTS的开发设计要求考生必须先按70-536进行:TS:Microsoft .NET frameworkApplication Development Foundation,只有这样,我们才能获得开发设计的MCTS认证资格。参考资料主要是微软企业的TraingKit系列和MOC系列,还有Sybex的学习指南,考前最强化的是易证宝材料。
2.MCTS翻译是微软认证技术专家,是微软认证系统中最基本的证书,其证书水平相当于之前的MCP认证,作为MCP认证后续证书,MCTS代表对微软技术或产品有足够的专业能力,可以实施建设和管理(对于网络管理或系统管理人员) 或程序编写能力(对于开发者)。
mcts考试内容是什么?
1.MCTS认证只有一个考试内容,只要通过考试,就可以获得MCTS资格,但MCTS的开发设计要求考生必须先按70-536进行:TS:Microsoft .NET frameworkApplication Development Foundation,只有这样,我们才能获得开发设计的MCTS认证资格。参考资料主要是微软企业的TraingKit系列和MOC系列,还有Sybex的学习指南,考前最强化的是易证宝材料。
2.MCTS翻译是微软认证技术专家,是微软认证系统中最基本的证书,其证书水平相当于之前的MCP认证,作为MCP认证后续证书,MCTS代表对微软技术或产品有足够的专业能力,可以实施建设和管理(对于网络管理或系统管理人员) 或程序编写能力(对于开发者)。
搜索蒙特卡洛树 - 用蛮干抵抗智慧
搜索蒙特卡洛树(Monte Carlo tree search;简称:MCTS)它是一种启发式搜索算法,用于一些决策过程,最引人注目的是在游戏中的应用。一个关键的例子是计算机围棋程序,它也用于其他棋盘游戏、即时在线游戏及其不确定性游戏。
比如围棋,棋手一定要根据盘面的情况,选择下一步走哪个位置。
这个决策过程可以被认为是决策函数 a = f(s) ,即应对 可能状态s , 决策函数f 会提供一个 行动a (落地位置)。自然,我们希望 f 尽可能好,它的决策a可以尽可能赢棋。 我们也可以把f结构变成决策树。从盘面初始状态开始(无棋盘),初始状态为根节点。第一手棋有19*19=361个位置。因此,根节点下有361个子节点,第二手棋有360个可能位置,即在361个节点下,每个节点有360个子节点...随着双方的落地,树枝越来越多,每个分支最终都会进入叶子状态(游戏结束后,黑胜或白胜)。
理论上,我们可以列出所有可能的情况,做一个完整的决策树,但事实上,这个数据太大了,无法完成。因此,我们应该在有限的时间和空间内有效地建造一棵子树,这是一棵不完整但不完整的子树 尽可能好的决策树 。 即使只是尽可能好的决定,也是非常困难的。
因为一步棋的质量一般不能马上判断,所以最终的评价需要在下一步才能决定谁赢。而且,即使赢了棋,也不代表每一步都好。 然而,无论如何,我们必须提供一些方法来让人工智能知道一步棋是怎样的,也就是说,我们必须提供一些 启发 ,所以我们可以采用蒙特卡洛树搜索的方法。 刚才我们说下一盘棋不能判断路线的好坏,但是如果下很多次呢?比如在特定盘面S1的前提下,进行n场比赛(然后S1盘面往后走)。如果统计得到更多的黑棋,说明S1的情况对黑棋更有利。
这就是蒙特卡洛的概念,用大量的随机事件来接近真实情况。 虽然蒙特卡罗法类似于估计一种情况,但我们仍然不能估计太多的情况。因此,我们应该有选择地集中精力估计决策树中可能更有价值的节点。
这就需要蒙特卡洛树搜索的应用,它提供了一个选择系统,让我们尽可能选择决策树中更有潜力的节点进行蒙特卡洛模拟,让树木尽可能集中在“更好”的策略上进行“成长”。 蒙特卡洛树搜索有四个关键过程: 从根节点R开始,选择连续的子节点到叶子节点L。蒙特卡洛树搜索的本质是将决策树扩展到最佳位置。也就是说,选择一个尽可能“有潜力”的树节点,那么什么样的节点有潜力呢? 一是胜率高,二是考虑频率少 。
获胜率强的节点(情况)意味着最终获胜的机会更大。当然,我们应该花更多的精力来分析它的后续路线。调查频率较低的节点意味着节点(情况)没有得到充分研究,有可能成为黑马。 具体来说,一般采用UCB1(Upper Confidence Bound,上置信区间)公式计算节点的“潜力”: wi:第 i 移动后获胜的频率 ni:第 i 移动后模拟的次数 c:理论上,探索参数/衡量参数等于探索参数/衡量参数 根号2,在实践中,一般可以根据经验来选择 t:仿真总频率等于全部 ni 的和 看一个例子(参考 28 天自制你的 AlphaGo(五) ) 上图中的每个节点代表一种情况。而 A/B 代表这个节点被浏览 B 第二,黑棋胜利了 A 次。
例如,一开始的根节点是 12/21,代表一共模拟 21 第二,黑棋胜利了 12 次。 图中显示了蒙特卡洛树搜索的四个步骤。让我们看看左边第一棵树。(Selection)。假设根节点是去黑棋。所以每个人都必须先在那里 7/10、5/8、0/3 选择上述UCB1公式: 假定 C 相对较小(如C=1),以上三个成绩为 1.25 1.245 1、所以我们选择了 7/10 节点(其得分1.25为最高)。
随后接下来 7/10 下边的 2/4 和 5/6 之间挑选。注意,因为目前是白棋,所以需要估计胜率。即图上黑棋的胜率是 2/4 和 5/6,白棋赢率为5/6, (1 - 2/4) 和 (1 - 5/6): 那么应该选择白棋 2/4 节点。
(图上扩展的是 5/6 节点,这不是很合理)。 在选定的叶节点L中,如果你已经能够判断结果,比赛将结束,否则建立一个或多个子节点并选择其中一个节点C。 看中图第二棵树(Expansion),假设选择了黑棋(目前)叶节点 3/3,然后创建一个子节点,初始状态 0/0。
从节点C开始,使用随机对策进行游戏,直到输赢(获得准确的回报)。这一步也被称为playout或rollout。 虽然蒙特卡洛方法原则上是随机对策,但实际上也可以采用一些“有经验”的策略,或者两者的融合。所谓有经验的对策就像一个有一定水平的棋手,ta 能够下出一些更好的路线。
您可以在模拟的某个阶段选择棋手的路线,在其他阶段选择随机路线。 但一般来说,仿真必须快速完成,才能得到尽可能多的仿真结果,使统计结果接近真实赢率。 看中图第三棵树(Simulation),黑棋从 0/0 节点开始启动模拟游戏直到结束,假设黑棋输了,所以评分是 0/1。
应用随机游戏的结果,升级从C到R路径的节点信息。 看中图第四棵树(Backpropagation),从 0/0 该节点开始遍历父节点,直到根节点R,该方法中的每个节点都添加了一个 0/1。 当蒙特卡洛树建成后,必须用它来做决定时,选择浏览量大的节点,而不是胜率最高的节点,而不是UCB成绩最大的节点。 浏览量不够大的节点,即使赢率高,也不够可靠(因为模拟频率不够)。
浏览量大的节点通常有一定的赢率。想想UCB公式,如果赢率不高,就不会经常被选中(浏览量不会大)。因此,如果选择浏览量大的节点,人工智能的性能会更加稳定。
拿到微软的mcp和mcts证书能找到什么样的工作?
只是一个证书,不一定能得到什么样的工作。微软认证专家 (MCP = Microsoft Certified Professional) 可以证明行业对你的微软产品和技术知识和掌握程度的肯定。
MCTS证书可以认证你是微软认证技术的专家。
但在实际的工作场所要求中,你必须有学位文凭,至少是计算机专业的大学。这样,你就可以在专业的it企业中找到一份好工作。另一个建议是,不要相信一些培训机构的宣传,说你可以通过培训获得证书来获得高薪,这在现实中是非常困难的。建议上一所全日制学校来获得一份好工作。
毕竟光有学历和证书是不够的,也需要能力。
微软的MCP和MCTS证书用途大吗?
MCP是微软认证专家(Microsoft Certified Professional )简称英语,是美国微软企业建立的一套专家认证,也是全球公认的计算机技术高端人才认证体系,也是全球公认的计算机技术高端人才认证体系。如果一个人通过了MCP认证,至少说明他在掌握微软发布的特殊产品方面达到了高级专家的水平。
本文由“碎碎的我”发布,不代表“写客百科”立场,转载联系作者并注明出处:https://www.ixieke.com/zonghe/170892.html
