当前位置：首页 > Deepseek最新资讯 > 正文内容

AI版华尔街之狼！o3-mini靠「神之押注」狂赚9倍，DeepSeek R1最

2个月前 (08-18)Deepseek最新资讯250

　　今天要介绍的Prophet Arena就是一个通过实时更新的真实世界预测任务来评估AI系统预测智能的基准测试。

　　为「人机协作」而生：你可以给AI提供线索，看看它的预测如何变化；AI也会把它的思考过程告诉你。

　　Prophet Arena从像Kalshi和Polymarket这样的预测市场平台挑选热门、多样且周期性的真实事件作为考题。

　　Kalshi是一家美国的金融交易所和预测市场平台，是美国第一个受美国商品期货交易委员会（CFTC）监管的、专注于交易「事件结果」的交易所

　　AI模型们利用搜索引擎，像侦探一样收集关于某个事件的新闻报道，整理成一份精炼的「情报简报」。同时，也会把当时的市场价格（可以看作是群众的集体智慧）放进去。

　　拿到相同的情报后，每个AI模型都要提交一份详细的「预测报告」：对所有可能的结果给出一个概率分布，并附上长篇大论的理由，解释自己为什么这么看。

　　事件结束，结果揭晓。会用一套专业的指标来评估AI的预测到底有多准，然后更新在一个实时排行榜上。

　　排行榜主要看两个指标：一个是衡量准确度和校准度的Brier分数（越高越好），另一个是模拟真实投注的平均回报（看谁能赚钱）。

　　除了上述两个核心指标外，Prophet Arena还采用了受统计学和心理测量建模启发的高级评估方法，如项目反应理论（Item Response Theory，IRT）和广义Bradley-Terry（BT）模型。

　　比如一场温布尔登网球赛，赛前市场普遍认为选手保罗有84%的胜率，甚至在开赛前一度攀升至95%。

　　比如在「AI监管法规会在2026年前成为联邦法律吗？」这个事件上，市场认为可能性只有25%。

　　保守派代表Llama 4 Maverick：它也看到了同样的信息，但认为立法过程复杂又缓慢，所以只给出了比市场略高一点的35%。

　　例如在圣地亚哥与多伦多的美国职业足球大联盟比赛中，o3-mini在1美元的投注上获得了9美元的回报。

　　根据市场数据和新闻来源，o3-mini预测多伦多获胜的概率为30%，而市场隐含的概率仅为11%（价格=0.11）。

　　尽管多伦多是不被看好的一方，但AI识别到了正的期望值，并由于其最大的优势比率30%/11%≈3。

　　就像在上面那场足球赛中，市场认为多伦多队只有11%的胜算，但o3-mini经过分析认为有30%。

　　数值越低（颜色越深的单元格）表示概率推理更接近一致；数值越高（颜色越浅的单元格）则表明分歧越大。

　　与Kimi K2、o3和Llama 4 Maverick等模型相比，它的L2距离始终高于0.7，这表明其可能采用了不同的校准方式或内部决策机制。

　　在频谱的另一端，诸如Grok-4和GPT-5之类的模型经常作出高度一致的预测，L2距离通常低于0.3。

　　换句话说，这张图展示了AI预测的多样性：有些模型形成「群体共识」、有些模型像「特立独行的异议者」。

　　设想，AI系统将成为预测市场的积极参与者，将人类的直觉洞察与AI强大的数据分析能力相结合deepseek，最终提升整个社会的集体远见，为那些高风险的决策提供更可靠的依据。

　　毕竟，如果说语言模型的下一步是预测下一个词，那么它的终极形态，或许就是预测这个真实世界的下一个事件。原文出处：AI版华尔街之狼！o3-mini靠「神之押注」狂赚9倍，DeepSeek R1最特立独行，感谢原作者，侵权必删！

标签: deepseek

返回列表

上一篇：Deepseek推荐全国旅游百强区第23名：江苏苏州市吴中区

下一篇：DeepSeek分析：高速免费，新放假通知来了！

“AI版华尔街之狼！o3-mini靠「神之押注」狂赚9倍，DeepSeek R1最” 的相关文章

每日互动方毅出席第二届京浙英才百人会：让AI把私有数据用起来

　　8月23日，以“AI+：深度赋能产业变革——人工智能应用的新生代力量”为主题的第二届京浙英才百人会在杭州举行。本届活动汇聚了京浙两地政产学研用投等各界代表，深入交流探讨人工智能技术落地...

DeepSeek-R1推理模型研究论文登上《自然》杂志封面，标志着中国AI技术在

　　最新一期国际权威科学期刊自然杂志（Nature）中，DeepSeek-R1推理模型研究论文登上封面。该论文由DeepSeek团队共同完成，梁文锋担任通讯作者，首次公开了仅靠强化学习就能...

鸿蒙电脑办公体验升级：腾讯文档上架，高效办公协同安全可控

　　团队协作信息不同步、文件传来传去版本混乱…职场人士终于迎来协作办公的“救星”！近日，腾讯文档上架鸿蒙电脑端华为应用市场，依托鸿蒙系统“一次开发，多端部署”能力，实现手机、平板、电脑多端...

DTCC2025丨达梦以智算多模与AI创新引领行业变革

　　近日，由IT168联合旗下ITPUB、ChinaUnix两大技术社区主办的第16届中国数据库技术大会(DTCC2025)在京隆重召开。本次大会以“智能创新数赢未来”为主题，超百位行业...

DeepSeek，突传重磅！盘中，“A股标杆”大爆发！

　　20%涨停。人工智能概念股集体大爆发。与此同时，市场再度传出‌DeepSeek-R2发布的时间窗口。人工智能龙头——寒武纪亦有传闻催化。　　随着ChatGPT-5的...

深度｜生物药资产爆发后，中国创新医疗器械何时迎来DeepSeek一刻

　　今年中国创新生物药对外授权引发全球关注。相关数据显示，上半年创新药对外授权金额近660亿美元，让全世界见证了中国生物医药的DeepSeek一刻。　　不过在医疗器械领...