{"text":[[{"start":8.4,"text":"20世纪80年代,心理学家菲利普•泰特洛克(Philip Tetlock)注意到,那些备受尊敬、资历深厚的地缘政治分析师,往往对冷战的进展以及未来走向存在根本性分歧。这很不寻常。如果所谓的专家对如此重要的问题都能持有截然不同的看法,那么我们所说的“专家”究竟意味着什么?"}],[{"start":29.57,"text":"泰特洛克的做法,是从越来越广泛的专家群体中收集可验证的经济和政治预测,然后耐心等待,看看哪些预测最终准确。此次研究的成果是他于2005年出版的《专家政治判断:究竟有多准确?我们如何得知?》。事实证明,这些领域专家的预测能力仅比随机投掷飞镖的黑猩猩略胜一筹。"}],[{"start":53.65,"text":"泰特洛克的著作重创了预测者群体本已脆弱的声誉,但他并未放弃这样一种可能性:预测可以做得更好。在《超预测》(2015年)一书中,他与合著者丹•加德纳(Dan Gardner)介绍了一批真正技艺高超的预测者,并着重分析了令他们表现出色的一些特质和习惯。泰特洛克罕见地使用了夸张手法,将这些人称为“超级预测者”。"}],[{"start":79.12,"text":"泰特洛克研究的影响之一,是如今许多人开始公开作出可验证的预测,其中包括一些经过认证的“超级预测者”。"}],[{"start":88.32000000000001,"text":"因此,最新进展——恕我直言——并不出人意料。为什么不把一些已经发表且可以检验的预言,与大型语言模型(LLM)和其他AI系统生成的预言进行比较?例如,AI系统在预测利率决策方面是否能跑赢市场?(不能,不过也不比市场差。)"}],[{"start":107.64000000000001,"text":"但让计算机作出这类宏观预测,并不只是为了测试其预测能力。这也和泰特洛克在20世纪80年代末开展的早期研究一样,旨在戳穿胡扯,检验真正的能力。专家和大型语言模型都擅长作出貌似合理的自我辩解;一个糟糕的预测,或一个准确的预测,都会为审视这些解释带来新的视角。毕竟,泰特洛克2005年出版的书,主题并不是预测,而是专家判断。评估AI系统能力的一种方式,是向它提出一个迄今无人知晓答案的问题。"}],[{"start":141.85000000000002,"text":"预测研究所(Forecasting Research Institute)的一项名为ForecastBench的项目正在开展这项评估。该研究所主席菲利普•泰特洛克(Philip Tetlock)领导的ForecastBench报告称,结果已经相当亮眼,而且还在不断提升。超级预测员在ForecastBench预测准确度指数上的平均得分为68.9分。目前,表现最好的专业AI预测员得分已达到68.8分。普通人的预测平均得分为62.8分,而未经特别调校的常规大型语言模型得分超过61分。"}],[{"start":174.60000000000002,"text":"在讨论应多大程度上认真看待这些数字之前,我们首先要弄清楚它们的含义。一种理解方式,是设想有一名预测者对每次预测都表现出十足信心:对某些结果给出100%的概率,对另一些结果给出0%的概率,而且每次都预测正确。这位无所不知的预言者将得到100分,即最高分。另一名预测者则耸耸肩,宣称每种结果出现的可能性都是五五开;其得分将达到“黑猩猩基准”:50分。"}],[{"start":206.47000000000003,"text":"一名预测者如果碰巧把一系列事件发生的概率都判断为68.9%,而这些事件随后全部发生;同时又把另一组事件发生的概率判断为31.1%,而这些事件一个也没有发生,那么他同样可以取得68.9分的“超级预测者”得分。这样的基准远胜于凭空猜测,却远不及无所不知。"}],[{"start":229.13000000000002,"text":"或许,我们不该因为普通大型语言模型在预测“乌克兰是否会在与俄罗斯停火前举行总统选举?”等事件方面仅略逊于人类,就对其刮目相看。无论是人类还是计算机,其预测结果都更接近靠扔飞镖作出判断的灵长类动物,而非完美预测。"}],[{"start":250.37000000000003,"text":"如今,专业AI预测员似乎已与备受推崇的超级预测员难分伯仲,这一事实更令人印象深刻,但需要注意的问题还有很多。首先,ForecastBench的比较并不完全是同类比较:人类超级预测员在2024年回答的是一组问题,而AI系统如今回答的是另一组问题。这使得两者的比较存在疑问,因为显然有些问题比其他问题更容易回答:“苏格兰会在10月底前宣布脱离英国独立吗?”显然比“弗拉基米尔•普京(Vladimir Putin)将在2030年底继续担任俄罗斯总统吗?”更容易回答。"}],[{"start":288.07000000000005,"text":"ForecastBench试图对这些问题的难度进行调整,但承认这种比较“依赖于一种随着时间推移而日益不可靠的统计外推”。ForecastBench承诺将收集更多人类预测,因此我们或许很快就能了解更多情况。"}],[{"start":304.49000000000007,"text":"预测并不只是描述未来;它们往往试图塑造未来。仅仅想到由全球最强大的企业控制的系统所生成的高度准确的计算机预测,就足以令人难以完全安心。著有《预言:从古代神谕到人工智能的预测、权力与未来之战》的卡丽莎•韦利斯(Carissa Véliz)说:“要确切知道某人明天会在哪里,唯一的办法就是让他去那里。”"}],[{"start":329.2300000000001,"text":"但即便AI预测系统最终证明自身既无过错又准确无误,仍有一些要素缺失。预测之所以往往有价值,不仅在于结果——即描述未来事件发生概率的一个数字——还在于预测过程本身。"}],[{"start":344.75000000000006,"text":"这里可以类比使用大型语言模型写文章:无论最终结果多么出色,输入提示词并按下按钮的人,都错过了构思、起草和反复修改文章这一思考过程。"}],[{"start":356.2300000000001,"text":"预测也是如此。高质量的情景规划演练之所以有价值,不仅在于它可能对未来的种种可能性作出一些发人深省的描述,更在于它能让专家和决策者聚在一起,以结构化的方式思考那些难以预测的事情。"}],[{"start":372.00000000000006,"text":"泰特洛克本人与合著者芭芭拉•梅勒斯(Barbara Mellers)和哈尔•阿克斯(Hal Arkes)发现,参加预测竞赛往往有助于减少政治两极分化——这可能是因为,作出准确预测需要保持开放心态,能够以他人的视角看待世界,并且愿意承认错误。"}],[{"start":388.22,"text":"善意预测是一种让人类变得更好的实践。在把这项任务交给机器之前,我们应三思。"}],[{"start":395.51000000000005,"text":"第一时间了解我们的最新报道——关注《FT周末杂志》(FT Weekend Magazine)X以及FT周末版Instagram"}]],"url":"https://audio.ftcn.net.cn/album/a_1789746939_1941.mp3"}