雨声里的杏花,与数字之外的判断
今天读一首访友诗、一段关于等待的英文原创散文,再看一个常被忽略的概率问题。三个板块可以分别读,不必寻找共同答案。
怀天经智老因访之
客子光阴诗卷里,杏花消息雨声中。
西庵禅伯还多病,北栅儒先只固穷。
忽忆轻舟寻二子,纶巾鹤氅试春风。
这首诗最值得慢读的地方,是它怎样让一个人从屋里走出去。开头的人刚睡醒,溪水已经流着,春天已经发生。他没有站在景色中心指挥万物,也没有宣布自己的情绪;一个“绿”字先把外面的世界带进来。
“客子光阴诗卷里”写一种很容易理解的生活:翻书、作诗,一天又过去了。书卷当然能安顿人,但“客子”也保留着寄居之感。人在屋里有自己的秩序,屋外有不等人的季节。下一句便把这两种时间接到了一起。
“杏花消息雨声中”没有直接写看见花。诗人听着雨,想到杏花:花开没有,雨会不会催开它,又会不会打落它?诗里没有替我们作答。“消息”也不是今天推送栏里的通知,更接近一种由细微迹象带来的知觉。眼前尚未出现的东西,先在听觉和想象里有了位置。
到这里如果只接一句“春色可爱”,就会变成一首漂亮而封闭的写景诗。陈与义却想起了两个人。一个多病,一个清贫,春天没有让他们的处境自动变好。这两句把景色的轻盈稍稍压住,让后面的出门带上关切,而不只是消遣。
最后的“试春风”尤其好。不是奋然振作,也没有把寻友写成道德义务,只是披上衣服,乘舟去试一试春风。诗题中的“怀”由此通向“访”:想念有了一个具体动作。我们不必把它硬读成生活建议,但可以欣赏这首诗的分寸——它让情绪落在一条船、一件衣服和一段路上。
A Few Minutes on the Platform
展开中文参考译文
火车晚点了,而这一次,我难得没有非赶到不可的地方。站台对面,一个女人正在剥橘子。她仔细地揭下细长的橘皮,放在折好的报纸上。身旁的男孩望着空空的铁轨,仿佛只要看得够用力,火车就会出现。
我拿出手机,没有找到想读的东西,又把它放回去。这一点小小的失败,让我奇怪地感到无处遮掩。站台、女人、男孩、下午,全在眼前。我得到几分钟没有用途的时间,第一反应却是赶快填满它们,不让它们向我提出任何要求。
一阵风穿过车站。橘皮下面的报纸动了动。身后某处关上一扇门,有人笑了。这些事都不重要,不值得记住,也许正因为如此,我才开始注意它们。它们不必成为故事,不必增进我的理解;它们只是在发生。
男孩问,火车是不是忘了我们。女人递给他一瓣橘子,说了句我没听清的话。他吃掉橘子,又看了一会儿铁轨,然后坐下来。那一刻,等待似乎成了一件人可以去做的事,而不是世界运作失灵的表现。
我想起自己经过了多少地方,却一心只想赶到别处。酒店房间只剩插座的位置,街道只剩路线,饭菜被压缩成两次约见之间的间隙。那些旅程没有什么不好,只是我常把路上的时间当作包装,想拆掉它,好拿到真正想要的东西。
广播终于响了。人们起身,拿好行李,重新成为乘客。女人用报纸包起橘皮。男孩走近黄线,又回头确认她正跟上来。我提起包,略有些舍不得,像要离开一场才刚刚开始的交谈。
什么都没有改变,只是下午不再空白。我在火车上找了个靠窗的位置,让手机留在口袋里。车缓缓驶出车站,几秒钟里,我还能看见刚才等候的地方。随后铁轨边升起一道墙,那里便看不见了。
这篇创刊原创用来观察你对英文难度和篇幅的反馈。正式选材将优先使用有可靠版本的公版散文或合规短摘,逐期注明作者和来源。
99% 准确,为什么仍可能误报很多?
想象一个内容平台用自动系统寻找违规帖子。宣传页说,它能找出 99% 的违规内容,同时也能正确放过 99% 的正常内容。这听起来相当可靠。现在有一篇帖子被标为违规,我们能说它有 99% 的可能真的违规吗?不能。还缺一个信息:原本有多少帖子违规。
把百分比还原成人和物
先设有 10,000 篇帖子,其中真正违规的只有 100 篇,也就是 1%。系统找出了其中 99 篇,漏掉 1 篇。剩下 9,900 篇是正常内容,系统虽然能正确放过其中 99%,仍会误标 99 篇。
因此,所有被标记的帖子共有 198 篇:99 篇真的违规,99 篇只是误报。随机取一篇被标记的帖子,真正违规的比例是 99 ÷ 198 = 50%。系统在两类内容上都有 99% 的识别表现,并不意味着它发出的每个警报都有 99% 的可信度。
这里没有数学魔术。正常内容太多,哪怕只误报其中很小一部分,也足以和真正找出的违规内容一样多。我们容易盯着“99%”,却忽略了这个百分比作用在多大的基数上。
换一个环境,同一套系统会给出不同结果
如果这次的 10,000 篇帖子里有 1,000 篇违规,系统就找出 990 篇,误报正常内容 90 篇。被标记的共 1,080 篇,真正违规的比例变成 990 ÷ 1,080,约 91.7%。系统本身的两项识别率没有改变,警报的含金量却明显不同。
这就是为什么在一个地方表现很好的筛查工具,搬到另一个地方不一定同样好用。除了模型、规则和阈值,要找的现象到底有多常见,也会改变结果的意义。一个专门收集可疑材料的队列,和所有新上传内容组成的大池子,不能直接共用同一种直觉。
一个容易反过来的条件
“违规时有多大概率被标记”,和“被标记时有多大概率违规”,问的是两个方向。前者从真实情况走向观察结果,后者从观察结果推断真实情况。把这两句话缩成“系统很准”,恰好抹去了需要分清的部分。
用人数或件数表达概率,常比只看百分比更直观。比如“每 10,000 篇里,99 篇命中,99 篇误报”,就很难再把 99% 的识别率直接当作 99% 的警报可信度。这种表示方式没有增加信息,却把被不同分母藏起来的信息放到了同一张桌上。
实际能用在哪里
看到“准确率很高”的宣传时,可以先补齐三个问题:它在什么样的数据上测出来?要找的目标在那里有多常见?误报和漏报分别是多少?如果只给一个准确率总数,你甚至无法还原上面的表。
另一个容易被忽略的情况是,目标极少时,一个从不报警的系统也能得到很高的总体正确率。在第一组数据里,永远判定“正常”,就能判对 9,900 篇,总体准确率为 99%,但它一篇违规也找不出来。因此评价指标要对应用途:发现线索和直接作出处理决定,所能容忍的错误通常不同。
这不等于罕见事件都不该查,也不等于所有警报都不可信。它提醒我们:警报是进一步判断的起点。要不要复核、如何复核、误报与漏报各有什么代价,需要结合实际任务决定;一个漂亮数字不能替这些问题作答。
关于不确定性判断的心理学研究,卡尼曼与特沃斯基讨论了人如何借助直觉捷径判断概率,以及这些捷径何时产生偏差。这里的数学算例是本刊独立构造的,不是某项实验结果,也不据此断言所有人都会犯同一种错。
想继续讨论?复制感兴趣的段落或本期链接,到你常用的 GPT 对话里即可。