
在谷歌搜索“青少年每天使用屏幕的时间多少才算过多”时,得到的不再是传统的链接列表,而是一段由人工智能生成的复杂回答。AI不仅引用了具体数字,还指出时间质量、睡眠、运动及情绪状态等因素比单纯的小时数更为关键。
另一项关于“是否应每日服用阿司匹林”的搜索中,AI在提供医疗信息并警告潜在风险的同时,表示若提供年龄和病史,可给出更具针对性的指导。
这些回答虽流畅权威,但属于不同类型。当前关于AI生成内容的争论多聚焦于准确性,然而准确性仅是评判标准之一。不同类型的回答要求用户从不同维度进行判断。
“答案字体学”:四种AI回答类型
弗吉尼亚大学图书馆馆长兼图书馆学院院长Leo S. Lo提出了一种名为“答案字体学”(answer typography)的分类法,将AI生成的回答归纳为四种基本类型:事实型、解释型、构建型和战略型。该分类法最初发表于《学术图书馆学杂志》。
尽管AI代理的回答可能混合多种类型,且以同样流畅的形式呈现,但识别其底层逻辑对于判断回复是否可直接使用至关重要。
事实型:核查来源
事实型答案做出原则上可通过证据核查的声明,例如“弗吉尼亚大学成立于何时”或“金的化学符号是什么”。
评估此类答案的稳健性,需将其与适当来源进行核实。如果回答引用了来源,应点击链接验证,而非仅将AI的回答本身视为证明。
解释型:审视证据选择
解释型回答建立在证据之上,但没有单一结论。例如“远程工作是否提高了生产力”或前述的屏幕时间问题。答案取决于纳入了什么证据、遗漏了什么,以及如何理解分歧。
谷歌对屏幕时间问题的回答显示,虽然初步提及两小时限制,但随后强调儿科指导意见更看重屏幕使用的质量和背景。美国儿科学会也指出,对于青少年没有确切的推荐时长,关键在于屏幕使用类型及其可能挤占的活动。
评估解释型答案时,不能仅检查事实。用户应思考:系统强调了什么证据?遗漏了什么?是否存在另一种合理的解释?一个有效的后续提问是:“支持不同结论的最强证据是什么?”
构建型:考量目的与受众
构建型答案是创造出来的,而非发现出来的。例如让AI起草求职信、撰写悼词或重组段落,这里没有唯一正确的结果。
评判标准在于目的、受众和语气。一篇悼词可能语法完美,但若听起来不像演讲者本人,或让家属感到平淡乏味,即为失败。用户需仔细阅读,评估其实际效果是否符合预期。
战略型:结合个人情境
战略型问题询问“该怎么做”,如“我应该买这套房子吗”或“我应该每天服用阿司匹林吗”。答案结合了信息与关于目标、风险、权衡和个人情况的判断。
在阿司匹林的案例中,谷歌警告风险并建议咨询专业人士,这与美国预防服务工作组(USPSTF)的指导方针一致,即低剂量阿司匹林的使用应个体化,权衡心血管益处与出血风险。
对于战略型答案,用户应自问:在建议适用于我个人之前,系统需要了解什么?需考虑利害关系、替代方案以及是否有资格的人士参与。最终判断权仍在用户手中,因为你是必须承受后果的人。
先问类型,再问对错
随着AI生成回答直接嵌入搜索结果,答案的类型可能在同一次交互中发生切换。报道医疗指南与决定如何将其应用于特定个人截然不同,而流畅的语调变化往往掩盖了这种差异。
作为用户,在质疑AI答案是否正确之前,应先识别AI代理进行了何种类型的智力工作。确定回答类型,将指引你下一步是该直接采信、进一步调查,还是寻求专业意见。