【科技24时区】当大语言模型(LLM)生成的文本如空气般弥漫在互联网的每一个角落,人类读者正急切地寻找辨别真伪的“嗅觉”。曾经那些显而易见的破绽——比如滥用破折号或频繁使用“delve”(深入探究)一词——早已成为历史。然而,研究人员指出,尽管旧有的痕迹被抹去,AI模型在撰写散文时仍会不自觉地退回到某些特定的语言习惯中。营销机构Graphite的一项最新研究深入剖析了前沿模型的写作癖好,试图从字里行间揪出每个模型独有的“口头禅”。
这项研究揭示了一个令人意外的发现:所谓的“露馅”特征,其覆盖范围远比想象中广泛。Graphite团队筛选出了13,000个短语,这些短语在AI生成内容中的出现频率至少是人类内容的两倍——这也是他们定义“露馅”特征的基准线。值得注意的是,不同模型的表现呈现出截然不同的演化路径。Graphite首席人工智能官Greg Druck向TechCrunch透露:“随着时间的推移,Claude系列模型实际上正在逐渐接近人类的词汇分布规律;相反,GPT系列模型则与人类表达方式渐行渐远。”
为了在大规模数据中精准捕捉这些细微差别,研究设计必须极为严谨。Graphite首先建立了一个包含10,000篇ChatGPT发布前文章语料库,作为纯人类写作的对照组。随后,研究人员让不同的AI模型根据摘要重写这些文章,旨在最大限度地消除源文本偏差。通过对比人类样本与各模型样本中特定词汇、短语的出现频率及句式结构模式,差异得以量化呈现。
数据显示,Claude Opus 5.5最显著的“身份标识”是单词“dependable”(可靠),其在AI文本中的出现频率比人类样本高出23倍。虽然Opus 5.5已摒弃了“It’s not X, it’s Y”这种生硬的对比句式,但它依然热衷于使用“is more than an X, it’s a Y”(不仅仅是X,更是Y)这类表达。更有趣的是,Opus似乎有一种强烈的冲动要向读者解释事物的重要性,其中“this matters”(这很重要)的使用频率比人类写作高出116倍,“why X matters”(为什么X重要)也高出92倍。
相比之下,OpenAI旗下的Astra模型则展现出另一套“泄露天机”的特征。该模型偏爱描述事物的“another dimension”(另一个维度),并倾向于通过声称某项行动“may provide”(可能提供)或“can provide”(能够提供)某种益处来对观点进行对冲修饰。Graphite将其最大的破绽称为“纠正性框架”,即把话题定义为“not simply X”(不仅仅是X)或提出替代方案“rather than relying on X”(而不是依赖X)。研究表明,这类句式在Astra生成的散文中出现的频率比人类写作高出100倍以上。
一个值得玩味的现象是,所有前沿实验室似乎都对“模型过度使用破折号”这一批评做出了回应。在Graphite的样本中,Opus 5.5使用破折号的频率比Opus 5减少了99%;Astra的使用率比人类样本低88%;而Gemini 3.1 Pro则几乎完全从写作中剔除了破折号。然而,尽管个别明显的“马脚”被修补,Graphite指出,整体上的“露馅”特征数量基本保持稳定。“这并不是说破绽在减少,”Druck表示,“它们成功移除了最广为人知的那些,但新的破绽又冒了出来。而且,每个模型版本都有自己独特的一套。”
鉴于各大实验室都在极力推崇类人化的写作风格,这种“破绽”的顽固存在着实令人惊讶。在发布Opus 5.5时,Anthropic曾夸耀该模型“比以往任何模型都沟通得更自然”,早期用户也认为其写作“更清晰、更易跟随”。OpenAI在发布GPT-6版本的Sol和Luna时也做出了类似承诺,称用户可以期待“更多的清晰度、更少的行话以及更少的怪异措辞”。
但从某种角度看,Druck对于实验室能否彻底消除这些标志性句式或短语持怀疑态度。“我的一个总体假设是,实验室对这些事情的控制能力比你想象的要弱,”Druck说道,“这些是拥有数十亿参数的巨型模型。它们能运行的测试次数是有限的,总有一些东西会漏网。”这或许暗示着,只要底层架构不变,AI试图模仿人类却又无法完全摆脱算法惯性的矛盾,将长期存在。
AI写作的“指纹”并未消失:前沿大模型暴露出新的语言习惯
科技区角
2026-10-02 04:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。