模仿得到吗?还不能:LLM 仍难以模仿日常作者的隐性写作风格

原题:Catch Me If You Can? Not Yet: LLMs Still Struggle to Imitate the Implicit Writing Styles of Everyday Authors

作者:Zhengxiang Wang(石溪大学)、Nafis Irtiza Tripto(宾州州立大学)、Solha Park、Zhenzhen Li(Bosch 人工智能中心)、Jiawei Zhou(石溪大学)

出处:arXiv:2509.14543v1 [cs.CL] · 2025-09 · 数据与代码:github.com/jaaack-wang/llms-implicit-writing-styles-imitation

本文件为论文全文中文译稿(供研究参考)。正文、附录与全部表格均翻译;图例保留原图;附录中的提示词(prompts)保持英文原文以便直接使用。参考文献列表未翻译。

摘要

随着大语言模型(LLM)日益融入个人写作工具,一个关键问题浮现:LLM 能否仅凭少量示例忠实模仿一个人的写作风格?个人风格往往细微而隐性,难以通过提示词显式指定,却对"与用户对齐的生成"至关重要。

本文对当前最先进 LLM 通过上下文学习、从少量用户手写样本中模仿个人写作风格的能力进行了全面评估。我们引入了一套互补指标组合——包括作者归属(AA)、作者验证(AV)、风格匹配与 AI 检测——以稳健地评估风格模仿。评估覆盖新闻、邮件、论坛、博客等领域,每个模型超过 40,000 次生成,涉及 400 余位真实作者。

结果显示:LLM 能在新闻、邮件等结构化文体中近似用户风格,但在博客、论坛等细微的非正式写作上力不从心;生成结果往往退回平均化的通用语气,且容易被识别为 AI 生成。对多种提示策略(如示例数量)的进一步分析揭示了有效个性化的关键局限。我们的发现凸显了 LLM 个性化适配的根本性差距,以及改进隐性、风格一致生成技术的必要性。为促进后续研究与可复现性,我们开源了数据与代码。

1 引言

人每次写作都会留下独特的语言指纹(Svartvik, 1968)——这是对个人风格微妙而潜意识的反映。为提升写作,人们早已使用从拼写/语法检查器到复述工具的各种写作辅助(Ferris, 2004)。而大语言模型(LLM)的兴起带来了强大的"一站式"助手,能够起草、编辑与改写文本(Wasi et al., 2024)。尽管 LLM 的流畅度令人印象深刻,它们却常常默认使用从海量网络数据中学到的通用风格,抹去了让写作显得真实的个人印记(Padmakumar & He, 2024)。这引发了"作者身份稀释"与被标记为 AI 生成内容的担忧(Tripto et al., 2024)。

隐性个性化写作模仿任务示意
图 1:隐性个性化写作模仿任务:给定某位日常作者的少量写作示例与一份内容摘要,提示 LLM 生成一篇模仿示例风格、并反映摘要语义的新文本。

为应对这些担忧,一些系统(如 Claude AI)提供语气、声音、正式度等可配置参数。然而这些控制手段收效有限——用户的个人风格细微精妙,很难被几个滑块概括(Kang & Hovy, 2021)。更自然的方案是用个人既往写作的示例来引导模型,即以少样本提示更忠实地模仿个人风格(如图 1 所示的任务)。LLM 已展现出模仿公众人物(Herbold et al., 2024; Chen & Moscholios, 2024)与虚构角色(Li et al., 2023)的潜力——这些对象在互联网上数据足迹丰富、易于建模——但它们复现日常用户风格的能力仍基本未被探索。

仅凭少量日常交互、没有任何显式风格定义,LLM 真能适应一位日常作者的风格吗?

面向普通用户的个人风格生成研究有限(Bhandarkar et al., 2024; Cho et al., 2025),更迫切的问题是缺乏稳健的评估:我们如何判断 LLM 生成文本在风格与声音上是否属于同一个人?作者身份概念本质上主观,但司法语言学中成熟的作者归属(AA)与作者验证(AV)等计算方法提供了有前景的代理指标。"语言个体性理论"(Nini, 2023)认为,一个人的写作风格往往构成一致的"风格模型"。若 LLM 生成的文本既能落入该风格模型、又能被两套计算作者模型判定为同一作者,我们就离真正个性化的文本生成更近了一步。

本文考察 LLM 能否在无显式风格指令的条件下,通过上下文学习模仿日常用户的隐性写作风格(任务见图 1)。我们的研究植根于一个现实场景:大多数用户通过标准界面而非定制插件或微调管线与 LLM 交互(Wang et al., 2024)。尽管个性化微调(Liu et al., 2024)或高级提示策略(Cho et al., 2025)能改善风格对齐,但在时间敏感的真实场景中往往不切实际。因此我们聚焦评估当前 LLM 的"开箱即用"能力:以少量用户书写样本为条件复现个人写作风格——这正是实践中最易获得、最具可扩展性的隐性个性化形态。

为此,我们对最先进 LLM 在个性化写作模仿任务上的表现做了全面评估。该任务定义为:仅从既往写作样本出发、无显式风格指令、以内容摘要进行语义约束地模仿个体隐性写作风格(见图 1)。鉴于个人风格难以度量,我们采用多角度计算评估器:作者归属、作者验证、语言学根基的风格指标,以及最先进的 AI 检测工具。这一组合可对"风格忠实度"与"类人生成"进行稳健而多面的评估。

基于该框架,我们评估了来自 OpenAI、Google、Meta、DeepSeek 的前沿模型,覆盖新闻、邮件、论坛、博客等具有不同风格约束的写作领域。数据集涉及 400 余位作者,并基于既有工作构建以确保多样性与真实性。我们考察:少量既往写作的少样本演示,是否足以让 LLM 生成匹配作者声音与风格的输出。

结果显示:LLM 在新闻、邮件等较结构化文体中能部分模仿用户风格,但在博客、论坛等细微非正式表达上表现挣扎;输出常退回平均化、通用化的语气,且容易被识别为 AI 写作。此外,增加演示数量对风格对齐的增益有限。这些发现凸显了上下文个性化当前的局限,并指出需要更有效的方法来实现真正个性化的生成——这是 LLM 写作工具民主化的关键一步。

2 相关工作

LLM 个性化涵盖从人格模拟(Tseng et al., 2024)到个性化内容推荐(Lyu et al., 2024)的广阔谱系。本文则聚焦于更微妙的隐性个性化写作模仿挑战:LLM 能否生成体现"从个体既往写作中学到的隐性风格"的文本。为此,我们梳理"基于 LLM 的个性化写作"与"围绕 LLM 生成文本的作者分析"两个方向的进展。

研究总体方法示意
图 2:研究总体方法。(A)把每位作者的写作样本划分为训练集与测试集;从训练样本中选取少样本示例,引导 LLM 依据测试样本摘要生成新文本。(B)用四种方法评估 LLM 对作者风格的模仿程度:(1)AA:模型是否把 LLM 生成样本判定为目标作者所写?(2)AV:模型是否判定 LLM 生成样本与人类写作样本出自同一作者?(3)风格分析:LLM 生成样本与人类样本的风格分布有多相似?(4)AI 生成检测:模仿人类写作的 LLM 样本能否被检测为非 AI 文本?

面向个性化写作的 LLM。LLM 的进展已在通用文本风格迁移上取得出色表现(Toshevska & Gievska, 2025),个性化文本生成也日益受到关注(Zhang et al., 2024)。既往工作多聚焦于复现知名人物的风格:作家(Mikros, 2025; Dinu et al., 2025)、名人(Herbold et al., 2024; Chen & Moscholios, 2024)或虚构角色(Li et al., 2023; Park et al., 2025)——这些对象拥有充足训练数据与丰富背景设定。然而,复现普通人风格的研究仍很欠缺,尤其是严格、系统的评估。

近期一些研究尝试用检索增强生成(RAG)系统(Mysore et al., 2024)或"试错-解释"(Trial-Error-Explain)等高级上下文提示策略(Cho et al., 2025)实现个体化生成,但这些方法往往成本高、难以实时化,或依赖多轮 LLM 查询。关键是,这类研究通常依赖 LLM-as-a-judge(Zheng et al., 2023)度量风格对齐;虽然 LLM 在作者分析任务上表现不凡(Huang et al., 2024),其判断仍主观,且可能对自己生成的内容存在偏好偏差(Panickssery et al., 2024)。

另一些评估使用 ROUGE、METEOR 等指标(Kumar et al., 2024)——它们衡量内容重叠,却忽略风格忠实度。作者归属(AA)也曾被使用(Bhandarkar et al., 2024),但通常限于狭窄领域或单文本续写,缺乏更全面的风格考量。因此,我们提出一个植根于作者分析与文体计量学的综合评估框架,系统考察 LLM 能否真正复现个人写作风格。

作者分析任务。为评估 LLM 能否真正复现个体风格,我们借鉴成熟的作者分析任务:作者归属(AA)从候选作者集合中识别文本作者(Kjell et al., 1994);作者验证(AV)判断两段文本是否同一作者(Halteren, 2007)。这些任务传统上依赖 n-gram 与文体计量线索,如词汇、句法、语义与结构模式(Stamatatos, 2009; Koppel et al., 2012; Juola & Stamatatos, 2013; Neal et al., 2017)。经典机器学习与深度模型长期用于文体计量,而微调后的 Transformer 模型目前代表了 AA/AV 的最先进水平(Tyo et al., 2022; Tripto et al., 2023)。近来,文体计量分析也被用于检测 LLM 生成文本(Herbold et al., 2023; Muñoz-Ortiz et al., 2024; Casal & Kessler, 2023),为评估 LLM 输出是否贴合目标个人风格提供了有前景的路径。

3 方法

本研究评估 LLM 能否在无任何显式风格指令的情况下,仅凭少量既往示例模仿用户的隐性写作风格。我们考虑如图 1 所示的现实场景:用户提供少量写作样本与一份内容摘要——即典型少样本提示——而不详细描述自己的风格(即便可行,这也颇有难度)。该设定无需模型定制,提供了一条可扩展的个性化路径。写作风格会随时间演变(文体计时学 stylochronometry 研究此现象,Can & Patton, 2004),但那主要关注小说家或公众人物的长期变化(Stamou, 2007; Klaussner & Vogel, 2015);在我们的语境中,假设个体在日常写作中保持相对稳定的风格——这一假设既实用也合理。

图 2 给出了方法论的总体图示。下文结构:3.1 任务设定、3.2 评估框架、3.3 数据集、3.4 设计选择与局限讨论。

3.1 任务设定与符号

我们形式化"隐性个性化写作模仿"任务。给定人类作者 \(a \in A\)(\(A\) 为全体作者集合),记 \(T_a\) 为作者 \(a\) 的全部写作样本集合。把 \(T_a\) 划分为训练集 \(T_a^{tr}\)(用于抽取少样本写作示例)与测试集 \(T_a^{te}\)(用于评估)。对任一测试样本 \(t_a \in T_a^{te}\),用 \(n\) 个写作样本 \(T_a^{tr'} \subseteq T_a^{tr}\) 和 \(t_a\) 的内容摘要 \(S_{t_a}\) 提示 LLM \(L\),生成新文本 \(t_a^L\),即形式化地 \(L(T_a^{tr'}, S_{t_a}) \to t_a^L\)(见图 2(A))。这里摘要 \(S_{t_a}\) 用于固定生成文本的内容(语义),从而使我们能在语义受控条件下专注评估 \(t_a^L\) 与作者写作风格的对齐程度。

评估时同时考察两方面:生成文本 \(t_a^L\) 对作者 \(a\) 整体写作风格的忠实度,以及 \(t_a^L\) 与具体测试样本 \(t_a\) 在固有风格上的接近程度。

3.2 个性化写作评估框架

为衡量 LLM 复现隐性个人风格的程度,我们提出一个植根于计算作者分析与"类人度检测"的多角度评估框架(见图 2(B)),包含四个组件:

这些指标共同使我们能够以计算方式探查 LLM 生成文本是否与目标作者保持风格一致,从而可靠地评估个性化生成。

3.3 数据领域

我们使用表 1 所列四个数据集的子集:Enron(Klimt & Yang, 2004)、Blog(Schler et al., 2006)、CCAT50(Liu, 2011)、Reddit(Völske et al., 2017)。四个数据集代表四种迥异的文体(邮件、博客、新闻、论坛),合计约 400 位作者。格式上,邮件与新闻较结构化、正式,博客与论坛则更随意、非正式。这些特性为在真实场景中评估 LLM 的跨文体风格模仿能力提供了全面试验台。

我们对原始数据集做严格的长度控制采样,并把选中样本均匀划分为训练/测试集(详见附录 A)。除长度控制外采样完全随机,以在大规模采样下保证代表性。

3.4 任务设计的合理性讨论

微调常被视为实现个性化生成的可靠方法(Tan et al., 2024; Zhang et al., 2024),但我们有意回避:其一,真实用户通常只能提供少量写作样本,不足以有效微调;其二,为每位用户维护独立的微调模型成本高昂、难以规模化(Han et al., 2024)。此外,需要多轮 LLM 往返交互的复杂提示技术(如 Cho et al., 2025; Bhandarkar et al., 2024)会引入显著延迟与 API 开销,不适合实时使用(Shekhar et al., 2024)。

因此我们采用更贴近用户实际交互方式的做法:仅用界面中留存的历史写作样本做少样本提示(只需一次 API 调用),并以零样本场景作为基线对照。如前所述,本文的首要目标是严格评估"在最小引导下 LLM 模仿个人风格的能力"。主要实验采用随机采样示例;后续分析中我们还探索了基于主题相似度或长度相似度的采样等策略能否进一步提升风格相似度。

4 实验设置

本节概述实验的关键选择,更多细节见附录 B。

LLM 与提示。我们兼顾闭源与开源模型:GPT-4o、GPT-4o-mini(OpenAI et al., 2024)、Gemini-2.0-Flash(Google DeepMind, 2024)、Gemma-3-27B(Team et al., 2025)、DeepSeek-V3(DeepSeek-AI et al., 2025)、Llama-4-Maverick(Meta, 2025)。后两者为专家混合(MoE)模型:DeepSeek-V3 总参数 671B、每 token 激活 37B;Llama-4-Maverick 总参数 400B、激活 17B。所有提示温度固定为 0,以最大化输出的可复现性。

写作示例采样。对每个测试样本,提供 5 个从该作者训练集随机抽取的写作示例供风格模仿,所有 LLM 共用同一批示例。采用随机采样是因为原则上我们无法控制用户会用什么示例做提示——这保证了评估更贴近现实。

测试样本摘要。用 GPT-4.1(OpenAI, 2025)为每个测试样本生成摘要。

基线。以同样的测试样本做零样本提示(仅给内容摘要)作为基线。我们在实验中预期并验证:不提供示例时风格模仿更差。该简单基线有两个作用:(1)实证检验上述预期;(2)对本研究提出的评估框架做合理性检查。作为概念验证,零样本仅跑四个模型(不含 DeepSeek 与 Llama)。

评估模型。AA 与 AV 模型基于 Transformer 编码器训练,具体为 Longformer-base-4096 与 ModernBERT-base(细节见附录 B)。对每位作者,还基于 LIWC(Boyd et al., 2022)与 WritePrint(Abbasi & Chen, 2008)特征集,从其写作样本中抽取分布性风格特征,构建个体风格模型。这三类模型用于评估人类写作与 LLM 生成文本的风格忠实度。此外,直接使用开箱的 GPTZero 作为 AI 检测工具。

在人类文本上验证评估框架。为验证框架可靠性,先在原始人类写作文本上报告评估结果(表 1)——这反映理想条件(四个评估器只处理人类数据),可据此考察其性能上界。

表 1:研究中使用的四个测试集及其原始数据来源。对应的训练集具有相同的作者数/样本数及相近平均长度。"AV Acc."与"AA Top-5 Acc."为在相应训练集上训练的 AV/AA 模型的平均测试准确率;"% Style Acc."为作者测试样本距该作者本人的风格模型比距其他作者风格模型更近的比例;"% Human"为测试样本被检测为人类生成的比例。

数据集文体#作者#样本平均长度AV Acc.(%)AA Top-5(%)Style Acc.(%)% Human
Enron邮件1503,88430988.979.879.499.2
Blog博客10025,22431991.495.581.999.5
CCAT50新闻502,50058489.294.969.1100
Reddit在线论坛1008,45133387.789.773.8100

在四个数据集上(Enron、Blog、CCAT50、Reddit),AV 模型准确率高达 87.7%–91.4%,AA 模型 Top-5 准确率为 79.8%–95.5%,说明两个模型微调良好、足以可靠评估作者一致性。此外,在相同特征表示上训练的 XGBoost 分类器取得了可观的 Top-1 作者归属准确率:CCAT50 46.16%、Enron 43.12%、Reddit 36.04%、Blog 34.11%——尽管候选作者数高达 50–150 位。这体现了我们文体计量框架捕捉个人写作风格的实力。风格模型也呈现一致的匹配(69.1%–81.9%,即作者的测试样本更贴近本人风格模型的频率)。最后,人类书写的测试样本几乎不会被 GPTZero 判为 AI 生成。综上,人类文本呈现出可区分、可个性化的风格模式,验证了评估框架的有效性。

5 结果

我们在评估框架下全面分析 LLM 模仿个性化风格的效果,并报告与原文的语义相似度,以确认生成输出在遵循给定内容的同时保留了示例中的风格线索。

5.1 作者归属准确率

表 2 报告了 5-shot(默认)与 0-shot(基线)设置下各数据集、各模型的平均 Top-5 AA 准确率。总体上,少样本提示一致优于零样本——提供既往样本确实帮助 LLM 生成与目标作者更风格对齐的文本。有趣的是,即使零样本也能取得非平凡的 Top-5 AA 准确率,主要归因于个人写作的主题/内容重叠。由于作者身份同时依赖内容与风格(Sari et al., 2018),我们的 AA 模型利用了这两个维度——这解释了无示例时的"高于随机"表现。这也凸显了需要其他评估(如本研究提供的)来对个性化写作做整体判断。

表 2:各 LLM 在少样本(5-shot)与零样本提示下的平均 Top-5 AA 准确率(越高越好)。对每个生成文本 \(t'\) 及其参考文本 \(t\),若真实作者 \(a\) 出现在 AA 模型 Top-5 预测中记 1 分;分数在两个 AA 模型上取平均。

模型设置CCAT50EnronRedditBlog
GPT-4o5-shot86.6459.6527.1239.39
0-shot83.8828.6218.7717.22
GPT-4o-mini5-shot87.3656.4526.3038.47
0-shot85.8427.5618.9516.10
Gemini-2.0-Flash5-shot92.1759.5635.5944.34
0-shot87.7228.9319.1419.62
Gemma-3-27B5-shot93.3062.3830.5339.38
0-shot86.2627.1219.2018.89

准确率在不同用户间也有差异(见图 3)。CCAT50 持续高准确率(可能因记者各覆盖独特主题),其他数据集波动更大。对所有作者,少样本一致优于零样本。值得注意的是,Gemini-2.0-Flash 与 Gemma-3-27B 在非正式领域(Reddit、博客)相对出色——这些领域包含 *、#、! 等因作者而异的风格线索。总体而言,这些发现凸显了个性化风格复现对数据集与模型的双重敏感性。

每位作者的 AA 准确率分布
图 3:不同设置下跨所有 LLM 平均的"每位作者 AA 准确率"分布;高亮值表示各分布均值。总体上少样本提示的每位作者准确率高于零样本。

5.2 作者验证准确率

表 3:各 LLM 在 5-shot 与 0-shot 下(两个 AV 模型平均)的 AV 准确率。这里假设 LLM 生成样本与对应测试样本同属一位作者,因此准确率越高越好。

数据集设置GPT-4oGPT-4o-miniGemini-2.0-FlashGemma-3-27BDeepSeek-V3Llama-4-Maverick
CCAT505-shot95.2895.1697.4497.3497.4694.68
0-shot93.1493.3893.9494.18--
Enron5-shot96.1596.6496.4496.1796.3095.65
0-shot85.0285.6885.9584.98--
Reddit5-shot63.6560.2365.8855.5449.9765.10
0-shot56.6654.2853.2548.75--
Blog5-shot19.3717.9321.2516.7220.7717.61
0-shot8.158.2210.359.55--

表 3 给出四个数据集上 LLM 生成文本的(Top-1)AV 准确率。跨所有模型与数据集,5-shot 一致优于 0-shot——仅提供少量写作示例就能显著提升 LLM 模仿隐性个人风格的能力。与 AA 结果类似,AV 性能也随数据集变化:在更结构化、正式的 CCAT50 与 Enron 上表现尤佳;在更非正式、风格多样的 Reddit 与 Blog 上普遍较低。尽管 Gemini-2.0-Flash、Gemma-3-27B、DeepSeek-V3 等多数 LLM 表现相近,其风格模仿效果仍高度依赖提示设计与数据集的风格特性——凸显了基于 LLM 的作者模仿对任务设定与领域特征的敏感性。

5.3 风格建模与对齐

我们采用 LIWC(Boyd et al., 2022,融合语言学与心理学线索)与 WritePrints(Abbasi & Chen, 2008,句法-词汇模式)特征集构建个体风格模型。为评估风格对齐,计算每个测试文本(无论人类或 LLM 生成)与对应作者风格模型之间的马氏距离(Mahalanobis distance)(McLachlan, 1999)。

CCAT50 风格模型距离分布
图 4a:CCAT50 上各文本与对应目标作者风格模型的平均马氏距离分布(距离越低表示与该风格模型越相似)。
Enron 风格模型距离分布
图 4b:Enron 上的距离分布。
Reddit 风格模型距离分布
图 4c:Reddit 上的距离分布。
Blog 风格模型距离分布
图 4d:Blog 上的距离分布。

图 4 展示了 5-shot 与 0-shot 下每位作者全部测试样本的平均距离分布。符合预期,人类原始样本距离最低。关键在于:少样本生成显著比零样本更接近目标风格(经 Wilcoxon 符号秩检验确认,Conover, 1999)。这与我们的假设一致——没有示例提示时,LLM 退回通用风格。跨数据集的差异也与 AA/AV 的趋势一致。

5.4 AI 生成检测

表 4:被检测为人类文本的 LLM 生成文本占比(越高越好)。

模型设置CCAT50EnronRedditBlog
GPT-4o5-shot0.0816.860.670.47
0-shot0.160.100.270.07
GPT-4o-mini5-shot0.0013.760.120.35
0-shot0.080.080.190.12
Gemini-2.0-Flash5-shot20.4954.2520.7718.74
0-shot0.441.881.180.79
Gemma-3-27B5-shot31.3643.6316.097.58
0-shot0.202.654.801.67

表 4 报告被 GPTZero 判为人类的比例,可视为"感知自然度与风格真实性"的代理。总体上 LLM 生成文本被判为人类的比例偏低(几乎所有模型与设置都低于 55%,常低于 20%)。这意味着:尽管 LLM 能在不同程度上骗过专门的 AA/AV 模型,成功"以假乱真"仍是艰巨挑战。有趣的是 GPT-4o/GPT-4o-mini 的检出率近乎为零;而 Gemini-2.0-Flash 与 Gemma-3-27B 明显更高(尤其在 Enron、CCAT50 等结构化数据上)——我们推测 GPTZero 可能针对 GPT 系模型的输出做了优化。因此检出率差异应谨慎解读:可能反映检测器偏差而非真实风格相似度。与前文一致,零样本在多数模型/数据集上的人类检出率更低。此外,提示设计、模型架构与目标领域特性都可能影响检出率。

5.5 语义相似度

实验中我们在提示里提供内容摘要以引导语义,从而在评估中聚焦写作风格。作为合理性检查,我们测量 LLM 生成文本与对应人类文本的语义相似度,以确认 LLM 确实按指令输出语义合规的生成。表 5 给出 METEOR、ROUGE(Kumar et al., 2024)与 SBERT(Reimers & Gurevych, 2019)分数。

表 5:LLM 生成文本与人类参考文本的平均内容相似度。

模型设置METEORROUGE-LSBERT
GPT-4o5-shot0.320.240.77
0-shot0.300.210.76
GPT-4o-mini5-shot0.310.230.77
0-shot0.290.200.76
Gemini-2.0-Flash5-shot0.320.260.78
0-shot0.310.210.75
Gemma-3-27B5-shot0.300.230.75
0-shot0.290.190.74

分数表明 LLM 生成文本与人类写作语义相似(SBERT ≥ 0.74),说明其指令遵循能力很强。此外,5-shot 在三个指标上一致略高,与前文观察到的风格忠实度提升一致。我们猜测:更高的风格忠实度(体现在用词与措辞等元素上)可能有助于提升语义相似度。

6 后续研究(提示策略变量消融)

日常用户或许不止于随机示例 + 内容摘要。我们假设精心挑选的样本能更好地促进上下文学习(Kapuriya et al., 2025)。由于作者身份同时依赖内容与随文本长度变化的风格因素(Tripto et al., 2025),我们分别按内容相似度与长度相近性选择示例;此外还提供原文开头片段引导生成(Bhandarkar et al., 2024),并改变示例数量。为考察这些效应,我们在测试集的精选子集上使用 GPT-4o、Gemini-2.0-Flash、LLaMA-4-Maverick 评估,兼顾成本效率与同条件比较。

6.1 考察的条件

表 6:基于与第 6 节相同测试子集的后续结果(三个 LLM 平均)。+Snippet(†)仅对 LLM 续写部分评估,不含最初提供的作者片段。

数据集设置AVAA(Top-5)Style Acc.% Human
CCAT505-shot96.3989.7260.118.50
+ Len ctrl96.8390.1657.895.67
+ Sim ctrl91.9581.0561.0010.33
+ Snippet †95.4587.7264.4415.50
Enron5-shot95.4469.3372.1136.83
+ Len ctrl95.8971.4461.2223.67
+ Sim ctrl81.2836.0070.0039.67
+ Snippet †90.5660.5068.4446.50
Reddit5-shot68.0735.4371.8010.90
+ Len ctrl70.0735.6056.6051.50
+ Sim ctrl53.1016.6369.3312.60
+ Snippet †72.8336.8368.2722.10
Blog5-shot19.4043.9382.679.00
+ Len ctrl20.6843.0368.6027.50
+ Sim ctrl10.3322.1382.658.60
+ Snippet †15.0438.6980.3921.70

6.2 主要观察

表 6 为三种 LLM 在各提示配置下的框架结果均值,基线为随机 5-shot。

AA/AV 准确率随示例数量的变化
图 5:AA/AV 准确率随写作示例数量(2/4/6/8/10)的变化。

总体而言,这些发现表明示例选择远非小事:面向内容或长度优化的策略并不总能提升风格模仿,且没有任何单一配置在所有指标上持续最优。有效的个性化需要领域敏感的决策,以及在语义控制、风格忠实度与类人度之间的精心平衡。

7 结论

本文通过少样本上下文学习,对最先进 LLM 模仿日常用户隐性写作风格的能力进行了全面评估。结合作者归属、作者验证、文体计量建模与 AI 生成检测,覆盖四个多样数据集,我们提供了强有力的经验证据:尽管基于示例的提示带来了改进,当前 LLM 仍难以复现细微的个人风格——尤其在非正式、风格多样的领域。分析还表明,提示设计选择(如长度对齐、内容相似)会适度影响风格忠实度,但无法弥合个性化差距。这些发现揭示了 LLM 风格适应性的根本局限,说明实现真正的个性化生成仍是开放挑战。未来工作应探索更丰富的个性化信号,以及提示与微调结合的混合策略,以更好捕捉真实场景中个人写作风格的细微之处。

致谢(节选):Zhengxiang Wang 获石溪大学 IACS 青年研究者奖(2025 学年)支持;IACS 亦为本实验提供免费 OpenAI GPT 访问。感谢 Google Gemma 学术计划对 Jiawei Zhou 的部分支持及算力资源。

局限。(1)我们提出了全面的计算评估框架,但未包含大规模人类评估——人工评估可能揭示自动指标未捕捉的风格忠实度或"感知作者性"方面。(2)分析限于同文体个性化(提示示例与生成文本文体一致);因缺乏同一作者的多文体语料,跨文体风格迁移尚未探索。(3)结论的普适性受限于四个英文数据集。(4)作者分析模型在每位作者的相对小样本上训练,可能限制其稳健性,尤其对风格一致性弱的作者。未来工作应纳入更广的语言与人口多样性、加入人类评估,并探索跨模态与跨文体的个性化。

伦理考量。(滥用风险)风格模仿技术可能被用于冒名、学术不端或钓鱼;本工作虽旨在支持个性化辅助,也凸显了相关风险。(隐私)我们使用公开、匿名化的数据集,但写作风格仍可能携带可识别特征,使用或发布数据时应谨慎。(偏差与泛化)数据集仅限英文且人口多样性有限,结论未必推广到更广人群或多语种场景。(评估假设)我们依赖计算作者模型,它们未必完全反映人类对风格的感知,也可能携带无意的偏差,敏感场景应谨慎使用。(披露与透明)随着 LLM 输出愈发接近人类写作,清晰披露 AI 参与对维持透明与信任至关重要。


附录

附录 A:原始研究的训练/测试划分准备

如 3.3 节所述,我们为每个数据集维护独立的训练/测试部分:训练部分用于训练 AA/AV 模型、构建个体风格模型、以及为提示中的上下文学习抽取示例;测试部分用于评估 AA、AV、风格模型,并开展主研究(少样本与零样本实验)。

一致的前处理确保了跨数据集的公平比较,同时平衡了样本量、作者覆盖与风格多样性。

附录 B:AA/AV 模型训练的实验细节

超参数。表 7 汇总 AV 与 AA 模型的训练配置;两类模型均训练了 longformer-base-4096(Beltagy et al., 2020)与 ModernBERT-base(Warner et al., 2024)。

数据集。AA 模型使用为评估 LLM 风格模仿能力而构建的四个数据集的训练/测试划分。AV 模型则从四个数据集的原始划分中采样文本对,构建标签均衡(正:负 = 4:6)的数据集。训练 AV/AA 时,从训练集划出 20% 作验证。

表 7:作者验证(AV)与作者归属(AA)模型的训练超参数。

类别训练参数AV 模型AA 模型
通用训练轮数1020
训练批大小88
评估批大小1616
最大序列长度20482048
优化学习率2e-52e-5
权重衰减0.010.01
预热步数500500
梯度累积步数44
评估评估策略每轮每轮
早停耐心33
结束时加载最佳模型是是
最优模型指标F1评估损失
越大越好是否
精度混合精度(fp16)是是

附录 C:结果报告方式的说明

我们的首要目标是呈现大规模、系统性的评估。鉴于研究规模——每位模型超过 40,000 次生成、覆盖 400 位作者——我们采用平均结果代表各 LLM 在隐性风格模仿上的期望表现。虽然按作者逐一报告四项指标更理想,但作者数量过多,不切实际;且考察 LLM 模仿不同个体的性能差异也超出本研究范围。尽管如此,我们在图 3 中给出了不同数据集上的逐作者 AA 准确率,并在图 4 中对不同提示条件下风格模型结果做了配对统计检验(Wilcoxon 符号秩检验)——这不仅丰富了分析,也再次印证了跨作者平均结果中的观察。最后,为最小化生成变异、最大化可复现性,所有实验全程使用贪心解码(温度 = 0)。

附录 D:后续研究

子集采样。为保证同条件比较,所有后续研究使用四个数据集的相同子集:每个数据集为每位作者抽 10 个测试样本;CCAT50、Enron、Reddit、Blog 的作者数分别为 30、30、50、50。这些数字依据 BERTopic 聚类结果选取,以确保每个测试样本都有至少 5 个来自相关作者的训练样本。

补充结果。图 6 展示提示中加入更多写作示例对风格模型与 AI 检测结果的影响。

风格模型准确率随示例数量变化
图 6a:风格模型准确率随写作示例数量的变化。
人类检出率随示例数量变化
图 6b:人类检测率(%)随写作示例数量的变化。

附录 E:提示词模板

本节给出研究使用的全部提示模板,用 "$" 表示占位符。(提示词保持英文原文,便于直接使用。)

E.1 测试样本摘要提示(由 GPT-4.1 执行)

You will be given a piece of text. Your task is to summarize the text in a concise and clear manner, capturing the main ideas and key points while maintaining the original meaning.
### Text to Summarize
$text
### Instructions
- Provide a summary that is brief yet comprehensive.
- Ensure that the summary accurately reflects the content of the original text.
- Avoid adding any personal opinions or interpretations.
- Do not output anything other than the summary.
Begin your response below:

E.2 少样本写作生成提示(主实验 + 内容相似/长度控制条件复用)

You will be given one or more writing samples from a specific author. Your task is to analyze the author's style, tone, and voice, then craft a new piece of $genre that closely mimics their writing based on a provided summary. Your writing should be around $num_words words.
### Author's Writing Sample(s)
$writing_samples
### Writing Task Summary
$summary
### Instructions
- Ensure your writing faithfully replicates the author's style, including tone, word choices, and sentence structure, etc.
- Maintain consistency with the author's voice while accurately reflecting the details of the given summary.
- Strive to make your writing indistinguishable from the original author's work.
- Do not output anything other than the writing.
Begin your response below:

E.3 零样本写作生成提示(基线)

Given the following summary, your task is to generate a writing sample around $num_words words. The genre of the writing is $genre. Do not output anything other than the writing.
### Writing Task Summary
$summary
Begin your response below:

E.4 少样本 + 片段引导提示

You will be given one or more writing samples from a specific author plus a text snippet of $genre from the same author. Your task is to analyze the author's style, tone, and voice, then generate a continuation for the provided human-authored text snippet with around $num_words words that closely mimics their writing based on a provided summary.
### Author's Writing Sample(s)
$writing_samples
### Writing Task Summary
$summary
### Human-Authored Text Snippet
$snippet
### Instructions
- Ensure your writing faithfully replicates the author's style, including tone, word choices, and sentence structure, etc.
- Maintain consistency with the author's voice while accurately reflecting the details of the given summary.
- Strive to make your writing indistinguishable from the original author's work.
- Do not output anything other than the writing.
Begin your response below: