云计算百科
云计算领域专业知识百科平台

AI网文写作实验笔记(十三):系列总结——12 篇实验、8 条核心结论,把“AI 写小说“每一步拆开验证

文章目录

    • 为什么写这一篇
    • 30秒极简版
    • 一、 这条路的起点:为什么 AI 写小说"看着对、读着假"
    • 二、 中段:真正管用的三样——蓝图、校准、结构
      • 1. 蓝图定"戏"(Part 6-7)
      • 2. 校准去"味"(Part 5)
      • 3. 情绪曲线部分可编程(Part 9-11)
    • 三、 后期:长文的问题不是记忆,是远期资产(Part 12)
    • 四、 收尾实验(人参与梯度):人到底该在哪介入?
    • 五、 8 条核心结论覆盖情况(这些是本系列的 8 个实验主题)
    • 六、 最终结论:AI 写网文,怎么做
    • 七、 没做完的、和可以继续的
    • 八、 数据与样本
    • 九、 系列索引
    • 十、 一句话总结

为什么写这一篇

这是系列的最后一篇。前面 12 篇做了几十个实验,这篇把它们串起来:我们到底验证了什么、哪些结论稳、哪些还没做、最终怎么用。

没空看完全部 12 篇的话,读这一篇就够——前面是过程,这里是答案。

写给谁: 想一口气看完"AI 写小说到底能不能、怎么才能"的人。


30秒极简版

12 篇实验、几十次测量,把"AI 写小说"拆成 8 条核心结论逐条验证。结论浓缩成几句话:

  • AI 能搭出"戏"——人给蓝图,它就能执行
  • 能部分控制"情绪曲线"——压抑释放、载体能指定;峰值位置只有趋势
  • 但"文风"和"长文伏笔"必须靠人——校准去 AI 味、伏笔要专门管理

工程化的正确答案不是"全自动",是"人给结构、AI 填血肉、校准去味、工具管长线"。


一、 这条路的起点:为什么 AI 写小说"看着对、读着假"

系列一开始(Part 1-4)解决的是最基础的问题:AI 写网文到底行不行?结论是**“行,但很多人卡在错误的地方”**——问题往往不在提示词本身,而在一些"大家以为的关键"上:

你以为的关键实测结论
提示词写得更长更细 约束越多,事实错误越多(Part 3)
多轮追问出奇迹 追 1 轮就够,3 轮白花钱(Part 8)
禁词表去 AI 味 禁词是摆设(Part 3),换词不换味(Part 10)

这四篇的价值在"证伪":把"提示词玄学"里大家最信的误区,用实验一个个证伪,留下的才是真正管用的。


二、 中段:真正管用的三样——蓝图、校准、结构

从 Part 5 开始,系列进入"什么真正管用"的建设阶段,结论可以归成三样:

1. 蓝图定"戏"(Part 6-7)

核心发现:约束管不住剧情设计,蓝图管得住。

  • Part 6:只有写作约束 + 剧本格式、没有剧情蓝图时,提示词救不了剧情(有戏四要素 0/20 达标)
  • Part 7:人先填"戏蓝图"(谁打谁/谁失控/怎么绝杀/什么反转),AI 照蓝图执行——从 0/20 到 20/20 达标

一句话:戏是设计出来的,不是提示词挤出来的。 人定结构,AI 照做。

2. 校准去"味"(Part 5)

核心发现:AI 腔是模型思维烙印,写的时候拦不住,写完用独立模型校准才能洗掉。

  • 标杆放生成端无效(盲测全不及格)
  • 独立强模型写后校准,比喻密度 7.2→0.2/千字(降 97%)
  • 但校准也会带新 AI 味,需要"白描铁律"压住

一句话:文风是最后一公里,得靠"独立模型 + 白描铁律"的事后校准,不是 prompt 能解决的。

3. 情绪曲线部分可编程(Part 9-11)

核心发现:AI 的情绪表达可以测量、部分可以控制。

  • Part 9:词表扫描测情绪方向是反的(AI 情绪词 11 倍反而更假),要用 LLM 语义标注(强度+载体)
  • Part 10:AI 载体能力不均——对话相对最不烂,一离开对话就 AI 味
  • Part 11:压抑释放能控(强度差 1.0→1.7,统计显著)、峰值位置只有趋势(三组不显著),载体能指定

一句话:情绪曲线的"骨架"部分可编程(载体、压抑释放可靠;峰值位置只有趋势),“血肉”(压得多深)还得靠校准。


三、 后期:长文的问题不是记忆,是远期资产(Part 12)

测短场景看不到的问题,在一本完整写完的 80 章 AI 长书里暴露了:

  • 短期记忆强:主角当前状态逐章连贯、角色一致性零 OOC
  • 长期记忆弱:69 条伏笔只收 35%,书完结了还大量烂尾

而且挖出三条反直觉规则(不是"记忆要管理"这种空话,是可判定的具体规则):

  • 伏笔标"接近兑现"后 0% 真兑现(状态机缺限期兑现)
  • 全书 60-75% 位置埋的伏笔回收率最低(14%)
  • 转折章一次埋 3-7 条容易烂尾
  • 一句话:AI 长文的问题不是"记不住",是"远期资产没有专门管理"——伏笔要限期兑现、埋设要守位置、单章要限数量。


    四、 收尾实验(人参与梯度):人到底该在哪介入?

    最后一个实验测"人参与梯度"——人介入程度从 0 到全面:

    组人介入阅读意愿AI腔/千字
    A 全AI 0 3.5 1.4
    B 人写大纲 大纲 4.0 0.0
    C 逐章审校 大纲+审校 4.2 2.2
    D 传统分工 详细大纲(对照组) 4.0 0.6

    (B 和 D 都是"人写大纲 + AI 正文",区别是:B 用系列验证过的"戏蓝图"作骨架,D 是传统写法,只给大纲、不给蓝图。主线是 B、D 都对比 A(全自动)和 C(工程化)——看"人介入多少"和"怎么介入"各值不值。)

    三条结论:

  • 人参与值得,但边际收益递减(3.5→4.2,从 0 到参与提升最大)
  • 人写大纲是性价比最高的介入点(AI 腔 0.0 最低、意愿 4.0)
  • 逐章审校提意愿最多但引入新 AI 腔——审查模型会把套话通过修改意见带进正文,需要"去套话"约束
  • 一句话:工程化的正确答案不是"全自动"或"全人工",是"人写大纲 + AI 填血肉 + 校准去味 + 工具管长线"。


    五、 8 条核心结论覆盖情况(这些是本系列的 8 个实验主题)

    主题内容结论出处
    幻觉防控 五规则三防线 规则冗余,自检+修复有效 Part 4
    上下文 正文脱钩 摘要+上一章最优 Part 2
    认知负荷 约束数量 约束越多越差,≤6条 Part 3
    百万字不崩 记忆/DNA/伏笔 短期强长期弱,伏笔需专门管理 Part 12
    文风 标杆+校准 生成端无效,写后独立校准有效 Part 5
    情绪曲线 蓝图+追问 蓝图定戏、追问1轮够、情绪曲线部分可编程 Part 7/8/11
    SOP边界 工程化程度 人写大纲性价比最高 人参与梯度实验
    工程化认知 工程化>单prompt 贯穿全系列 全部

    这 8 条核心结论全部有实测数据撑着。

    关键数据速查(一表看完系列最有用的数字):

    环节关键数据
    约束数量 ≤6 条;再多,事实错误不降反升(Part 3)
    剧情蓝图 有戏四要素 0/20 → 20/20(Part 7)
    文风校准 比喻密度 7.2→0.2/千字,降 97%(Part 5)
    追问轮数 1 轮就够,3 轮白花钱(Part 8)
    情绪测量 AI 情绪词是真人 11 倍,方向是反的(Part 9)
    载体蓝图 遵守率 80%,直述情绪词 3%→15%(Part 10)
    情绪曲线 压抑释放强度差 1.0→1.7 显著;峰值位置只有趋势(Part 11)
    长文伏笔 69 条只收 35%;60-75% 进度处埋的回收率最低 14%(Part 12)
    人参与梯度 阅读意愿 3.5→4.2;人写大纲 AI 腔降到 0.0(收尾实验)

    六、 最终结论:AI 写网文,怎么做

    把系列所有结论收成一份"正稿流程":

    【人】写戏蓝图(谁打谁/谁失控/怎么绝杀/什么反转)

    【人】写大纲(关键节点 + 情绪曲线 + 载体序列) ← 性价比最高,AI腔降为0

    【AI】照蓝图+大纲生成初稿(doubao)

    【独立模型】校准去 AI 味(deepseek + 白描铁律) ← 比喻密度 -97%

    【AI】追问优化 1 轮(别追 3 轮,白花钱)

    【工具】管长线(伏笔限期兑现/埋设守位置/单章限数量)

    【人】终审剧情

    (注:人参与梯度实验里"逐章审校"提意愿最多(4.2),但它会引入审查模型的套话(AI 腔 2.2),所以正稿流程用的是"校准去味"而非"逐章审校"——校准只改文风不查剧情,副作用更小。若要加剧情审校,需配"去套话"约束。)


    七、 没做完的、和可以继续的

    诚实交代还没验证的:

  • 跨题材、跨模型:全部实验用攻心戏 + doubao/deepseek;打斗/权谋/感情戏、Claude/GPT 都没验证
  • 真人读者大规模盲评:只在早期的一个实验里做过一次(结论不乐观),后续评估以 LLM 双评者为主
  • "百万字不崩"那条(记忆管理):用的是"千金归来"那一套工具做观测,不是我们自己搭的对照实验
  • 样本量:多数实验 20 篇/组,方向可靠、精度有限
  • 可以继续的方向:把上面的"正稿流程"真正跑完一本 30 万字以上的书,看它能不能在真实长篇里稳住——这是最有价值的下一个实验,但它需要时间。


    八、 数据与样本

    全部实验数据、脚本、报告都散落在各篇的"数据与样本"一节——评论区或私信找作者要,注明要哪一篇的。


    九、 系列索引

    篇主题核心结论
    Part 1 实验框架 为什么"改一百次提示词"没用
    Part 2 上下文量 摘要+上一章最优
    Part 3 约束数量 约束越多事实错误越多
    Part 4 幻觉防控 规则冗余,自检修复有效
    Part 5 文风标杆 生成端无效,写后独立校准有效
    Part 6 剧情设计上限 无蓝图时提示词救不了剧情
    Part 7 剧情蓝图 蓝图定戏,0/20→20/20
    Part 8 追问优化 1轮就够,3轮白花钱
    Part 9 情绪测量 词表扫描方向反,用LLM语义标注
    Part 10 载体蓝图 AI载体能力不均,对话相对最不烂
    Part 11 情绪曲线 压抑释放/载体可编程,峰值位置只有趋势
    Part 12 长文伏笔 短期强长期弱,伏笔需专门管理
    Part 13 系列总结 本篇

    十、 一句话总结

    AI 写小说这条路能走通,但关键不在"提示词",在"结构"。人给蓝图和结构(戏蓝图、大纲、情绪曲线、伏笔规则),AI 填血肉,独立模型去 AI 味,工具管长线。12 篇实验把这条路每一步都用数据验证过,没有玄学,只有可复现的结论。 系列完结,感谢读到这里的你。


    本系列完结。 Part 1-13 全部发布。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » AI网文写作实验笔记(十三):系列总结——12 篇实验、8 条核心结论,把“AI 写小说“每一步拆开验证
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!