P03 · AI DATA ENGINEERING · SYNTHETIC DEMO

Governed Novel Data Pipeline

从“伪精确文学特征”到可审计 AI 数据管道

2025 年 6 月,我与一名算法工程师和一名内容编辑开始筹备私有 AI 小说创作工作台;后续我把项目中暴露的权利、标签真值、评测隔离和版本治理问题,独立重建为这套 100% 合成、可公开复核的数据管道。

真实项目提供问题背景,公开 Demo 提供可审计的工程证据;两者不是同一份数据,也不是同一套代码。公开仓库不含私有项目的代码、小说、日志、配置、提示词、合同或经营记录。
01 / Background

真实项目起点:三人协作的私有小说创作工作台

项目在 2025 年 6 月筹备、7 月进入开发。我们希望把选题、素材、大纲、正文、润色和评价串成一套私有工作台:算法工程师负责模型调用与工作流,编辑负责内容规则与最终验收,我负责采集、清洗、数据库、向量检索,并在后期主导数据审计与治理重构。

PRIVATE PROJECT · REAL CONTEXT

真实项目:问题从哪里来

三人合作的私有 AI 小说项目暴露了权利追溯、语义验证、编辑瓶颈、重试恢复、版本管理和模型替换等真实问题。相关代码、小说、日志、提示词、合同和经营记录不进入公开仓库。

PUBLIC REPOSITORY · 100% SYNTHETIC DEMO

公开作品:如何证明我会解决

我基于上述事故独立重建了训练前数据治理 Demo。所有公开数据 100% 合成;页面中的可复现指标只来自固定 Release,不代表私有项目规模或业务结果。

真实项目提供可解释的问题链,公开 Demo 提供可复核的实现链。二者在页面中并列说明,但资产边界始终分开。

为什么不能直接训练

字段合同发生漂移

我对照早期字段说明、数据库表和分析模块后发现,“12 维文学特征”存在三套不同定义。

文学语义被过度规则化

钩子、反转和情绪递进主要依赖关键词、词典与模板。它们可以寻找表面信号,却难以判断反讽、冷幽默和字面含义与真实意图相反的表达。

生成与评审没有解耦

同类模型服务同时参与生成和评价,缺少独立金标、盲评与校准。部分模型评价虽然被保存,却没有进入最终门禁,实际通过条件仍主要依赖表面格式规则。

我的角色:早期负责数据采集、清洗、数据库、向量检索和文学特征工程;发现问题后主导数据审计与治理重构。公开仓库由我独立设计、实现和发布。我使用 AI 辅助开发,但对数据边界、工程设计、验证结果和最终发布负责。
02 / Failure analysis

最有价值的一次失败:抽样结构检查全绿,语义已经塌缩

数据格式全部通过,但文学语义完全没有区分度。

原报告里的“全部通过”只指抽样字段格式、范围和枚举检查,不是全量语义验证。
Report says PASS

自动报告实际检查了什么

  • 字段类型与基础格式是否合法
  • 数值是否非负、评分是否落在 1—5
  • 枚举和布尔值是否属于允许集合
  • 部分语义字段即使为空或 None 也能通过
Semantics collapse

这些检查没有证明什么

  • 某个位置是否真的构成开篇钩子
  • 情节是否真的发生语义反转
  • 情绪变化是否具有有效区分度
  • 同类模型给出的评价是否能作为独立真值
EARLY PRIVATE PROTOTYPE · SYNTHETIC DEMO RECORDS · NOT PUBLIC DATASET 21/32 未识别到开篇钩子
EARLY PRIVATE PROTOTYPE · SYNTHETIC DEMO RECORDS · NOT PUBLIC DATASET 30/32 反转数为 0
EARLY PRIVATE PROTOTYPE · SYNTHETIC DEMO RECORDS · NOT PUBLIC DATASET 32/32 情绪递进全部为 2

以上来自私有早期原型的 32 条合成 AI 试验记录,只展示内部审计聚合结果。来源材料属于私有证据,不在公开仓库复现;它们不是公开 Demo 的固定回归数据,也不代表真实业务规模。

从私有项目到公开 Demo

项目筹备与开发启动

我们三人开始搭建私有小说创作工作台。我负责采集、清洗、数据库和向量检索;算法工程师负责模型调用与工作流,编辑负责内容规则与验收。

多 Agent Demo 跑通

Streamlit、LangGraph、通义千问、Chroma 和 SQLite 串起选题、素材、大纲、正文与评分;此时“能生成”仍被误当成“数据可用于训练”。

权利与数据接入重建

旧素材无法逐作品证明来源和使用范围。我把旧库隔离为只读实验数据,重新建立作者、来源、授权范围、撤回方式和版本台账。

抽样结构全绿,语义却塌缩

编辑抽查发现样本高度同质;我继续对照材料、数据库和分析 Agent,确认字段口径漂移、特征分布塌缩,以及生成与评价没有真正解耦。

从生成吞吐转向可用稿成本

批量生成暴露了编辑瓶颈、限流重试、断点恢复和向量版本错位。同题盲测进一步说明:复杂 Agent 编排不应成为不可替换的核心,评测必须冻结且独立。

私有项目收束与资产边界

商业假设未通过止损线后,我们停止继续扩张。我整理权属、版本、密钥、索引、依赖与交付边界,把可保留价值收敛到工作流、治理规范和评测资产。

公开合成治理 Demo

我把训练前治理部分独立重建为公开仓库,以 100% 合成数据、固定 Release、双版本 CI、可复现构建和治理文件完成发布。

03 / Governed architecture

修复方法:让每一种判断都有清晰责任

我没有继续给规则增加更多文学名词,而是把客观硬门、候选检索、语义预筛和最终内容判断拆开。公开仓库重点实现其中的训练前数据工程层。

01 PUBLIC DEMO · IMPLEMENTED

规则

权利准入、Schema、格式、字数、哈希、版本和文件完整性。

02 PRIVATE BLUEPRINT · NOT IMPLEMENTED

检索

相似人设、相似冲突、历史素材、旧大纲和编辑经验。

03 PRIVATE BLUEPRINT · NOT IMPLEMENTED

AI

创意扩展、候选生成、风格改写、编辑建议和带证据的语义预筛。

04 PRIVATE BLUEPRINT · REQUIRES REAL EVALUATION

编辑

黄金集、盲评、最终语义判断,以及修改 diff 的持续校准。

04 / Verification

固定合成回归:从数据漏斗到发布证据

所有数据量都固定在 v0.1.0-demo,用于验证权利门、去重、切分、数据集派生和文件对账。它们不是业务规模指标。

合成原始记录
SYNTHETIC DEMO
27
权利硬门通过
SYNTHETIC DEMO
25
最终唯一作品
SYNTHETIC DEMO
20
2 条 SYNTHETIC DEMO 权利案例被硬门阻断
2 条 SYNTHETIC DEMO 精确重复
3 条 SYNTHETIC DEMO 近似重复
SYNTHETIC DEMO DATASET 36 / 12 SFT train / validation
SYNTHETIC DEMO DATASET 24 偏好对
SYNTHETIC DEMO DATASET 30 隔离评测任务
SYNTHETIC DEMO · SIMULATED EVENTS 40 模拟编辑事件
SYNTHETIC DEMO BUILD 17/17 自动化测试通过
RELEASE CI 3.10 / 3.12 两个 Python job 均成功
DETERMINISTIC SYNTHETIC BUILD byte-stable 重复构建 checksum 一致,CI 重建 artifacts 无 diff
LIGHTWEIGHT RELEASE GATE PASS 密钥模式、本机路径、私有目录、归档类型和 DEMO 标记检查
05 / Engineering decisions

四个关键设计决策

我做这四个取舍,是为了不把无法证明的判断混进确定性硬门。

DECISION 01

为什么先按作者切分

同一作者的风格、偏好与叙事习惯可能跨作品重复。如果只按章节或样本随机切分,验证集仍可能看到训练集作者的稳定模式。项目先冻结作者分组,并保持作品不可拆,再派生 SFT、偏好和评测任务。

DECISION 02

为什么 SHA-256 和 MinHash 都需要

SHA-256 对规范化后完全相同的正文确定、快速、可追踪;MinHash/LSH 用于发现轻微改写或局部变化的候选。前者不能识别语义近似,后者也不能证明版权安全,两者承担不同职责。

DECISION 03

为什么模型评审不能作为唯一真值

当同类模型同时生成和评审,它们容易共享盲区。模型评分适合预筛、解释和提供证据,不应替代独立金标、真实编辑盲评与校准后的发布门槛。

DECISION 04

为什么规则、检索和 AI 必须分层

规则处理可确定的约束,检索召回历史证据,AI 提供候选与语义建议,编辑负责最终内容判断。分层后,每个组件的错误类型、验证方式和责任边界都更清楚。

06 / Private project context

三人实际协作与私有工作台

PRIVATE PROJECT · REAL CONTEXT · NOT IN PUBLIC REPO 以下角色分工和工作流来自私有项目的实际协作与迭代。不同阶段的自动化程度不同,最终内容始终由编辑验收;公开仓库只实现其中的训练前数据治理部分。

编辑

  • 维护评分卡与黄金集
  • 执行盲评和最终内容验收
  • 把修改 diff 沉淀为可追踪反馈

数据工程师

  • 权利、清洗、去重与切分
  • 数据、评测和发布版本管理
  • 盲化统计、血缘与质量看板

算法工程师

  • 模型适配、RAG 与推理
  • 可选微调和供应商切换
  • 成本、延迟与维护复杂度优化

项目中持续迭代的创作流程

01创建作品
02上传授权素材
03生成选题 / 大纲候选
04锁定 Story Bible
05逐章生成
06人物 / 伏笔 / 逻辑检查
07编辑修改并保存 diff
08导出交付稿
PRIVATE PROJECT DECISION · MODEL-AGNOSTIC DELIVERY 模型和 Agent 编排保持可替换:如果连续两个冻结评测版本中,自研模型在编辑盲测、可用稿成本和维护成本上仍不优于外部基础模型,就停止训练。真正可沉淀的是私有新增代码、创作工作流、模型适配层、评分规范、权属清晰的编辑反馈与黄金集,以及部署与操作手册。
07 / Public evidence

固定到 Release 快照的公开证据

以下治理证据固定到 Release 对应提交 b19b3b5…;CI 结果单独链接到当次 Actions 运行记录。

本地复现入口

python scripts/run_demo.py --output-dir artifacts
python -m unittest discover -s tests -v
python scripts/check_public_repo.py
08 / Limits

公开 Demo 边界

下面只描述固定公开仓库的实现范围;它不否认私有项目的真实经历与工作流,也不把私有资产包装成公开可复现证据。

公开 Demo 已完成

  • 确定性合成数据可以重复生成和对账。
  • 权利硬门、规范化、SHA-256 精确去重与教学型 MinHash/LSH 近重复候选检测,已在合成回归上运行。
  • SFT、偏好和隔离评测格式可以稳定派生。
  • Manifest、DEMO 阶段 / 占位血缘、测试、作者 / 作品 / 正文哈希跨 split 重叠检查和轻量公开发布门禁可以公开复核。

当前没有覆盖

  • 未训练或微调小说模型,模型与训练运行只保留占位关联。
  • 没有真实用户、发布结果、收入或生产吞吐。
  • 不是生产级版权法律判断、PII 或内容安全系统。
  • 基线、消融与盲测文件是合成格式样例,不是真实编辑实验。
  • 真实落地仍需私有环境、逐作品授权和独立编辑盲测。

我希望通过这个项目展示什么

这个项目不包含“爆款”预测,也没有训练小说模型。我用它展示了自己如何识别伪精确标签、建立数据契约,并把权利、去重、隔离、版本和发布验证落实成可执行链路;文学语义仍由真实编辑评测和人工判断负责。