refactor(agents): prompt 外置方案A — 21 prompt 散文外迁 .md + SpecResolver

把 21 个内置 agent 的 system_prompt 从 specs.py 的 Python 常量外置为
prompts/<spec.name>.md,import 期由 load_prompt 确定性加载;建立 SPECS 名册
+ SCHEMA_CATALOG(Pydantic 类型留 Python)+ 统一只读解析入口 SpecResolver。
纯重构、零功能/schema 变更,缓存断点前块字节级不变(不变量 #9)。

@llm packages/agents(步骤1-3)
- spec_model.py:抽出 AgentSpec(frozen,字段不变)
- prompt_loader.py:load_prompt = utf-8-sig 去BOM → LF 归一 → NFC → rstrip尾LF,
  内存缓存 + fail-fast(PromptNotFoundError),import 期确定性
- schema_catalog.py:SCHEMA_CATALOG[name]→output type 唯一真相源(refiner=None)
- prompts/*.md ×21:取常量「运行时值」程序化外迁(反斜杠折行已塌缩,
  物理换行≡运行时换行);文件名按 spec.name 连字符(style.md/character-gen.md 等)
- specs.py:删 21 常量 + AgentSpec 类;system_prompt=load_prompt(name)、
  output_schema=SCHEMA_CATALOG[name];建 SPECS + REVIEW_RESERVED_NAMES;
  *_spec 兼容期保留且 SPECS[name] is *_spec(同一实例)。804→337 行
- __init__.py:显式 __all__ 重导出(避 F401)

@backend packages/skills(步骤4-5)
- SpecResolver:内置 SPECS(纯内存、零 DB)+ 用户 SkillRegistry 统一 get;
  内置 name 永不触发 DB;output_schema_for 精确匹配
- skill_registry:保留命名空间守卫前移至入库校验,拒同名内置 → VALIDATION
- toolbox_registry:GeneratorTool.spec 改走 SPECS[...],删 12 个 *_spec 直接 import

@devops repo-root
- .gitattributes:prompts/*.md text eol=lf(修正:须用完整嵌套路径才匹配)
- packages/agents/pyproject:hatchling artifacts 纳入 prompts/*.md 随 wheel/sdist 分发
- ci.yml:新增 build wheel → 裸装 → import ww_agents.SPECS 冒烟

TDD 全程 mock 网关;门禁绿:ruff/format clean · mypy 209 files · pytest 744 passed
(含金标准 sha256 回归 / md↔spec↔catalog 一一对应 / fail-fast / BOM+NFC /
内置守卫 / 同一实例 / 编排器无回归 / apps/api import-smoke / 打包冒烟)
This commit is contained in:
Yaojia Wang
2026-06-24 04:49:44 +02:00
parent f9ff89cd6b
commit dca4d45d4e
52 changed files with 1907 additions and 701 deletions

View File

@@ -0,0 +1,48 @@
"""Prompt 加载器Prompt 外置方案A · 步2
`load_prompt(name)` 在模块 import 期一次性读盘 `prompts/<name>.md` → 规整 → 内存缓存
→ 返回完整 UTF-8 文本。保证 `spec.system_prompt` 字节稳定(缓存断点前块,不变量 #9
且单测可复现。文件缺失 = fail-fast`PromptNotFoundError`),不 fallback、不返回 ""
规整规则(锁死缓存字节,设计 §3.2),依次:
1. 去 BOM`encoding="utf-8-sig"` 读(`utf-8` 不自动剥 BOM带 BOM 会污染首字节破缓存);
2. 行尾归一CRLF/CR → LF
3. Unicode 归一化:`unicodedata.normalize("NFC", text)`(中文/全角标点的跨平台缝隙);
4. 尾换行策略(方案 B顺生态`text.rstrip("\n")`——吞掉文件尾部所有 LF、不补回。
`.md` 允许带 ≤1 个尾换行(顺 Prettier / editorconfig运行时字符串无尾换行
(与旧常量逐字等价)。
`load_prompt` 不做任何动态插值(无 `.format`);需运行期占位符的 prompt 不走此路径。
"""
from __future__ import annotations
import unicodedata
from pathlib import Path
from typing import Final
PROMPTS_DIR: Final = Path(__file__).parent / "prompts"
_CACHE: dict[str, str] = {}
class PromptNotFoundError(FileNotFoundError):
"""按 spec.name 找不到对应 `prompts/<name>.md`import 期 fail-fast"""
def load_prompt(name: str) -> str:
"""按 spec.name 读 `prompts/<name>.md` → 规整 → 缓存 → 返回完整 UTF-8 文本。"""
cached = _CACHE.get(name)
if cached is not None:
return cached
path = PROMPTS_DIR / f"{name}.md"
if not path.is_file():
raise PromptNotFoundError(f"prompt not found for spec name {name!r}: {path}")
raw = path.read_text(encoding="utf-8-sig") # 去 BOM
normalized = raw.replace("\r\n", "\n").replace("\r", "\n") # 行尾归一
normalized = unicodedata.normalize("NFC", normalized) # Unicode 归一化
text = normalized.rstrip("\n") # 尾换行:吞掉、不补回
_CACHE[name] = text
return text