api/app/features/conversation/input_normalize.py

"""
聊天输入归一：供访谈 Agent / 编排层对 ASR 与键盘输入做可控预处理（规则 / 可选 LLM）。

不改变 segment 落库原文；仅作为模型侧派生净稿。
与 memoir 共用同一套确定性规则，避免聊天与回忆录对同一句理解割裂。
"""

from __future__ import annotations

from typing import Any

from app.core.config import settings
from app.core.text_normalize import apply_oral_rules, llm_normalize_text
from app.core.logging import get_logger

logger = get_logger(__name__)

apply_conversation_input_rules = apply_oral_rules


def _llm_normalize_chat_input(text: str, llm: Any) -> str | None:
    """仅修正明显错字与同音字，不增事实；失败返回 None。"""
    return llm_normalize_text(
        text,
        llm,
        max_input_chars=int(settings.chat_input_normalize_llm_max_input_chars),
        max_tokens=int(settings.chat_input_normalize_llm_max_tokens),
        agent_name="chat_input_normalize.llm",
    )


def normalize_chat_input_for_agent(text: str, *, llm: Any | None = None) -> str:
    """
    聊天侧单一出口：编排层与 InterviewAgent 共用。

    - 全局关闭：原文
    - off：原文
    - rules：仅规则
    - llm：先规则，再（可选）LLM；无 llm 或失败则保留规则结果
    """
    if not settings.chat_input_normalize_enabled:
        return text or ""
    mode = (settings.chat_input_normalize_mode or "rules").strip().lower()
    if mode == "off":
        return text or ""

    base = apply_conversation_input_rules(text or "")
    if mode != "llm":
        return base

    refined = _llm_normalize_chat_input(base, llm)
    if refined is not None:
        return refined
    return base
-												feat(api): 访谈人格/回复长度策略、口述归一、背景语气与输入净稿全链路

Chat 访谈
- 新增 persona 系统（default / warm_listener / curious_guide）与 background_voice 语气层
- 回复长度由 compute_reply_plan 统一决策（brief / standard / expanded），融合信息密度启发式
- 输入净稿（input_normalize）：编排层可选 rules/llm 归一用户口语后再喂模型与记忆检索
- 记忆证据注入：按用户话检索 memory evidence 并注入 prompt

Memoir 回忆录
- 口述归一（oral_normalize）：segment 原文保留，story 管线取派生净稿作叙事输入
- segment 入队批次门闸：累计字数 + 最长等待秒数，减少零碎提交
- fidelity_check / prompts / narrative_agent 微调
- Alembic 0005：清理跨章节 story 外键

Infra
- Dockerfile 加入 ffmpeg
- pyproject.toml 新增依赖并同步 uv.lock
- .env.example / .env.production 补全新配置项

Tests
- 新增 test_background_voice、test_chat_input_normalize、test_experience_regressions
- 扩展 test_interview_prompts、test_interview_reply_length、test_story_route_oral_invariant

Made-with: Cursor

											
										
										
											2026-03-31 23:55:26 +08:00
+								"""
 								聊天输入归一：供访谈 Agent / 编排层对 ASR 与键盘输入做可控预处理（规则 / 可选 LLM）。
 								不改变 segment 落库原文；仅作为模型侧派生净稿。
 								与 memoir 共用同一套确定性规则，避免聊天与回忆录对同一句理解割裂。
 								"""
 								from __future__ import annotations
 								from typing import Any
 								from app.core.config import settings
-												feat(api): 叙事 prompt、职业上下文、读路径章节、WS 解耦与错误脱敏

- 回忆录：事实边界补充允许清单；传记文体示例与 JSON 叙事要求对齐
- default 职业提示 occupation_context；cadre/military 退休语境
- GET 章节读路径零写入，prepare_chapter_read_view + markdown_for_response
- 文本归一抽到 core/text_normalize；移除弃用 reply 策略与 recompose_chapters_for_story
- ConversationService：WS 连接/用户段落/结束对话；对外错误固定文案
- 测试：HTTP 脱敏契约、章节读视图、occupation 与 background_voice

											
										
										
											2026-04-01 11:49:33 +08:00
+								from app.core.text_normalize import apply_oral_rules, llm_normalize_text
-												feat(api): 访谈人格/回复长度策略、口述归一、背景语气与输入净稿全链路

Chat 访谈
- 新增 persona 系统（default / warm_listener / curious_guide）与 background_voice 语气层
- 回复长度由 compute_reply_plan 统一决策（brief / standard / expanded），融合信息密度启发式
- 输入净稿（input_normalize）：编排层可选 rules/llm 归一用户口语后再喂模型与记忆检索
- 记忆证据注入：按用户话检索 memory evidence 并注入 prompt

Memoir 回忆录
- 口述归一（oral_normalize）：segment 原文保留，story 管线取派生净稿作叙事输入
- segment 入队批次门闸：累计字数 + 最长等待秒数，减少零碎提交
- fidelity_check / prompts / narrative_agent 微调
- Alembic 0005：清理跨章节 story 外键

Infra
- Dockerfile 加入 ffmpeg
- pyproject.toml 新增依赖并同步 uv.lock
- .env.example / .env.production 补全新配置项

Tests
- 新增 test_background_voice、test_chat_input_normalize、test_experience_regressions
- 扩展 test_interview_prompts、test_interview_reply_length、test_story_route_oral_invariant

Made-with: Cursor

											
										
										
											2026-03-31 23:55:26 +08:00
+								from app.core.logging import get_logger
 								logger = get_logger(__name__)
-												feat(api): 叙事 prompt、职业上下文、读路径章节、WS 解耦与错误脱敏

- 回忆录：事实边界补充允许清单；传记文体示例与 JSON 叙事要求对齐
- default 职业提示 occupation_context；cadre/military 退休语境
- GET 章节读路径零写入，prepare_chapter_read_view + markdown_for_response
- 文本归一抽到 core/text_normalize；移除弃用 reply 策略与 recompose_chapters_for_story
- ConversationService：WS 连接/用户段落/结束对话；对外错误固定文案
- 测试：HTTP 脱敏契约、章节读视图、occupation 与 background_voice

											
										
										
											2026-04-01 11:49:33 +08:00
+								apply_conversation_input_rules = apply_oral_rules
-												feat(api): 访谈人格/回复长度策略、口述归一、背景语气与输入净稿全链路

Chat 访谈
- 新增 persona 系统（default / warm_listener / curious_guide）与 background_voice 语气层
- 回复长度由 compute_reply_plan 统一决策（brief / standard / expanded），融合信息密度启发式
- 输入净稿（input_normalize）：编排层可选 rules/llm 归一用户口语后再喂模型与记忆检索
- 记忆证据注入：按用户话检索 memory evidence 并注入 prompt

Memoir 回忆录
- 口述归一（oral_normalize）：segment 原文保留，story 管线取派生净稿作叙事输入
- segment 入队批次门闸：累计字数 + 最长等待秒数，减少零碎提交
- fidelity_check / prompts / narrative_agent 微调
- Alembic 0005：清理跨章节 story 外键

Infra
- Dockerfile 加入 ffmpeg
- pyproject.toml 新增依赖并同步 uv.lock
- .env.example / .env.production 补全新配置项

Tests
- 新增 test_background_voice、test_chat_input_normalize、test_experience_regressions
- 扩展 test_interview_prompts、test_interview_reply_length、test_story_route_oral_invariant

Made-with: Cursor

											
										
										
											2026-03-31 23:55:26 +08:00
 								def _llm_normalize_chat_input(text: str, llm: Any) -> str | None:
 								    """仅修正明显错字与同音字，不增事实；失败返回 None。"""
-												feat(api): 叙事 prompt、职业上下文、读路径章节、WS 解耦与错误脱敏

- 回忆录：事实边界补充允许清单；传记文体示例与 JSON 叙事要求对齐
- default 职业提示 occupation_context；cadre/military 退休语境
- GET 章节读路径零写入，prepare_chapter_read_view + markdown_for_response
- 文本归一抽到 core/text_normalize；移除弃用 reply 策略与 recompose_chapters_for_story
- ConversationService：WS 连接/用户段落/结束对话；对外错误固定文案
- 测试：HTTP 脱敏契约、章节读视图、occupation 与 background_voice

											
										
										
											2026-04-01 11:49:33 +08:00
+								    return llm_normalize_text(
 								        text,
 								        llm,
 								        max_input_chars=int(settings.chat_input_normalize_llm_max_input_chars),
 								        max_tokens=int(settings.chat_input_normalize_llm_max_tokens),
 								        agent_name="chat_input_normalize.llm",
 								    )
-												feat(api): 访谈人格/回复长度策略、口述归一、背景语气与输入净稿全链路

Chat 访谈
- 新增 persona 系统（default / warm_listener / curious_guide）与 background_voice 语气层
- 回复长度由 compute_reply_plan 统一决策（brief / standard / expanded），融合信息密度启发式
- 输入净稿（input_normalize）：编排层可选 rules/llm 归一用户口语后再喂模型与记忆检索
- 记忆证据注入：按用户话检索 memory evidence 并注入 prompt

Memoir 回忆录
- 口述归一（oral_normalize）：segment 原文保留，story 管线取派生净稿作叙事输入
- segment 入队批次门闸：累计字数 + 最长等待秒数，减少零碎提交
- fidelity_check / prompts / narrative_agent 微调
- Alembic 0005：清理跨章节 story 外键

Infra
- Dockerfile 加入 ffmpeg
- pyproject.toml 新增依赖并同步 uv.lock
- .env.example / .env.production 补全新配置项

Tests
- 新增 test_background_voice、test_chat_input_normalize、test_experience_regressions
- 扩展 test_interview_prompts、test_interview_reply_length、test_story_route_oral_invariant

Made-with: Cursor

											
										
										
											2026-03-31 23:55:26 +08:00
 								def normalize_chat_input_for_agent(text: str, *, llm: Any | None = None) -> str:
 								    """
 								    聊天侧单一出口：编排层与 InterviewAgent 共用。
 								    - 全局关闭：原文
 								    - off：原文
 								    - rules：仅规则
 								    - llm：先规则，再（可选）LLM；无 llm 或失败则保留规则结果
 								    """
 								    if not settings.chat_input_normalize_enabled:
 								        return text or ""
 								    mode = (settings.chat_input_normalize_mode or "rules").strip().lower()
 								    if mode == "off":
 								        return text or ""
 								    base = apply_conversation_input_rules(text or "")
 								    if mode != "llm":
 								        return base
 								    refined = _llm_normalize_chat_input(base, llm)
 								    if refined is not None:
 								        return refined
 								    return base