Files
EPEEAIKit/.cursor/deferred/registry.md

203 lines
12 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Deferred Decisions Registry
## Active Items
### [cloud-deploy-route-b] 路线 B云服务器正式部署
- **status**: deferred
- **tags**: deployment, docker, nginx, cloud, production
- **recorded**: 2026-04-12
- **source_chat**: [发布到手机浏览器的方案讨论](discussion-publish-routes)
- **prerequisite**: 路线 A内网穿透 + 移动端适配)完成后
- **related_files**:
- art-agent/backend/app/main.py
- art-agent/frontend/next.config.ts
- art-agent/frontend/.env.local
- art-agent/backend/.env
- **context**: |
买轻量云服务器2C2G ~50元/月),编写前后端 Dockerfile + docker-compose
配置 Nginx/Caddy 反向代理统一入口HTTPS 自动签证书,
环境变量搬迁(去掉本地代理配置),可选绑定域名。
预估工作量 1-2 天。
- **chosen_alternative**: 路线 A — 本地运行 + 内网穿透Cloudflare Tunnel / ngrok
- **deferred_reason**: 当前阶段只需自己和朋友试用,内网穿透足够
### [style-pipeline-layered] 分层组合风格一致性产线(含便利选取 + LoRA 训练)
- **status**: deferred
- **tags**: 风格一致性, 风格选取, IP-Adapter, LoRA, ControlNet, 量产, 美术产线, InstantStyle, 风格库, 训练
- **recorded**: 2026-04-12
- **updated**: 2026-04-16
- **source_chat**: [风格一致性技术方案讨论](style-consistency-discussion)
- **prerequisite**: EPEEKit 进入美术资源量产阶段(风格方向已确定、需要批量产出同风格素材)
- **related_files**:
- art-agent/backend/app/services/image_gen.py
- art-agent/backend/app/config.py
- art-agent/frontend/src/app/page.tsx
- **context**: |
分层组合的风格一致性产线:
1. 探索期当前Prompt + 参考图,快速试错确定风格方向
2. 锁定期IP-Adapter / ControlNet选 3-5 张精选图作为风格锚点,推理时注入风格
3. 量产期LoRA + ControlNet用精选图训练 LoRA20-50 张),批量产出同风格资源
4. 贯穿全程:标准化 Prompt 模板 + Negative Prompt 模板,确保品质下限
各阶段可叠加使用不互斥。LoRA 训练需要同风格样本积累到足够数量。
2026-04-13 调研补充 — 风格迁移模型层级:
- Kolors IP-Adapter当前在用通用 IP-Adapter风格迁移弱内容+风格+构图混合提取
- InstantStyleReplicate 可用):专门分离内容/风格,风格迁移强,但贵且慢
- Style IPAdapter for NoobAI-XLCivitAI最强画风迁移线条+着色技法),需 ComfyUI
- ICAS 框架(学术前沿 2025.04IP-Adapter + ControlNet 组合,多主体风格一致性最优
锁定期的最佳方案:迁移到 HF Inference Endpoints 后,用 NoobAI-XL + Style IPAdapter + ControlNet
2026-04-16 补充 — 便利的风格选取和 LoRA 训练 UI
- 风格库 UI预设风格卡片缩略图+标签+描述),一键选取即注入对应 Prompt 模板/参考图/LoRA
- LoRA 训练流程集成:在 Agent 内上传训练素材 → 触发云端 LoRA 训练 → 训练完成后自动入库为新风格
- 风格组合:支持多风格叠加(如"水墨 + 赛博朋克"),前端可视化混合权重
- 风格管理:用户自建/收藏风格,按项目/标签分类,团队共享
- **chosen_alternative**: 当前使用 Prompt Engineering + LLM 参考图理解(探索期方案)
- **deferred_reason**: 风格方向尚未确定,过早引入 LoRA/ControlNet 是过度优化
### [doc-gen-management] 文档生成和管理系统
- **status**: deferred
- **tags**: 文档生成, 项目大纲, 游戏风格文档, 美术规范, GDD, 模板, 导入
- **recorded**: 2026-04-16
- **source_chat**: [接下来要做的三件事](next-features-planning-0416)
- **prerequisite**: 基础对话生图能力稳定后
- **related_files**:
- art-agent/frontend/src/app/page.tsx
- art-agent/backend/app/agent/loop.py
- art-agent/backend/app/agent/tools.py
- **context**: |
文档驱动的美术资源生产流程:
1. 项目大纲导入:支持上传/粘贴项目大纲GDD、策划案等Agent 解析结构
2. 游戏风格文档生成:基于大纲 + 对话交互,自动生成美术风格指南
(色彩体系、质感定义、元素规范、参考图收集等)
3. 文档模板预设多种文档模板美术风格指南、UI 规范、角色设定集、场景规范等)
4. 文档管理:按项目组织,版本历史,团队共享,与生图任务关联
5. 文档 → 生图联动:风格文档中的规范自动注入生图 Prompt确保产出一致性
- **chosen_alternative**: 当前无文档管理能力,美术规范靠口头约定或外部文档
- **deferred_reason**: 当前阶段聚焦核心生图能力,文档系统是生图能力稳定后的自然延伸
### [asset-spec-presets] 资产规格快速选取系统
- **status**: deferred
- **tags**: 资产规格, icon, UI资产, 3D资产, 尺寸, 比例, 安全区, 底色, 预设, 美术标准
- **recorded**: 2026-04-16
- **source_chat**: [接下来要做的三件事](next-features-planning-0416)
- **prerequisite**: 基础生图能力稳定后
- **related_files**:
- art-agent/backend/app/agent/tools.py
- art-agent/backend/app/services/image_gen.py
- art-agent/frontend/src/app/page.tsx
- **context**: |
资产规格预设系统——选取资产类型即自动套用全部技术标准:
1. 资产类型库Icon / UI按钮 / 头像框 / 背景图 / 角色立绘 / 场景原画 / 3D贴图 等
2. 每种类型包含完整规格定义:
- 尺寸输出分辨率、DPI
- 比例1:1 / 16:9 / 自定义)
- 安全区(内容区 vs 出血区)
- 底色/透明度要求
- 文件格式PNG / SVG / PSD 等)
- 风格约束(该类资产的通用风格要求,如 icon 需要简洁辨识度高)
- 导出规格(多尺寸自动导出,如 @1x @2x @3x
3. 项目级自定义:允许在预设基础上调整,保存为项目专属规格
4. 3D 资产扩展:未来覆盖 3D 模型的面数/贴图分辨率/UV规范等
5. 一键应用:选取资产类型后,尺寸/比例/后处理参数自动注入生图调用
6. 游戏全品类覆盖:目标是游戏中所有美术资产类型都有对应的规格预设
- **chosen_alternative**: 当前生图参数完全由用户在对话中手动指定或由 LLM 推断
- **deferred_reason**: 当前阶段聚焦核心生图和风格探索,规格系统是进入量产阶段的必备基础设施
### [hf-inference-endpoints] 迁移到 Hugging Face + Inference Endpoints
- **status**: deferred
- **tags**: 基础设施, Hugging Face, Inference Endpoints, ComfyUI, 自定义模型, 风格迁移
- **recorded**: 2026-04-13
- **source_chat**: [Kolors 风格迁移排查与模型调研](kolors-style-investigation)
- **prerequisite**: 探索期结束、确定要用的模型组合后
- **related_files**:
- art-agent/backend/app/services/image_gen.py
- art-agent/backend/app/config.py
- **context**: |
将生图基础设施从 Replicate API 迁移到 Hugging Face Inference Endpoints
1. 可部署任意 ComfyUI 工作流NoobAI-XL + Style IPAdapter + ControlNet 等任意组合)
2. 不受 Replicate 模型作者暴露的参数限制,完全控制推理流程
3. CivitAI 上的任何 LoRA、IP-Adapter 权重都能直接加载
4. 按 GPU 时长计费,批量生成时远比 Replicate 按次付费便宜
5. 是 style-pipeline-layered 延期方案中"锁定期 → 量产期"的基础设施
背景:当前在 Replicate 上可用的风格迁移模型有限——
- Kolors IP-Adapter风格迁移弱混合提取内容+风格+构图)
- InstantStylejyoung105/instant-style风格迁移强但贵$0.12/次)且慢(~128s
- Style IPAdapter for NoobAI-XL最强画风迁移但需 ComfyUI 环境Replicate 上无法使用
迁移到 HF Inference Endpoints 后可自由组合以上所有方案。
- **chosen_alternative**: 当前使用 Replicate APIKolors IP-Adapter + Flux + SDXL
- **deferred_reason**: 探索期用 Replicate 足够快速迭代,迁移工作量较大(需搭建自定义推理服务)
### [vision-model-asset-library] 专用 Vision 模型用于资源库功能
- **status**: deferred
- **tags**: 资源库, vision, CLIP, BLIP, 图片搜索, 自动标签, embedding
- **recorded**: 2026-04-12
- **source_chat**: [参考图风格解析方案讨论](vision-model-discussion)
- **prerequisite**: 资源库功能进入增强阶段(基础 Gallery 已完成)
- **related_files**:
- art-agent/frontend/src/app/gallery/page.tsx
- art-agent/backend/app/services/image_gen.py
- **context**: |
引入专用 Vision 模型CLIP / BLIP 等)为资源库提供智能化能力:
1. 自动标签生成的图片自动分类UI/角色/场景/图标等)
2. 以图搜图:上传一张图,从资源库中找风格最相似的
3. 语义搜索:用自然语言搜索图片(如"蓝色水晶质感的按钮"
4. 聚类分组:自动将图片按视觉相似性分组
可通过 Replicate 调用或本地部署,成本极低。
- **chosen_alternative**: 当前资源库使用手动标签 + Prompt 文本搜索
- **deferred_reason**: 当前阶段资源量少,手动管理足够;等资源积累到一定量级后再引入自动化
### [advanced-view-transform] 进阶视角变换 Pipeline3D 重建 + ControlNet 风格还原)
- **status**: deferred
- **tags**: 视角变换, 3D重建, ControlNet, Zero123++, TripoSR, InstantMesh, Novel View Synthesis, 手绘风格, IP-Adapter
- **recorded**: 2026-04-16
- **source_chat**: [视角变换方案讨论与 Zero123++ 集成](view-transform-zero123plus)
- **prerequisite**: Zero123++ 基础验证完成、确认视角变换是高频需求后
- **related_files**:
- art-agent/backend/app/services/view_transform.py
- art-agent/backend/app/config.py
- art-agent/backend/app/agent/tools.py
- **context**: |
当前已集成 Zero123++(固定 6 视角输出),但存在两个局限:
1. 视角固定6 个预设角度),无法自定义任意角度
2. 手绘风格保持度不够——Zero123++ 更擅长写实/3D 渲染风格
进阶方案分三个层级:
A. 更强的多视角生成模型:
- Era3D高质量多视角一致性建筑类友好
- SyncDreamer同步多视角生成一致性好
- Wonder3D多视角 + 法线图,精确视角控制
B. ControlNet 引导的视角变换:
- 用 Depth Anything V2 从原图提取深度图
- 用 ControlNetdepth/normal 模式)+ 目标视角描述重新生成
- 通过 IP-Adapter 注入原图风格保持手绘风格
C. 最佳质量方案(多步组合 Pipeline
原图 → TripoSR/InstantMesh 3D 重建 → 旋转到任意目标角度渲染灰度/线稿
→ ControlNet(canny/depth) + IP-Adapter(原图风格) → 手绘风格新视角图
这是质量最高的方案:视角精准 + 风格保真
实施依赖:
- 方案 B/C 需要 ComfyUI 环境(与 hf-inference-endpoints 延期方案关联)
- 方案 C 的 TripoSR/InstantMesh 可先在 Replicate 上验证
- **chosen_alternative**: 当前使用 Zero123++ 固定 6 视角输出(基础验证阶段)
- **deferred_reason**: 先用 Zero123++ 验证视角变换的实际需求频率和用户反馈,再投入进阶方案
---
## Completed / Cancelled Items
### [context-window-management] 对话上下文管理(滑动窗口)
- **status**: completed
- **completed_date**: 2026-04-13
- **completed_by**: [CL-20260413-2320] Mem0 记忆系统集成
- **notes**: 原计划自建 tiktoken + 滑动窗口 + 摘要。实际方案Mem0 的事实提取替代了"对话摘要",滑动窗口在 loop.py 中实现MAX_RECENT_TURNS=20
### [mem0-long-term-memory] 引入 Mem0 作为长期记忆层
- **status**: completed
- **completed_date**: 2026-04-13
- **completed_by**: [CL-20260413-2320] Mem0 记忆系统集成
- **notes**: Mem0 OSS 自部署DeepSeek 事实提取 + Ollama nomic-embed-text embedding + Qdrant 本地向量库),与上下文管理一并实施