Files
EPEEAIKit/.cursor/deferred/registry.md

12 KiB
Raw Permalink Blame History

Deferred Decisions Registry

Active Items

[cloud-deploy-route-b] 路线 B云服务器正式部署

  • status: deferred
  • tags: deployment, docker, nginx, cloud, production
  • recorded: 2026-04-12
  • source_chat: 发布到手机浏览器的方案讨论
  • prerequisite: 路线 A内网穿透 + 移动端适配)完成后
  • related_files:
    • art-agent/backend/app/main.py
    • art-agent/frontend/next.config.ts
    • art-agent/frontend/.env.local
    • art-agent/backend/.env
  • context: | 买轻量云服务器2C2G ~50元/月),编写前后端 Dockerfile + docker-compose 配置 Nginx/Caddy 反向代理统一入口HTTPS 自动签证书, 环境变量搬迁(去掉本地代理配置),可选绑定域名。 预估工作量 1-2 天。
  • chosen_alternative: 路线 A — 本地运行 + 内网穿透Cloudflare Tunnel / ngrok
  • deferred_reason: 当前阶段只需自己和朋友试用,内网穿透足够

[style-pipeline-layered] 分层组合风格一致性产线(含便利选取 + LoRA 训练)

  • status: deferred

  • tags: 风格一致性, 风格选取, IP-Adapter, LoRA, ControlNet, 量产, 美术产线, InstantStyle, 风格库, 训练

  • recorded: 2026-04-12

  • updated: 2026-04-16

  • source_chat: 风格一致性技术方案讨论

  • prerequisite: EPEEKit 进入美术资源量产阶段(风格方向已确定、需要批量产出同风格素材)

  • related_files:

    • art-agent/backend/app/services/image_gen.py
    • art-agent/backend/app/config.py
    • art-agent/frontend/src/app/page.tsx
  • context: | 分层组合的风格一致性产线:

    1. 探索期当前Prompt + 参考图,快速试错确定风格方向
    2. 锁定期IP-Adapter / ControlNet选 3-5 张精选图作为风格锚点,推理时注入风格
    3. 量产期LoRA + ControlNet用精选图训练 LoRA20-50 张),批量产出同风格资源
    4. 贯穿全程:标准化 Prompt 模板 + Negative Prompt 模板,确保品质下限 各阶段可叠加使用不互斥。LoRA 训练需要同风格样本积累到足够数量。

    2026-04-13 调研补充 — 风格迁移模型层级:

    • Kolors IP-Adapter当前在用通用 IP-Adapter风格迁移弱内容+风格+构图混合提取
    • InstantStyleReplicate 可用):专门分离内容/风格,风格迁移强,但贵且慢
    • Style IPAdapter for NoobAI-XLCivitAI最强画风迁移线条+着色技法),需 ComfyUI
    • ICAS 框架(学术前沿 2025.04IP-Adapter + ControlNet 组合,多主体风格一致性最优 锁定期的最佳方案:迁移到 HF Inference Endpoints 后,用 NoobAI-XL + Style IPAdapter + ControlNet

    2026-04-16 补充 — 便利的风格选取和 LoRA 训练 UI

    • 风格库 UI预设风格卡片缩略图+标签+描述),一键选取即注入对应 Prompt 模板/参考图/LoRA
    • LoRA 训练流程集成:在 Agent 内上传训练素材 → 触发云端 LoRA 训练 → 训练完成后自动入库为新风格
    • 风格组合:支持多风格叠加(如"水墨 + 赛博朋克"),前端可视化混合权重
    • 风格管理:用户自建/收藏风格,按项目/标签分类,团队共享
  • chosen_alternative: 当前使用 Prompt Engineering + LLM 参考图理解(探索期方案)

  • deferred_reason: 风格方向尚未确定,过早引入 LoRA/ControlNet 是过度优化

[doc-gen-management] 文档生成和管理系统

  • status: deferred
  • tags: 文档生成, 项目大纲, 游戏风格文档, 美术规范, GDD, 模板, 导入
  • recorded: 2026-04-16
  • source_chat: 接下来要做的三件事
  • prerequisite: 基础对话生图能力稳定后
  • related_files:
    • art-agent/frontend/src/app/page.tsx
    • art-agent/backend/app/agent/loop.py
    • art-agent/backend/app/agent/tools.py
  • context: | 文档驱动的美术资源生产流程:
    1. 项目大纲导入:支持上传/粘贴项目大纲GDD、策划案等Agent 解析结构
    2. 游戏风格文档生成:基于大纲 + 对话交互,自动生成美术风格指南 (色彩体系、质感定义、元素规范、参考图收集等)
    3. 文档模板预设多种文档模板美术风格指南、UI 规范、角色设定集、场景规范等)
    4. 文档管理:按项目组织,版本历史,团队共享,与生图任务关联
    5. 文档 → 生图联动:风格文档中的规范自动注入生图 Prompt确保产出一致性
  • chosen_alternative: 当前无文档管理能力,美术规范靠口头约定或外部文档
  • deferred_reason: 当前阶段聚焦核心生图能力,文档系统是生图能力稳定后的自然延伸

[asset-spec-presets] 资产规格快速选取系统

  • status: deferred
  • tags: 资产规格, icon, UI资产, 3D资产, 尺寸, 比例, 安全区, 底色, 预设, 美术标准
  • recorded: 2026-04-16
  • source_chat: 接下来要做的三件事
  • prerequisite: 基础生图能力稳定后
  • related_files:
    • art-agent/backend/app/agent/tools.py
    • art-agent/backend/app/services/image_gen.py
    • art-agent/frontend/src/app/page.tsx
  • context: | 资产规格预设系统——选取资产类型即自动套用全部技术标准:
    1. 资产类型库Icon / UI按钮 / 头像框 / 背景图 / 角色立绘 / 场景原画 / 3D贴图 等
    2. 每种类型包含完整规格定义:
      • 尺寸输出分辨率、DPI
      • 比例1:1 / 16:9 / 自定义)
      • 安全区(内容区 vs 出血区)
      • 底色/透明度要求
      • 文件格式PNG / SVG / PSD 等)
      • 风格约束(该类资产的通用风格要求,如 icon 需要简洁辨识度高)
      • 导出规格(多尺寸自动导出,如 @1x @2x @3x
    3. 项目级自定义:允许在预设基础上调整,保存为项目专属规格
    4. 3D 资产扩展:未来覆盖 3D 模型的面数/贴图分辨率/UV规范等
    5. 一键应用:选取资产类型后,尺寸/比例/后处理参数自动注入生图调用
    6. 游戏全品类覆盖:目标是游戏中所有美术资产类型都有对应的规格预设
  • chosen_alternative: 当前生图参数完全由用户在对话中手动指定或由 LLM 推断
  • deferred_reason: 当前阶段聚焦核心生图和风格探索,规格系统是进入量产阶段的必备基础设施

[hf-inference-endpoints] 迁移到 Hugging Face + Inference Endpoints

  • status: deferred
  • tags: 基础设施, Hugging Face, Inference Endpoints, ComfyUI, 自定义模型, 风格迁移
  • recorded: 2026-04-13
  • source_chat: Kolors 风格迁移排查与模型调研
  • prerequisite: 探索期结束、确定要用的模型组合后
  • related_files:
    • art-agent/backend/app/services/image_gen.py
    • art-agent/backend/app/config.py
  • context: | 将生图基础设施从 Replicate API 迁移到 Hugging Face Inference Endpoints
    1. 可部署任意 ComfyUI 工作流NoobAI-XL + Style IPAdapter + ControlNet 等任意组合)
    2. 不受 Replicate 模型作者暴露的参数限制,完全控制推理流程
    3. CivitAI 上的任何 LoRA、IP-Adapter 权重都能直接加载
    4. 按 GPU 时长计费,批量生成时远比 Replicate 按次付费便宜
    5. 是 style-pipeline-layered 延期方案中"锁定期 → 量产期"的基础设施 背景:当前在 Replicate 上可用的风格迁移模型有限——
    • Kolors IP-Adapter风格迁移弱混合提取内容+风格+构图)
    • InstantStylejyoung105/instant-style风格迁移强但贵$0.12/次)且慢(~128s
    • Style IPAdapter for NoobAI-XL最强画风迁移但需 ComfyUI 环境Replicate 上无法使用 迁移到 HF Inference Endpoints 后可自由组合以上所有方案。
  • chosen_alternative: 当前使用 Replicate APIKolors IP-Adapter + Flux + SDXL
  • deferred_reason: 探索期用 Replicate 足够快速迭代,迁移工作量较大(需搭建自定义推理服务)

[vision-model-asset-library] 专用 Vision 模型用于资源库功能

  • status: deferred
  • tags: 资源库, vision, CLIP, BLIP, 图片搜索, 自动标签, embedding
  • recorded: 2026-04-12
  • source_chat: 参考图风格解析方案讨论
  • prerequisite: 资源库功能进入增强阶段(基础 Gallery 已完成)
  • related_files:
    • art-agent/frontend/src/app/gallery/page.tsx
    • art-agent/backend/app/services/image_gen.py
  • context: | 引入专用 Vision 模型CLIP / BLIP 等)为资源库提供智能化能力:
    1. 自动标签生成的图片自动分类UI/角色/场景/图标等)
    2. 以图搜图:上传一张图,从资源库中找风格最相似的
    3. 语义搜索:用自然语言搜索图片(如"蓝色水晶质感的按钮"
    4. 聚类分组:自动将图片按视觉相似性分组 可通过 Replicate 调用或本地部署,成本极低。
  • chosen_alternative: 当前资源库使用手动标签 + Prompt 文本搜索
  • deferred_reason: 当前阶段资源量少,手动管理足够;等资源积累到一定量级后再引入自动化

[advanced-view-transform] 进阶视角变换 Pipeline3D 重建 + ControlNet 风格还原)

  • status: deferred

  • tags: 视角变换, 3D重建, ControlNet, Zero123++, TripoSR, InstantMesh, Novel View Synthesis, 手绘风格, IP-Adapter

  • recorded: 2026-04-16

  • source_chat: 视角变换方案讨论与 Zero123++ 集成

  • prerequisite: Zero123++ 基础验证完成、确认视角变换是高频需求后

  • related_files:

    • art-agent/backend/app/services/view_transform.py
    • art-agent/backend/app/config.py
    • art-agent/backend/app/agent/tools.py
  • context: | 当前已集成 Zero123++(固定 6 视角输出),但存在两个局限:

    1. 视角固定6 个预设角度),无法自定义任意角度
    2. 手绘风格保持度不够——Zero123++ 更擅长写实/3D 渲染风格

    进阶方案分三个层级:

    A. 更强的多视角生成模型: - Era3D高质量多视角一致性建筑类友好 - SyncDreamer同步多视角生成一致性好 - Wonder3D多视角 + 法线图,精确视角控制

    B. ControlNet 引导的视角变换: - 用 Depth Anything V2 从原图提取深度图 - 用 ControlNetdepth/normal 模式)+ 目标视角描述重新生成 - 通过 IP-Adapter 注入原图风格保持手绘风格

    C. 最佳质量方案(多步组合 Pipeline 原图 → TripoSR/InstantMesh 3D 重建 → 旋转到任意目标角度渲染灰度/线稿 → ControlNet(canny/depth) + IP-Adapter(原图风格) → 手绘风格新视角图 这是质量最高的方案:视角精准 + 风格保真

    实施依赖:

    • 方案 B/C 需要 ComfyUI 环境(与 hf-inference-endpoints 延期方案关联)
    • 方案 C 的 TripoSR/InstantMesh 可先在 Replicate 上验证
  • chosen_alternative: 当前使用 Zero123++ 固定 6 视角输出(基础验证阶段)

  • deferred_reason: 先用 Zero123++ 验证视角变换的实际需求频率和用户反馈,再投入进阶方案


Completed / Cancelled Items

[context-window-management] 对话上下文管理(滑动窗口)

  • status: completed
  • completed_date: 2026-04-13
  • completed_by: [CL-20260413-2320] Mem0 记忆系统集成
  • notes: 原计划自建 tiktoken + 滑动窗口 + 摘要。实际方案Mem0 的事实提取替代了"对话摘要",滑动窗口在 loop.py 中实现MAX_RECENT_TURNS=20

[mem0-long-term-memory] 引入 Mem0 作为长期记忆层

  • status: completed
  • completed_date: 2026-04-13
  • completed_by: [CL-20260413-2320] Mem0 记忆系统集成
  • notes: Mem0 OSS 自部署DeepSeek 事实提取 + Ollama nomic-embed-text embedding + Qdrant 本地向量库),与上下文管理一并实施