Product Case Study · 2026

PetBook Studio

从“一张宠物卡通图”到“一本真实经历绘本”

我把问题重新定义为:如何让 AI 在尊重真实记忆的前提下,持续画对同一只宠物,并让用户可以在高成本生成前后保持控制。

3–6

张宠物参考照片

多角度建立身份

6

页固定故事分镜

先审阅,后生图

单页自动重试上限

控制成本与等待

01 · Opportunity

用户想保存的不是宠物长什么样,而是它曾经怎样陪伴自己

现有宠物 AI 产品大多停在头像、贴纸和单张插画。它们提供即时惊喜,却很难承载一段有起伏、有细节、可以反复翻阅的真实记忆。

核心张力

情感价值要求“像它、是真的”
生成模型倾向“更好看、更会编”

身份漂移

同一本书里,毛色、斑纹、项圈和体型可能每页都不一样。

事实漂移

AI 为了戏剧性补写内容,却没有告诉用户哪些不是原始经历。

编辑失控

用户只想改一个表情,结果角色、背景和构图一起被重画。

像它自己
像它自己

我不是想要一只泛泛的橘猫,我想要鼻子旁边有那块小斑点的年糕。

保留真实
保留真实

那天它真的用尾巴盖住了小猫,这个动作不能被 AI 改成别的。

02 · Product strategy

把不可控的“一键生成”,改造成七个可确认的产品节点

每一次用户确认都在降低下一阶段的风险:先确认身份,再确认事实和结构,最后才进入昂贵的图像生成。

01

照片与故事

用户提供真实素材

02

Pet DNA

确认身份锁

03

故事理解

事实 / AI 补充

04

六页分镜

编辑后确认

05

角色标准图

统一视觉锚点

06

逐页生成

质检与重试

07

绘本编辑

版本与导出

Scope

为什么固定六页?

足够形成冲突与转折,又能把生成时间、成本和评测规模控制在面试 Demo 可解释范围内。

Consistency

为什么先角色标准图?

把多张真实照片先收敛成统一画风的角色锚点,后续每页同时引用照片、Pet DNA 与标准图。

Reliability

为什么逐页生成?

首张通过质检后再继续;单页失败、修正和重试不会让整本书归零。

03 · AI orchestration

模型不是一个黑盒按钮,而是一条有输入契约和质检闭环的生产线

页面只调用内部 Route Handler。Provider 工厂决定使用 Mock 还是 Google Gemini;结构化结果统一经过 Zod 校验。

Vision

Pet DNA

Text

事实拆解

Story

六页分镜

Image

连续插画

Vision

AI 辅助质检

Edit

局部重绘

输入契约

照片、Pet DNA、不可变特征、角色标准图、当前分镜、前后页连续性、mustKeep 与 avoid。

输出契约

文本严格 JSON;图片不含正文;每次返回 model、generationId、耗时、状态和来源。

失败契约

超时、限流与单页失败会明确提示;允许一次自动重试,但绝不静默替换为 Mock。

04 · Product evidence

让面试官看到产品界面,而不只是听工作流名词

同一份年糕项目状态贯穿 Pet DNA、分镜、角色标准图、成品和编辑版本。

Pet DNA · 身份锁

01
年糕参考图

暖橘 × 奶油白

鼻右侧橘色斑点

琥珀绿色圆眼睛

森林绿项圈

橘色环纹长尾

不确定:逆光下背部花纹边界

Storyboard · 六页结构

02
相遇
P1 · 相遇事实
观察
P2 · 观察AI
犹豫
P3 · 犹豫事实
靠近
P4 · 靠近事实
守护
P5 · 守护事实
余韵
P6 · 余韵AI

Character Sheet · 视觉锚点

03
年糕角色标准图

Editable Book · 版本历史

04
V1 原页面
V1 原页面
V2 更好奇
V2 更好奇

Natural language edit

让年糕看起来更好奇一些,其他内容不要改变。

05 · Bad Case

最关键的失败不是“不够好看”,而是“不再像用户的那只宠物”

Bad Case 被拆成可定位的问题、原因、约束修正和前后结果,而不是一句“重新生成”。

问题诊断

局部修改导致身份和构图一起漂移

原因
编辑 Prompt 只写“更好奇”,没有说明哪些内容绝对不能改变。
优化
加入 editType,并显式列出宠物身份、毛色、项圈、构图、背景、其他角色和未指定内容。
验收
新版本进入同一页版本历史,用户可对比、使用新版本或恢复 V1。
修改前 · V1
修改前 · V1
修改后 · V2
修改后 · V2

只改

表情更好奇

保留

身份 / 项圈 / 背景

结果

可回退版本

06 · Evaluation

评测围绕产品风险,而不是只看一张图是否“审美不错”

视觉理解看身份锁是否准确,文本看事实边界,图片看连续性,编辑看未指定区域是否稳定。

离线评测样例 · 20 个故事任务

Demo 示例数据,不代表正式模型评测结果
评测维度检查方法Mock 示例分建议阈值
身份一致性多角度参考图 + 角色标准图9490
不可变特征保留鼻侧斑点 / 项圈 / 毛色分区9592
文图匹配动作、情绪、角色数量9390
跨页画风一致同一风格与连续性上下文9288
局部编辑服从只改指定内容9187

07 · Architecture & boundaries

演示稳定性与真实能力并存,但绝不把 Mock 伪装成真实生成

同一套页面和领域类型,通过服务端 Provider 工厂切换执行路径。API Key 仅在服务端读取。

AI_PROVIDER=mock

Mock mode

本地年糕示例数据

本地角色图与六页插画

可控延迟与稳定质检

离线三分钟演示

AI_PROVIDER=google

Google mode

Gemini 多模态理解

结构化 JSON + Zod

Gemini 原生图片生成/编辑

失败明确提示与重试

密钥

只在 Route Handler 后方

状态

浏览器 IndexedDB 恢复

成本

图片调用必须主动点击

来源

示例 Mock 与真实 Google 明确隔离

Try the product

产品思路讲完了,现在回到年糕的那本书