10 KiB
Seller Helper 方案设计
面向 Ozon 跨境电商的 AI 选品搬运工具 文档状态:方案探讨阶段(未开始编码) 最后更新:2026-08-05
1. 背景与目标
在 Ozon 做跨境电商,货源来自 1688 / 淘宝 / 拼多多。当前痛点:
- 单个门店的商品图片、信息往往不完善,需要跨多个网站抓取补齐。
- 图片最麻烦:图里的中文需要转成俄文,甚至需要 AI 美化重做。
- 信息要一条条手动填进 Ozon 商品编辑页,耗时。
- 部分商品带视频,视频里的中文也可能需要替换成俄文。
目标效果
粘贴一个或多个卖家网站 URL → 程序自动:
- 抓取商品信息、图片、包装信息等资源;
- 生成俄文标题、标签、简介、富文本(富文本用固定模板,图文内容由程序生成);
- 抓取合适的图片并翻译中文 / AI 美化;
- 提供预览页面,可点选某区域,通过与 AI 对话修改选中内容(文本或图片);
- 满意后提交,调用 Ozon Seller API 上传到后台(用户再去 Ozon 后台正式发布)。
Ozon Seller API 文档:https://docs.ozon.ru/api/seller/zh/
2. 可行性总览
结论:能实现,大部分模块是成熟技术。 全流程真正的难点只有两个:
- 🔴 从 1688/淘宝/拼多多稳定抓取(反爬)
- 🔴 视频里的中文替换(工程量大、效果不稳定)
其余模块可靠可控。
| 模块 | 难度 | 说明 |
|---|---|---|
| ① 抓取商品信息/图片 | 🔴 高(反爬) | 三个平台都有强反爬,最脆弱的一环 |
| ② 生成俄文标题/标签/简介 | 🟢 低 | LLM 直接做,质量高,可顺带做 Ozon SEO |
| ③ 图片中文→俄文 | 🟡 中 | OCR 定位 + 抹字 + 重排,或图像编辑模型直改 |
| ④ 图片 AI 美化 | 🟡 中 | 图生图,效果好但要控成本 |
| ⑤ 富文本内容生成(模板+图文) | 🟢 低 | 模板注入 + LLM 填内容 |
| ⑥ 预览 + 点选对话式编辑 | 🟡 中 | 标准 Web 应用 + AI 编辑循环,工程量在交互 |
| ⑦ 上传 Ozon | 🟢 低-中 | API 清晰,难在类目属性字典要匹配对 |
| ⑧ 视频中文替换 | 🔴 高 | 建议放到二期/三期,单独立项评估 |
3. 各模块技术方案
① 抓取(数据入口)
官方 API(1688 开放平台、淘宝开放平台、多多进宝)对个人几乎不开放。三条可选路线,从稳到脆:
- 浏览器插件方案(✅ 已选定):Chrome 扩展,用户正常登录浏览时点「抓取」,插件读取当前页面已渲染的 DOM/接口数据发给后端。借用用户真人登录态与真实环境,最不易被封,且多网站补充信息的场景天然契合——在哪个页面就抓哪个。
- 第三方"商品详情"数据 API:按次收费,省心但有费用、字段可能不全、依赖第三方稳定性。
- Playwright 后端无头浏览器:灵活但最易触发风控,维护成本高。
决策:MVP 采用浏览器插件抓取,先只支持 1688。
② 文案生成(俄文标题/标签/简介)
用 Claude 把抓取的中文信息 → 生成俄文标题/关键词标签/卖点简介,并按 Ozon 习惯做本地化 SEO。质量最有保证,是核心价值区。
③ 图片文字翻译(中文→俄文)
两条路线,已决定都接,预览页让用户对比挑选:
- 路线 A · 传统管线(版式高度还原):OCR 定位中文(如 PaddleOCR)→ inpaint 抹除 → 按原版式重排俄文。可控、可批量,适合规格参数图,排版还原需调试。
- 路线 B · 图像编辑模型直改(效果自然美观):用多模态图像编辑模型直接"把图里中文换成俄文/美化"。上手快、出图自然,但排版可能与原图有差异,需控成本与一致性。
④ 图片 AI 美化
图生图,效果好但要控成本。与路线 B 共用图像编辑模型能力。
⑤ 富文本内容生成
用户提供固定模板(含占位符),程序把生成好的图文填进模板。
⑥ 预览 + 点选对话式编辑
Web 页面渲染最终商品卡;每个可编辑区域(某段文字、某张图)可点选 → 弹出对话框 → 用户下指令 → 局部重生成。标准的"AI 编辑循环",工程量在交互设计。(Pi SDK 的适用性见第 6 节。)
⑦ Ozon 上传
Ozon Seller API 有完整的商品导入流程(/v2/product/import、图片上传、类目属性)。核心坑是类目属性字典:每个类目有强制属性,值必须来自 Ozon 字典(/v2/category/attribute 拉取),不能随便填。需做"属性映射 + 字典校验"层。上传后用户在后台正式发布。
⑧ 视频中文替换(二期/三期)
- 硬字幕(烧进画面的中文):逐帧 OCR + 抹除 + 重排,效果不稳定。
- 配音:STT → 翻译 → TTS 重配,相对可控。
- 建议一期先不做,或只做"音频重配"子集,单独立项评估。
4. 推荐架构 / 技术栈
┌─ Chrome 扩展(抓取,借用户登录态)
│ │ { 标题, 参数, 图片URL[], 价格, 详情图文 }
▼
Next.js 后端(前后端一体)
├─ /extract 规整原始数据
├─ /generate Claude → 俄文标题/标签/简介 + 富文本(模板占位)
├─ /image 队列任务:路线A(OCR+抹字+重排) / 路线B(图像编辑模型) 两版都出
├─ 图片服务 Python 微服务:OCR/inpaint + 图像编辑模型
├─ 任务队列 图片/视频异步处理(BullMQ)
└─ /ozon 类目属性字典校验 + 上传草稿
▼
对象存储(图片/视频)
▼
前端预览页(React):点选区域 + 对话式编辑;图片 A/B 两版切换
- 主栈 Next.js(前后端一体)。
- 图像/OCR 用 Python 微服务(生态最好)。
- 长任务用队列(BullMQ)。
- 环境:Node 22 + Python 3.14(本机均已就绪)。
5. 分阶段路线
一期 MVP(已选:文案为主链路)
主链路目标:1688 商品页点插件「抓取」→ 后端生成俄文文案+富文本 → 预览页可对话改文案 → 一键推 Ozon 草稿。图片一期先"原样搬运 + 可选翻译/美化",两条路线并存供挑选。
落地顺序(每步可独立验证):
- 脚手架:Next.js 项目 + 目录结构 + 环境变量(Claude key、Ozon key、图片模型 key)。
- Chrome 扩展:先只做 1688,抓取当前页 → POST 到本地后端,打通原始 JSON。
- 文案生成:Claude 中文数据 → 俄文标题/标签/简介 + 富文本(占位符注入)。
- 预览页 + 对话式改文案:渲染商品卡,点选文字区域 → 对话局部重生成。
- Ozon 适配层:拉类目属性字典 → 校验 → 上传草稿。先把纯文案(无图)商品推成功。
- 图片双路线:接 OCR 抹字重排(A)+ 图像编辑模型(B),预览页出两版供选。
步骤 1、2 无需任何密钥即可先跑起来看到效果。
二期
多平台抓取(淘宝/拼多多)、图片美化、点选对话式改图、类目属性智能映射。
三期
视频处理。
6. Pi SDK 适用性评估
Pi(Earendil 出品,MIT 开源,@earendil-works/pi-coding-agent)是可嵌入的 AI 编码 Agent 框架(TS/JS)。核心:Session + 事件流、自定义工具 defineTool()、内置工具 read/bash/edit/write/grep/find/ls、消息队列 steer()/followUp()、Session 树 fork/clone、子 agent、可切换模型(能接 Claude)。文档:https://pi.dev/docs/latest/sdk
判断:外科手术式使用——只用在一个地方
✅ 强契合:预览页「对话式编辑」循环
该交互本质是带工具的 agent 会话,Pi 能力几乎量身定做:
| 需求 | Pi 对应能力 |
|---|---|
| 点选区域后对话改内容 | AgentSession + 自定义工具 editText/regenText/editImage/swapImageVariant |
| 改到一半想换方向 | steer() 打断当前回合 |
| 改完这段再改那段 | followUp() 排队 |
| 回退 / 多方案对比 | Session 树 fork/clone(天然 undo + A/B 分支) |
| 前端实时看 AI 在改什么 | 事件流喂 UI |
| 长对话不爆上下文 | 内置 compaction |
自己用 Anthropic SDK 手撸需实现打断、排队、分支、压缩——Pi 白送。
❌ 不建议:抓取→文案→图片→上传 主管线
这是确定性 ETL,非开放式 agent 任务。用 agent 框架包会引入不必要的非确定性,上传 Ozon 那步尤其不能让 agent 自由发挥。用普通代码 + 直接 Claude API 更可控、好测。
原则:流程固定的用管线代码;开放式、要来回对话的用 Pi。 只有编辑循环属于后者。
两个坑
- 默认内置工具含
bash/edit/write,服务端必须关掉。 抓取来的网页内容是不可信输入(提示注入风险),若 agent 带 bash/写文件能力,可能被诱导在服务器执行命令。用 Pi 时禁用全部内置工具,只暴露自定义业务工具,并做沙箱。 - 依赖成熟度:Earendil 较新,把产品核心交互绑上去有第三方风险。好在能接 Claude,LLM 层不锁定;真不行可退回自己用 Anthropic SDK 撸编辑循环。
待定决策
编辑循环实现方式:
- A) 用 Pi:省事,白送打断/分支/压缩。
- B) 用 Anthropic SDK 自撸:少一个第三方依赖,需自己实现打断/分支。
倾向建议:一期先用 Anthropic SDK 把编辑循环跑通(简单版),Pi 作为二期需要 undo/多方案分支时的增强再引入,避免一上来被新框架卡住。(未最终拍板)
7. 已确认决策 / 待办
已确认
- 抓取方式:浏览器插件(先支持 1688)。
- 一期 MVP:文案为主链路。
- 图片文字翻译:A/B 两条路线都接,预览页挑选。
待用户提供(不阻塞脚手架)
- Ozon Seller API 的 Client-Id / Api-Key(沙箱或正式)——用于步骤 5。
- 富文本模板(哪怕草稿版)——用于步骤 3 占位符设计。
- 图像编辑模型偏好(无偏好则做成可插拔,A 路线先用开源 OCR 跑通)。
待决策
- 编辑循环:用 Pi(A)还是 Anthropic SDK 自撸(B)。