批量译图总返工怎么办?AI译图与指令写法

批量译图总返工怎么办?返工原因与指令写法。

2026-10-07 14:42

用完批量译图之后总返工,是很多人都会遇到的一件事。第一天觉得很顺,第二批就开始出问题:有的图版式被改动了、有的图字体变了、有的图文字位置偏了、还有的图干脆连产品都动了。改完这批,下批又出新毛病。忙一圈下来,感觉不是在做图,是在修图。

大多数人会把返工归因到"模型不稳定"上。这个解释听着合理,但解决不了问题——你没法控制模型,只能控制你给它的输入。真正把返工率压下来的人,都做了同一件事:把注意力从"再生成一次试试"转到"我的指令到底说清楚了没有"。

批量译图的指令不是提示词的玄学,它本质上是一句工作交代。你交代得越含糊,AI 的自由度就越大,改出来的东西就越可能超出你的预期。这篇要讲的,是让指令变清楚的三要素,以及为什么一批图只写一条指令,反而比每张图单独写更稳。

先摆一个观点:返工率的下降不是靠反复试出来的。同一条含糊的指令试十次,只会得到十种含糊的结果,你从中挑一个看着顺眼的,下一批还会重演。真正让返工变少的路径只有一条——把需求侧的模糊逐条消掉。这个过程有点像给外包美工下单:你不会只说"帮我把图改成英文",你会说清改哪几个字、用什么字体、版面别动。跟批量译图打交道,用的是同一套沟通逻辑。

还有一个前置提醒:返工分两类,值得区分对待。一类是"内容错",比如数字被改、术语译错,这类必须改,不能将就;另一类是"呈现不符预期",比如字体变了、间距变了,这类要看你们对版面的要求有多严。要求严的店铺,这两类都要卡;要求相对宽松的,第二类可以适当放宽。先分清自己属于哪一类,后面的做法才有统一标准。

一位电商运营者坐在电脑前,屏幕上显示着批量图片处理界面与输入框,人物右手托腮作思考状,左侧墙上贴着几张修改过的商品图样稿,桌面有笔记本和一杯水,暖色调台灯照明,写实摄影风格

图1:反复返工的现场——问题往往不在图,在那句没写清楚的指令上。

一、返工率高,根子在输入而不是输出

先把批量译图的机制说清楚。青虎AI【批量译图】是图像生成模块旗下的图片批量文字翻译工具,核心逻辑是"一次上传多张商品参考图、给一句翻译指令,同步把图内所有中文替换成指定外文",它会自动匹配原图字体、排版和画面光影,完整保留产品主体与构图。翻译指令的默认写法是"将图片中的文字翻译为:英语",目标语种可以改成日语、韩语、西班牙语、俄语等。

注意这里的关键词:一句指令。批量译图的设计就是让一句话作用于整批图,而不是每张图单独调。这种设计带来的效率是巨大的,但也意味着——如果那句话本身没写清楚,整批图会一起出问题。返工不是随机的,它是决策不明确带来的必然结果。

把返工场景梳理一下,会发现绝大多数集中在几类。有的图版式被重排了,本来居中留白的文字变成了贴边;有的图字体换了,原图里那种偏细的字变成了规整但不好看的系统字;有的图产品主体的位置被挪了一点,虽然产品还在,但构图变了;还有的图文字位置整体偏移,跟旁边的图形元素错位了。这几类问题的共同点是:它们都不是"翻译错了",而是"翻译之外的事情被动了"。

为什么会被动?因为你的指令只说了"翻译成什么语言",没说"哪些必须保留"。AI 拿到一个只说了一半的要求,只能自己补齐另一半。它的补齐逻辑和你的预期不一定一致,于是返工就产生了。

还有一种返工是被"顺带优化"带出来的。有些模型在替换文字时会顺手做一点它认为的改善——把你觉得有点挤的字间距调开、把偏小的字号统一、把不太规整的对齐调正。单看每一处改动都合理,合起来就把原图的版式感觉改掉了。版式是设计的一部分,改了版式等于改了这张图的表达,这就是为什么"只做翻译"这个约束必须写清楚。

再有就是文字块识别不完整带来的返工。原图的文字如果压在复杂背景上、或者字号很小、或者排成弧形,识别准确率会下降,可能出现"一部分翻了、一部分没翻"的情况。这一类的解法不在指令上,而在于换更清晰、主体更突出的参考图,或者把这张图单独拿出来处理。分清"指令问题"和"素材问题",是减少无效返工的关键一步。

返工的本质是一次信息补差

你没说清的,AI 替你做了决定;你不同意它替你做的决定,就得重来一次。把决定权收回到自己手里,返工空间自然就被压缩了。

二、指令三要素:翻什么、译成什么、保留什么

把指令写清楚,其实就是把三件事说明白。这三件事缺一件,AI 就会自己去补,补出来的结果就可能不是你要的。

第一要素是"翻什么"。要明确的是范围:画面里哪些文字要翻。默认情况下,指令指向的是"图片中的文字",也就是画面里全部中文。但如果你的图里有不该翻的内容——比如产品包装上原有的外文、比如你希望保持的某些符号——就要在指令里把范围收紧。范围说得越具体,误伤越少。

第二要素是"译成什么语言"。这一点默认指令已经给了模板,把"英语"改成目标语种即可。听起来简单,但这里有个容易忽略的点:语种的表达要准确。要写清楚是哪种语言,不要写含糊的表述。日语、韩语、西班牙语、俄语这些在默认指令的框架里都可以直接替换。

第三要素是"保留什么"。这是三要素里最容易被漏掉、也最影响返工率的一条。要明确保留的东西包括:产品主体和它的位置、画面构图、背景、版式布局、字体风格、光影效果。这些内容如果不在指令里说清楚是"要保留"的,AI 在做替换时可能会连带调整——它可能觉得换个字体更好看,或者觉得文字挪个位置更协调。它不是在犯错,是在做你没禁止它做的事。

要素要说明的内容漏写会怎样推荐写法要点
翻什么画面中哪些文字需要翻译可能漏翻或多翻明确指向图内中文文字
译成什么目标语种语种不符,整批报废直接写清具体语种
保留什么产品、构图、背景、版式、字体、光影版式被改、字体被换、主体被挪逐项写明需要保持不动

三要素凑齐,指令就从"一句话请求"变成了"一份工作单"。这个区别在单张图上感受不明显,在批量上差别巨大——单张出问题你改一张,批量出问题你改一批。

写第三要素的时候有个实用习惯:逐项列,不合并。不要写"保留原图",而是分条写成产品主体保持不动、画面构图不变、背景不变、版式布局不变、字体风格一致、光影效果保持。逐项列的好处不只是约束更明确,还在于出问题时能一眼看出是哪一项失守,方便下一批针对性补强。这份保留项清单是可以复用的,写一次,后面每个批次都能用。

三要素之外,还有一个不是必写但常常有用的补充:说明这批图的用途或渠道。比如写明是用于海外独立站的主图。这不直接改变替换逻辑,但能帮你在心里校准预期——主图和详情图对文字的清晰度要求不一样,主图讲究第一眼就看明白,文字太少反而不好。

左右两栏并列的版面对照图,左栏是一张结构混乱、文字挤压错位的商品图,右栏是同一张图结构整齐、文字位置规整的版本,两栏之间用竖线分隔,浅色背景,扁平化信息图风格

图2:左边是没说清保留项的结果,右边是把三要素写全之后的样子。

三、为什么一批只写一条指令更稳

有人会想:既然每张图的文字内容不一样,那我给每张图单独写一条更贴合的指令,是不是效果更好?这个想法听起来合理,实操里却经常把返工率推高。

原因在于一致性。批量译图是同步处理,一批图的产出会自然形成一套统一的视觉语言——同样的字体处理方式、同样的字距行距逻辑、同样的版面留白习惯。这种统一是批量优势的核心。如果一批图里有五条不同的指令,等于五次不同的处理逻辑,出来的五组图放在一起,风格就会打架:有的字距松,有的字距紧;有的字重,有的字轻。最后你还得再做一遍统一,白白多出一轮。

还有个更实际的问题:指令越多,出错面越大。十条指令里有一条写得不严谨,就会污染这一批里对应的那些图。一条指令,你只需要把它写对一次;十条指令,你要保证十条都对。哪个更容易,不用算。

那什么情况下才需要拆指令?答案是当目标语言不同的时候。一批英语、一批日语,那是两条指令、两个批次,这是合理的切分。但如果目标语言相同、只是图的内容不同,那么就写一条。内容差异不需要在指令里体现,因为批量译图处理的是"把中文换成外文",它不关心你卖的是什么产品。

还有一种情况值得单独拆批:图里需要保留的内容差别很大。比如一批图带着活动角标,另一批是干净的产品主图。这两类图对"保留什么"的要求不同,混在一起写指令,总有一类会被将就。这时候拆成两个批次分别设置,比硬塞在一个批次里要稳。

反过来说,如果两批图只是拍摄角度不同、背景不同、产品不同,但都只是"把中文换成外文"这一件事,那就没必要拆。判断标准始终是同一句话:需要 AI 做的事有没有变化。变化了就拆,没变化就不拆。

指令拆分的唯一理由

目标语言不同,或者需要保留的内容有明显差异,才拆指令。仅仅因为"图不一样"就拆指令,是在给自己增加出错面。

四、青虎AI【批量译图】的能力边界

把指令写好之前,得先清楚这把"刀"能切什么、切不到什么。青虎AI【批量译图】处理的是静态图片内的文字,把图内中文替换成指定外文。它保留产品主体与画面构图,自动匹配原图字体、排版和光影。它不处理视频——视频的语音、字幕、对口型是另一套能力。

它也不是"批量改图"。批量改图是同一套规则改多张图的画面内容,比如换背景、换颜色、去水印;批量译图只管文字,专做中文到外文的替换,其它一切保留不动。这两者的区别在写指令时特别重要——如果你的诉求是"顺便把背景也换一下",那不是指令能解决的,得走别的功能。

它也和详情图编辑模式不同。编辑模式是精细化调整某一张图,适合反复打磨、逐处修改;批量译图是一批图同步换语言,适合量大、改动规则的活。想清楚你这批活属于哪一类,是选对工具的前提。

参数上还有几条边界要在写指令前知道:单次最多上传 10 张参考原图,图多就分批;源语言固定为简体中文,识别的是原图里的中文文字;生成模型默认图片 5.0 Lite;数量默认 1;常用场景和模特不选则保持原图构图,选了会套用场景模板。这几条决定了你的批怎么切、指令怎么写——尤其是"不选常用场景则保持原图构图"这一条,正好就是"保留什么"的另一种表达方式。

其中"源语言固定简体中文"这一条值得多想一层。它意味着你的原图必须是带中文的图。如果原图里混着大量英文,那这些英文不在处理范围内,译图后可能出现中英夹杂的效果。从事跨境很久的店铺,素材堆里往往有各种来源的图,上传前先扫一眼,把那些本身就以外文为主的图挑出来,能少掉一批不必要的返工。

"单次最多 10 张"这条上限也直接关系到返工。批次越大,一次失败的代价越高。把批次切小一点,某个批次出问题的返工量就小一点。追求一次跑完不一定是效率最高,稳稳地跑完才是。宁可多跑两个批次,也别让一个大批次出问题后全部推倒。

不选场景本身就等于保留构图

想让产出严格贴合原图,在参数区就不要选常用场景和模特。这比在指令里反复强调保留,更直接也更不容易出错。

理解了边界,"返工"这件事的范围就清晰了:能通过指令解决的问题,是指令的事;解决不了的,是工具选错了。把这两类分开看,就不会一直在同一个坑里打转。

举个具体的例子。有人抱怨颜色不准,希望译图后能把画面主色调整成品牌色。这不是指令能解决的,因为批量译图只管文字,不管画面内容。这类需求要么用批量改图去做,要么单独精修。反过来,有人抱怨文字位置偏了一点,这大概率是保留项没写清楚,补一句"文字位置与原文保持一致"就能改善。分清问题归属,是避免无效返工的关键。

所以遇到返工时先别急着改指令。问自己一个问题:这个问题的性质是"该做的没做到",还是"不该做的被做了"?前者多半是指令范围写窄了,后者多半是保留项写漏了。这两种情况对应两种改法,混着改往往越改越乱。

五、写指令前要准备好的三样东西

指令是在弹窗里敲进去的,但写指令的功夫在弹窗之外。准备工作没做好,指令就只能现场发挥,发挥出来的大概率是含糊的。

一份定稿的中文文案

图上的中文内容必须是终版。边译边改文案,等于每条返工都要重新走一遍流程,这是最常见也最冤的返工来源。

一张术语对照表

把品类名、卖点词、材质词、功效词各语种的写法提前定好。指令本身不写术语,但术语表决定了你翻译的目标方向。

一份保留项清单

明确这批图哪些必须一点不动:产品位置、背景、版式、字体、光影。清单越具体,指令里的保留要求就写得越准。

这三样里,最容易被跳过的是保留项清单。大多数人默认"保留"是不需要说的,因为那是常识。但在写指令这件事上,常识需要被显性化——你没写出来的要求,不构成约束。

还有一件可以顺手做的准备:先挑两三张最有代表性的图跑一批试水。挑的原则是选文字最多、字体最特殊、排版最复杂的那几张。如果这最难的一关过去了,剩下的图大概率也没问题;如果这几张还要返工,那说明指令里还有没说清的地方,正好在试水阶段就发现。

试水还有一层价值:它能帮你确认语种译法。有些词在目标语言里有多种说法,试水之后你就知道 AI 默认会选哪一种,需要纠正的就在指令或后续核对阶段处理。这个信息如果等到全量生成后才发现,成本就高多了。

六、从写指令到出图的完整步骤

准备工作就绪后,操作流程本身并不复杂。两个入口效果一致:一个是登录青虎AI 工作台后走左侧【创作】-【AI图像生成】-【批量译图】;另一个是在 LinkPix 首页走【图像生成】-【批量译图】,或者【图像生成】-【常用场景】-【批量译图】。点进去弹出独立操作弹窗,分原图区、产品图区、批量设置、参数设置四大模块。

横向排布的五段操作流程示意图,从左到右依次为成叠的图片文件图标、带文字输入框的对话框图标、齿轮参数图标、成排图片生成图标、向下箭头下载图标,环节之间用细箭头相连,扁平化视觉风格

图3:返工的多少,基本在第二步写指令的时候就定下来了。

步骤一:上传参考图

在原图区批量选中本批图片。单次最多 10 张,超了就分批。图越清晰、主体越突出,译图效果越稳。

步骤二:写指令三要素

在批量设置里写清三件事:翻什么(图内中文文字)、译成什么(目标语种)、保留什么(产品主体、构图、背景、版式、字体、光影)。一批只写一条。

步骤三:核对参数

生成模型默认图片 5.0 Lite;源语言固定简体中文;数量默认 1;想让产出严格贴合原图,就不要选常用场景和模特。

步骤四:点生成

确认无误后点击生成按钮,AI 按同一条指令同步处理本批所有图片,保留产品、背景、版式,替换画面内中文。

步骤五:下载并用返工记录反查指令

生成完成后批量下载。对照原图检查,把出现的问题归类,然后回头判断是哪一要素没写清楚。下一批改正,返工就会明显变少。

第五步是这篇的重点。很多人下载完就把返工当成"运气不好"处理,直接再生成一次。更有效的做法是把返工样本变成反馈:这次字体被换了,说明保留项里没写字体;这次版式被改了,说明没写版式保留。把每一次返工对应到三要素里的某一项,下一批的指令就比上一批更严密。返工率是这么一轮一轮降下来的。

这里要强调一个心态上的转变:返工不是失败,是信息。它准确地告诉你,你的指令在哪一项上留了缺口。把返工样本收集起来看,比零星地"这次怎么又不行"要有价值得多。真正把批量译图用顺的团队,手里都攒着一份从返工里总结出来的指令模板。

顺便说一个操作上的小习惯:每次生成前,把指令文本复制到一份本地文档里存档,按批次和语种命名。这样后面出现疑问时可以回溯——上一批英语版是怎么写的、日语版多了哪一句。指令也可以被复用和迭代,存档就是从零开始和站在过去经验上写的区别。

返工现象指向的要素缺口指令里补什么参数区配合是否需重跑整批
字体变了保留什么写明保留原字体风格不选场景模板否,单张重做
版式重排保留什么写明保持原版式布局不选场景模板否,单张重做
产品位置移动保留什么写明产品主体位置不动不选场景否,单张重做
部分文字没翻翻什么把范围写得更明确换更清晰原图视数量而定
语种不对译成什么复核目标语种写法无需调整是,整批重跑

七、返工台账:把每一次返工变成一条规则

降低返工率最有效的办法,是建一份返工台账。听起来有点重,做起来其实很轻:一张表,记录批次号、语种、返工张数、问题类型、指向的指令缺口。三批之后,你就能看出自己的指令经常在哪一项上失守。

比如连续几批都是"字体被换",那说明你的保留项里关于字体的表述还不够明确,需要调整措辞;如果问题集中在"部分文字没翻",那说明原图的清晰度或文字密度是瓶颈,指令再怎么改也解决不了,得从素材入手。台账的价值就在于告诉你——问题到底出在指令上,还是出在别的地方。

台账还有一层用处:它能帮你算出成本。返工张数乘以单张处理时间,再加上你重新核对的精力,这就是返工的实际代价。这笔账算出来,你会更愿意在写指令那一步多花三分钟。前期的严谨是最便宜的投入。

回到行业口径上看一眼就明白这笔账为什么值得算。详情页外包的报价在套版 100 到 300 元、半原创 500 到 1500 元、品牌原创 1500 元以上这几个区间;一个中等规模店铺每月花在图片二次处理上的人时大约在 20 到 40 小时。这个时间里若有三分之一消耗在返工和重复核对上,那就是把最贵的时间用在了最不该用的地方。

台账还有一个用法是横向比对。同样是返工,不同语种的返工分布往往不一样——某个语种的图特别容易出溢出问题,某个语种的图字体特别容易变。这类横向差异能告诉你哪个语种需要更严的指令,哪个语种可以放心批量走。把资源按风险分配,而不是平均用力。

台账做久了还能反映一个团队的真实状态。返工率突然升高,可能是新素材的质量下降了,也可能是新人上手时的正常波动。看到数据变化先别急着改流程,先把原因找出来。流程本身没问题,问题在输入的时候,改流程是白费功夫。

八、四个常见误区

误区一:只写"翻译成英文",不提保留

这是返工的头号原因。只说译成什么语言,等于把"要不要保版式、要不要保字体"的决定权交给了 AI,结果自然不可控。

误区二:一批图写好几条指令

多指令会让整批风格不统一,也多出好几倍的出错面。目标语言相同时,一批就写一条。要拆的是批次,不是指令。

误区三:返工就重新生成,不做归因

不归因的返工是随机消耗。把每次返工对应到三要素里的某一项,下一批才能真的变好。否则同样的坑会一直踩。

误区四:文案没定就先进批量流程

文案一改,所有语种全部作废。批量译图的前提是中文内容已经终版,边译边改文案是最贵的返工方式。

九、四个提效技巧

技巧一:把三要素写成一段固定模板

把"翻什么、译成什么、保留什么"整理成一段可以直接改语种复用的文字,每次生成前粘进去、改语种。省去每次重新组织语言的功夫,也保证了严密性。

技巧二:保留项里永远别只写"保留原图"

"保留原图"太笼统。写成产品主体不动、构图不动、背景不动、版式不动、字体风格不动、光影不动,逐项列出来,约束力完全不一样。

技巧三:用最难的三张图试水

文字最多、字体最特殊、排版最复杂的三张先跑一批。难的过了,简单的自然不在话下;难的就返工,正好在低成本阶段发现指令缺口。

技巧四:语种逐批推进,每批只改一个变量

英语批稳定之后再做日语批,一次只引入一个新变量。同时换语种、换素材、换指令,出了问题根本不知道是哪一项导致的。

十、三个可以照做的场景

场景一:同系列多款产品的首批出海

一组同系列产品图要做英语版,最合适的就是一个批次、一条指令。把保留项写全,参数区不选场景模板,让产出严格贴合原图。这一批跑顺了,后面所有批次都有了可复用的指令模板。

场景二:活动海报批量补语种

活动图有活动角标、有折扣信息,属于容错要求最高的类型。写指令时除了三要素,还要单独确认角标区域的文字是否完整替换。建议这类图第一批只做一半,确认无误后再做另一半。

场景三:返工率居高不下时的流程重排

如果连续几批返工都多,不要继续硬跑。停下来做一次完整复盘:把最近三批的返工样本摆一起,逐张标注问题类型,看它们集中在哪个要素上。往往调整一处措辞,后面的返工就直接减半。

三个场景的做法殊途同归:把变量管住。批次里只留一个变量,指令里三要素写全,参数区不引入额外的不确定性,返工就失去了空间。

再补一个判断视角:把返工率当成衡量流程好坏的指标之一。不是看谁做得快,而是看同一个流程下谁的返工少。返工少通常意味着指令写得清楚、素材挑得仔细、批次分得合理。这种视角会把注意力引向真正决定效率的地方,而不是单纯比手速。

两位工作人员站在办公桌前对照屏幕上的图片成品讨论,桌面上放着一份打印的指令模板与一支笔,其中一人手指屏幕某处,另一人低头在纸上记录,办公室环境整洁,明亮自然光,写实摄影风格

图4:把关口前移到指令环节,会比在成品上反复返工省力得多。

十一、总结

总结:返工不是模型不听话,是那句话没说全

批量译图总返工,根因多在指令写法上。指令要回答三个问题:翻什么、译成什么语言、保留什么。前两项决定了译得对不对,第三项决定了除翻译之外的画面有没有被顺手改动——而返工里的大多数,恰恰是第三项没说清造成的。产品主体、构图、背景、版式、字体风格、光影,这些都要显式写成"保持不变",没写出来的要求不构成约束。至于条数,一批只写一条,目标语言相同就不要拆;要拆的是批次,不是指令。参数区也要配合:不选常用场景和模特,产出就会保持原图构图。用青虎AI【批量译图】时记住单次最多 10 张、图多分批、生成不覆盖原图,把每一次返工都归因到三要素里的某一项,返工率会一轮一轮降下来。

十二、常见问题解答

问:指令写多长比较合适?

答:够用就好,关键是三要素齐全。翻什么、译成什么、保留什么写清楚即可,不用堆砌修饰词。写得长不等于写得清楚。

问:为什么我写了"保留原图",版式还是变了?

答:"保留原图"太笼统。把保留项拆开逐条写——产品位置、构图、背景、版式、字体、光影分别写明不动,约束力会强很多。

问:一批里图的内容差别很大,能写一条指令吗?

答:可以。批量译图处理的是把中文换成外文,不关心产品是什么。只要目标语言相同、需要保留的内容一致,一批写一条就够了。

问:什么时候必须拆成两批?

答:目标语言不同时必须拆。比如英语一批、日语一批。或者需要保留的内容有明显差异,比如有的图带活动角标有的不带,也可以分开处理。

问:字体被换了算不算严重问题?

答:不影响信息正确,但直接影响专业度,属于必须处理的问题。解法是在指令的保留项里明确写字体风格保持一致,参数区不选场景模板。

问:产品位置被挪了怎么办?

答:这属于保留项没写到位。指令里补上产品主体位置保持不动,并且参数区不选常用场景和模特,产出就会保持原图构图。

问:目标语种该写在哪里?

答:就写在翻译指令里。默认是"将图片中的文字翻译为:英语",把语言部分换成需要的语种即可,输入框格式不用改。

问:源语言能改成别的吗?

答:源语言固定为简体中文,识别的是原图内的中文文字。这一点写指令时不用管,也改不了。

问:常用场景和模特要不要选?

答:想让产出严格贴合原图就不要选,不选择则保持原图构图。选了会套用对应的电商场景模板,画面会带上模板风格。

问:生成会覆盖原图吗?

答:不会覆盖原图,结果单独产出、可以批量下载。原图留着,既方便对照检查,也方便随时重做。

问:单次能上传多少张?

答:单次最多 10 张参考原图,图多就分批。批次切分要和指令设计一起考虑,别让一个批次跨了两种需求。

问:返工的单张要不要整批重跑?

答:一般不需要。出错的是个别图就单独重做。只有当批次划分本身有问题,或者目标语种写错了,才需要整批重跑。

问:这跟批量改图有什么区别?

答:批量改图是同一套规则改多张图的画面内容,比如换背景、换色、去水印;批量译图只管文字,做中文到外文的替换,其它保持不动。

问:文案还在改,能先跑一批吗?

答:不建议。文案一改,之前译的所有语种都要重来。等中文内容定稿再进批量流程,这是最省返工的顺序。