夜雨聆风学习资料网

ARTICLE · 1148577

AI 做图,改起来也得顺手:豆包这次选对了方向

AI 做图,改起来也得顺手:豆包这次选对了方向

用 AI 做图时,可能会遇到这样的情况:一张图整体已经挺满意,只想把标题缩小一点,把产品往右挪一点。

这时候,如果能直接选中要改的地方,再告诉它怎么调整,操作就会直观很多。如果每个小修改都得靠一长段文字来回沟通,再强的模型也很难用顺手。

豆包工作这次上新的画布,就很适合承接这样的创作过程。素材、方案和成果可以摆在一起,方便对比,也能继续调整文字、配色和布局。

我觉得这个方向选对了。图片和视频创作都需要反复比较、边看边改,画布的操作方式很适合这些任务,也能让豆包自家的模型优势更容易发挥出来。

如果豆包把图片和视频创作当成主战场,继续降低普通人的使用门槛,我非常看好这条路。

豆包画布:多版 Logo、产品应用图和门店视觉放在同一张画布上。图片来源:羊城晚报报道,新浪转载。

自己最有优势的能力,值得做得更深

现在的 AI 工作产品,功能越来越接近。做文档、做表格、做 PPT、做调研、生成网页,大家都在补。

这些功能当然有价值,但如果产品介绍都是同一张清单,用户就很难判断:这件事到底该交给谁做?

我更愿意看到一家产品把自己的优势做透,让用户遇到某类任务时,很自然地想起它。

豆包有这样的条件。字节自己的 Seedream 图片模型、Seedance 视频模型,已经提供了值得继续往产品里深挖的能力。

比如,Seedream 5.0 Pro 的官方介绍,重点讲了复杂图文排版、局部交互编辑、图层分离和多图融合;Seedance 2.5 的介绍,则强调多模态参考、连续叙事和音视频编辑。这些能力很适合往反复修改、连续创作的方向发展。

这里说的是字节已有的模型能力,具体到豆包工作,仍要以产品里实际开放的功能为准。

有这样的基础,豆包完全值得把图片和视频创作当成重点。让模型持续进步,同时把用户完成创作的过程做顺,两件事可以互相支撑。

毕竟,普通用户用一个产品,最终要看自己能不能拿到满意的成果。模型再强,如果每次都要研究半天怎么描述、怎么修改、怎么接下一步,这个优势就很难充分发挥出来。

画布很适合创作时的「边看边改」

做图片、做视频,很多时候都是一边看到结果,一边才知道自己还想改什么。

你可能说不清自己想要哪种风格,但看到三个方案,就知道第二个更接近自己的想法。你也可能已经满意整张图,只想把标题缩小一点,把产品往右挪一点。

这些需求,用纯文字讲起来很费劲。

如果素材和结果都在聊天记录里,你还得翻回去找参考图,说明自己指的是哪一版,再描述要改的是哪个位置。创作一复杂,对话就会越来越长。

画布适合承接的,正是这类过程。

这次更新把素材、设计方案和创作成果集中到同一张无限画布上,可以随时查看、对比和整理。生成之后,还能继续调整文字、配色和布局。

我觉得这里有三处很有价值。

第一,方案能放在一起看。

三个版本并排摆着,构图、颜色、信息层级的差别更容易看出来。参考图也可以留在旁边,随时对照。

豆包画布:三个 Logo 方向并排展示,方便比较和选择。图片来源:羊城晚报报道,新浪转载。

这会降低表达需求的难度。你可以先选一个接近的方向,再往下改,不必在生成之前就把所有细节描述清楚。

第二,修改可以直接落到具体位置。

公开报道提到,画布支持标记、涂抹,以及分图层、抠图、消除、扩图等操作。用户可以圈定要修改的区域,也可以对具体素材继续下达指令。

豆包画布:圈定图片区域,再输入局部修改要求。图片来源:羊城晚报报道,新浪转载。

能指着一个地方说「把这里改掉」,沟通就会直观很多。对普通用户来说,这种操作也更接近自己的习惯。

当然,能选中位置只是开始,模型还得改得准确。如果改标题时把产品也改了,用户依然要返工。画布给出了更好的交互入口,编辑稳定性还需要持续打磨。

第三,图片和视频可以接着做。

公开介绍里,「创意设计」「创意视频」任务的图片、视频和 HTML 成果可以汇入同一画布,也能通过「创建画布」从空白开始。

假设你要给一款产品做宣传,就可以围绕这样的过程来理解它:放入产品图和风格参考,比较几版主视觉,选定方向,再把图片延展成视频素材。

这只是一个说明用的场景,但它能解释画布为什么适合视觉创作。前一步的成果可以成为下一步的参考,相关素材一直摆在眼前,用户更容易保持创作思路。

视频制作还有镜头节奏、声音、剪辑等要求,画布也需要和这些编辑能力配合。但作为组织素材、比较方案和推进创作的工作空间,我觉得它很合适。

WorkBuddy 和千问,也有各自值得深挖的方向

把豆包放到同类产品里看,这个选择会更清楚。

腾讯 WorkBuddy 的官方文档强调自主规划和执行、本地文件处理,以及文档、表格、PPT 等成果交付;企业版还介绍了与腾讯文档的搜索、引用和回写连接。

沿着这些能力看,我更看好它把电脑里的文件处理、多步骤任务执行和腾讯办公生态连接做深。文件就在电脑里,资料已经在办公系统里,能直接接上这些东西,就有使用价值。

千问办公的官方资料,则强调工作上下文、多格式交付、云端定时任务、网页开发和浏览器自动化;国内产品介绍也突出钉钉生态的连接。

我更看好它围绕企业协作,把消息、文档、业务资料和任务接起来。工作信息能够连贯使用,才更容易把一个任务从头做到尾。

这些是我对优势方向的判断,三家的能力也有重叠。WorkBuddy 和千问同样可以做创意内容,豆包也在补办公和执行能力。

但产品仍然需要一个足够清楚的重点。对豆包来说,图片和视频创作就是一个很值得做深的方向。

市场空间,要靠降低门槛兑现

我看好这个方向,还有一个原因:需要视觉内容的人,远远不限于专业设计师和视频创作者。

小商家要做活动海报,电商运营要做产品素材,讲师要做课程配图,内容创作者要做封面和短视频。他们有具体需求,也愿意判断结果好不好,只是不一定掌握完整的设计和视频制作方法。

如果豆包能让这些人更容易完成创作,就有很好的市场机会。

但降低门槛,还得落实到整个使用过程。

入口要让人看得懂。用户说「我要给新品做一套宣传素材」,产品就能帮他组织参考、方案和产出,而不必先学一套模型名、技能名和参数。

修改要尽量可控。已经满意的部分能保留下来,小地方改错了可以退回,旧版本也能找得到。用户敢于继续试,创作才会往前走。

成本也要容易理解。图片和视频往往需要多次尝试,用户要知道试一轮大概会消耗多少,生成失败或不满意后还有多少调整空间。试错成本过高,再直观的画布也会让人犹豫。

最后,成果还得方便拿出去用。尺寸、清晰度、可编辑程度和导出方式,都影响这张图、这段视频能不能进入后续工作。

专业创作里的审美、叙事和细节把关依然有价值。豆包可以先把大量日常需求做顺,让更多有想法的人能够开始、能够修改,也能够完成。

我希望豆包沿着这个方向继续做。把自己最值得发挥的图片和视频能力,放进一个普通人也能用好的创作工具里,这个主战场选得很对。

相关学习资料