SenseNova-U1 Infographic V2:50.3 分的评测范围与信息图边界
把信息图拆成文字、版式和语义三条质量轴,解释 MoT 路由、BizGenEval hard 对照和生成后的 OCR/事实核验。

专项模型 / 信息图生成
信息图不是普通文生图加几行字。模型必须同时处理语义规划、版式层级、图标—文字对应和可读字符渲染。SenseNova-U1-8B-MoT-Infographic-V2 已发布完整权重,并在 BizGenEval hard split 报告 50.3;这个数字只支持信息图专项比较,不代表通用文生图质量。
OCR 辅助生成、文档布局模型和统一多模态 Transformer 逐步把字符、版式与图像放进同一问题。SenseNova-U1 用 MoT 在文字、图标、空间层级和关系箭头之间分配容量,BizGenEval 则只测量这条专项路线中的一部分能力。

1. 文字生成的旧难题:图像模型为何长期只会画“像字的纹理”
GAN 与早期扩散模型主要从自然图像分布学习外观,文字在训练集中既稀疏又经常被裁切、压缩或水印化。模型能够复制招牌的局部节奏,却缺少字符序列与字形之间的稳定绑定。OCR 引导、合成文本数据和字符级标注后来提高了可读性,但它们仍未解决段落层级、图例绑定和跨区域阅读顺序。
信息图把这些问题集中到同一画布:标题需要控制注意力,数字必须与对应图标或图表相连,箭头表达因果或流程,颜色图例还要在远距离位置保持一致。文档理解模型提供布局与阅读顺序经验,图像生成模型提供视觉风格,两条研究线由此开始汇合。

2. 从统一 Transformer 到模态专属专家
统一多模态模型把文本、图像乃至布局 token 放进共同注意力空间,优势是关系可以跨模态传播,难点是不同 token 的统计规律差异很大。汉字需要精确局部笔画,图像块表达连续纹理,布局关系又更接近离散坐标;完全共享参数会让它们争夺同一表示容量。
Mixture-of-Transformers 让不同模态拥有专属变换路径,同时通过注意力交换信息。SenseNova-U1 的信息图能力应从这种异质 token 分工理解。50.3 的 BizGenEval 结果属于商业视觉评测,不等同于通用图像偏好、纯 OCR 准确率或可编辑矢量文档质量;每一种证据仍需保留原协议。
3. 信息图评测:OCR、关系正确与视觉质量不能互相代替
OCR 可以逐字检查标题、数字和标点,却不知道一个百分比是否连到正确图例。视觉语言模型能够回答图中关系,又可能依赖自身语言先验纠正或猜测模糊文字。人工评审读得懂整体含义,审美偏好、语言背景和屏幕尺寸仍会影响评分。
BizGenEval 将商业视觉放进更接近海报和信息图的任务,意义在于评估对象更专门。50.3 仍与数据版本、提示集、评分器和输出尺寸绑定,不能和另一套 OCR 或图像偏好分直接相加。模型在此处领先,也不推出摄影、人像或自由艺术生成的普遍优势。
高分辨率给小字更多像素,也让空间 token 和远距离关系增加。标题、数据、图标和图例相隔很远时,局部字形清晰不保证跨区域绑定正确。长画布还会放大分区重复、对齐漂移和颜色图例复用。
进入出版流程后,栅格结果通常需要重建为 SVG、HTML 或设计软件对象。数字回到数据源,文字回到可编辑文本层,箭头和图表回到结构化关系。生成模型缩短构图探索,确定性排版负责最终事实与可维护性。
4. MoT 怎样同时容纳字符、布局与视觉 token
普通文生图可以用相似纹理表达“城市夜景”,信息图却要把一组离散事实放进稳定的阅读顺序。标题、数字、图标、箭头和分区一旦错位,画面即使漂亮也会传递错误关系。模型面对的对象由连续视觉外观变成了半结构化文档,文字正确率、空间布局和语义关系需要在同一次生成里成立。
这也解释了专用训练数据的重要性。网页截图、海报与演示文稿提供大量布局样式,但其中的文字经常很小,逻辑关系也未必显式标注。高质量样本需要同时描述内容、层级、位置与视觉风格,才能让模型学到“哪个数字属于哪条结论”,而不只是学会画出像信息图的背景。
Mixture-of-Transformers 怎样分配异质 token
SenseNova-U1 采用 Mixture-of-Transformers 思路处理文本与视觉 token。这里的 mixture 重点在不同模态可以拥有不同参数路径,同时在注意力层交换信息。文本 token 要保住词序和字符边界,图像 token 要表达形状、颜色与空间邻接;若完全共享同一套变换,二者会争夺有限的表示容量。
设第 l 层的文本与图像状态为 h_l^T、h_l^I,可把一次更新概括为 h_{l+1}^m=h_l^m+F_l^m(Attn(h_l^T,h_l^I))。注意力建立跨模态联系,模态专属的 F_l^m 再处理各自统计特征。这个写法用于说明结构:视觉分支并没有独自决定排版,文字顺序也会通过共享注意力改变空间布局。
BizGenEval 的 50.3 衡量的是一块窄而难的区域
项目公开的 BizGenEval 面向商业视觉内容,评分协议集中在信息表达、版式和视觉质量。50.3 只有放在该数据集、该版本和相同评审流程里才有意义。它不能与通用图像偏好分、OCR 准确率或另一套海报榜单相加,更不能推导出模型在摄影、人像或自由艺术生成上的总排名。
信息图评估本身仍在发展。自动视觉语言模型可能识别大标题,却漏掉数字与图例之间的错误对应;OCR 能发现字错,无法判断一条箭头是否指向了错误对象;人工评分能读出语义,却受到审美与语言背景影响。一个可信结果往往需要把这些信号并排保留。
文字、关系和画布在高分辨率下共同放大
提高分辨率会增加空间 token,给小字留下更多像素,同时让长距离关系更难维持。标题位于左上角、图例位于右下角时,两者需要跨越大量视觉位置保持一致;局部字形变清楚,并不保证整张图的语义连线正确。长画布还容易出现分区重复、边缘对齐漂移与颜色图例复用。
信息图最终经常要进入印刷、演示或网页。生成的栅格图缺少真正的文本层、矢量路径与可编辑数据绑定,后续修改一个数字时仍可能需要重做整张图。专用生成模型缩短了草图到成稿的距离,但没有取代数据校对和版式工程。
从提示词到成图,中间仍缺文档对象模型
多数图像生成器最终预测栅格潜变量,没有显式的标题框、数据系列、图例绑定或段落对象。模型从像素统计中学会这些视觉模式,却无法像排版引擎一样保证文本不会溢出,也没有数据库约束确保百分比总和为 100%。画面结构是生成出来的外观,而非可查询的文档树。
这使长文本提示成为瓶颈。用户可以描述五个分区、十二个数字和对应图标,模型仍需把自然语言解析为空间计划,再在有限画布上逐项渲染。条件 token 越长,稀有修饰与早期数字越容易在注意力中被稀释,局部清晰度无法弥补遗漏条目。
OCR 后处理能够发现字形错误,视觉语言模型可以复述图中关系,二者都不能直接编辑原像素中的单个字符。可编辑信息图通常还需要把生成结果作为构图草案,再用 HTML、SVG 或设计软件重建文本和数据对象。生成模型负责视觉探索,结构化工具负责最终确定性。
SenseNova-U1 的专用成绩说明统一多模态生成在商业视觉上取得进展,也应保留这一表示边界。模型能生成更像成稿的栅格图,不等于已经成为数据可验证、文字可局部编辑的制图系统。
5. MoT 路由的信息图计算分配
h′=Σ_{e∈TopK(g(h))} p_e(h)·E_e(h)g(h)路由器分数TopK每个 token 激活的专家集合E_e第 e 个专家变换
信息图同时包含自然图像、字符、图标和版式关系。MoT 路由把不同 token 送往少量专家,使总容量增加时不必让每个 token 经过所有专家。
50.3 只在官方 BizGenEval hard 表中成立。发布前仍要用 OCR 核对专名、数字和单位,再人工检查箭头、图例和阅读顺序。
论文、代码与权重可沿 SenseNova-U1 source / Infographic V2 weights and benchmark 查阅。
6. 3 分的有效范围
三行来自同一官方模型卡的 hard split,指标和提示模板一致,因而可以并排;它们不构成通用图像质量总榜。
| 模型 | BizGenEval hard | 页面角色 |
|---|---|---|
| SenseNova-U1 Infographic V2 | 50.3 | 信息图专项模型 |
| Z-Image | 8.2 | 同表通用生成对照 |
| Qwen-Image 2512 | 6.3 | 同表通用生成对照 |
7. 从模型演示到出版文件,信息图还要经过一条校对链
SenseNova-U1 的统一范式把理解与生成放在同一家族中,Infographic-V2 则把权重进一步推向商业图表和复杂版式。仓库与模型卡证明权重可以取得,BizGenEval hard split 的 50.3 说明它在指定专项集合中的位置;两者仍没有证明每种语言、字号和行业模板都达到出版标准。
信息图评测至少包含三层。字符层检查字形、拼写和数字;关系层检查箭头、图例、单位与数据对应;画布层检查层级、留白和视觉重心。OCR 分数可能在文字全部可读时很高,却不发现“增长 12%”被连到错误柱形;视觉偏好分数也可能奖励一张漂亮但数据关系错误的图。
高分辨率会同时放大机会和错误。更多视觉 token 允许模型容纳小字与细线,也让长段文字、密集图标和跨栏关系占用更多注意力。分块生成可缓解显存压力,却可能在块边界打断箭头或重复标题。复现实验因此应记录画布尺寸、长宽比、提示词语言、种子和缩放方式,并在原尺寸而非缩略图上做 OCR 与人工核对。
出版端通常把生成图当作构图提案:文字重新排入可编辑文本框,数值重新连接数据源,图标和箭头转成矢量对象,品牌颜色按规范校准。概率生成负责视觉探索,最终事实、无障碍文本和版本维护仍由结构化文件承担。
结语:生成信息图仍然不是生成文档对象
SenseNova-U1 展示了统一多模态生成在文字和布局上的推进,尤其是让语义、字形与空间结构在一次生成中共同作用。专用数据与模态分工使它跨过普通文生图只会模仿版式的阶段。
最终输出依然是栅格像素,没有真正的文本层、图表数据绑定与矢量对象。事实数字、文字校对和后续编辑仍需结构化工具完成。把这一边界写清楚,信息图模型的进步才不会被夸大成自动排版系统。
专名、数字和单位在生成过程中同时受到字符形状与版式位置约束。一个字符即使可被 OCR 识别,仍可能压住正文、连错箭头或打乱颜色图例,说明信息图生成同时包含文字与关系布局两类问题。
中文长句和混合单位会进一步增加换行组合。模型输出的 PNG 固化了这些选择,难以像矢量排版文件那样逐项修正,因此更接近自动生成的视觉草稿。
判分器不等于读者。罕见人名、长单位、脚注和密集表格仍可能出现似字非字、错误换行或数字替换。
50.3 只对应模型卡列出的 BizGenEval hard 设置。改变画布、提示模板、采样步数或评分器后,所得结果应单独列示,不能继续沿用原表分数。