图映上线:图片、视频、PDF 与 Office 处理留在本地
合同、证件、订单截图、商品原图和尚未发布的设计稿经常需要压缩、转换、识别文字或移除背景。过去用户通常要把文件上传到不同网站再等待服务器处理。文件去了哪里、保留多久却很难从操作页面中判断。DataDance数据跳动推出的 ImgIng 图映尝试改变这一默认路径。它把图片转换与压缩、在线做图、AI 抠图、AI 超分辨率、图片文字识别、动态图制作、视频压缩与抠像、PDF 处理和 Office 文档转换放进浏览器并把“处理发生在哪里”直接作为产品功能的一部分。对于浏览器能够完成的任务文件留在设备中只有少数需要服务器能力的专业格式产品才会在操作前说明。ImgIng 是统一的产品品牌“图映”是中文产品名DataDance数据跳动为产品出品方。产品面向国内用户提供 imging.cn面向海外用户提供 imging.ai。目前用户无需注册即可使用端侧功能导出文件不添加水印。下载模型不等于上传图片“本地处理”并不意味着网页什么都不下载。浏览器要读取 HEIC、生成 AVIF或者运行 AI 抠图和 OCR仍然需要编解码器与模型。图映采用的方式是在用户真正使用相应功能时把 WASM 编解码模块或 AI 模型下载到浏览器再由用户设备完成计算。这与上传原图是两个相反的传输方向模型从网站进入设备图片像素和识别文字不需要离开设备。模型与编解码器完成首次下载后还可以复用浏览器缓存减少重复等待。图映不会只根据浏览器名称和版本判断能力。系统会分别测试输入能否解码、目标格式能否编码、WASM 是否可以加载、WebGPU 或兼容后端能否运行再选择浏览器原生能力、本地模块或服务端路径。界面会显示“即时”“端侧 WASM”或“服务端”等处理标识。一套本地底座覆盖多类视觉任务在静态图片方面图映支持 JPG、PNG、WebP、AVIF、HEIC、GIF 等常见格式并为部分专业格式提供替代路径。压缩时会区分照片、截图、透明素材和少色图片分别处理连续色调、文字边缘与 Alpha 通道。若文件没有变小系统会提示保留原文件或更换格式。新上线的图片 OCR 使用 PP-OCRv6提供极速、专业和极致三档分别对应上游的 tiny、small 与 medium 三档模型。据 PaddleOCR 官方发布数据medium 档相比上一代 PP-OCRv5_server 在检测上提升 4.6%、识别上提升 5.1%。识别工作在独立 Worker 中完成结果保留文字位置、置信度和表格结构可导出 TXT、Markdown 和 JSON也方便粘贴到电子表格。当前支持简繁中文、英文、日文及多种欧洲语言。上游模型标称覆盖 50 种语言图映出于端侧体积与首次下载时长的考虑只打包了其中一部分统一模型暂不包含韩文产品也没有把手写体和公式识别列为可靠能力。AI 抠图同样采用本地模型。图映根据设备和任务提供不同体量的模型优先使用 WebGPU在环境不支持时使用兼容后端。模型生成蒙版后用户仍可通过画笔修复头发、手指和半透明物体等容易误判的区域再更换纯色或图片背景。手机端会限制高内存模型避免用户下载完成后才发现设备无法运行。动态图工具按“帧”处理 GIF、APNG、动图 WebP 和动图 AVIF可读取原始帧时长与循环方式支持排序、删帧、调速和多格式导出。针对动态图常见的残影问题图映只在能够证明安全时保存局部变化透明轮廓发生变化时回退到完整帧避免为了缩小文件破坏播放结果。AI 超分辨率老照片与低清素材的本地重建图映的超分辨率同样在本地运行接入 Real-ESRGAN、SwinIR 与官方 Real-HAT-GAN 三类模型提供 2× 与 4× 放大以及专门的老照片增强模式。大尺寸图片会自动分块处理避免一次性占满设备内存。模型体量与设备能力直接相关因此这里同样走运行时探测能用 WebGPU 就用不能则回落到兼容后端手机端会限制过大的模型。视频压缩四档内容感知画质除抠像外图映也提供视频压缩输入支持 MP4、M4V、MOV、WebM 与 MKV输出可选 MP4H.264 / AAC、WebMVP9 / Opus或 WebMAV1 / Opus。所谓智能码率指的是四档内容感知画质——视觉无损、高画质、均衡与体积优先——系统按画面特征而非固定码率决定压缩强度。静态讲解视频与高速运动素材需要的码率相差很大固定档位要么浪费体积要么损失细节。Office 文档转成可离线打开的只读网页图映把 DOCX 与 PPTX 转成单文件 HTML不依赖脚本即可离线阅读。DOCX 输出保留文字、列表、表格、图片、页眉页脚、脚注与尾注按页分隔PPTX 输出保留文字、图片、形状、表格、图表、SmartArt 与背景但不包含动画与嵌入程序——这两类无法在静态 HTML 中等价重建产品直接说明而不是悄悄丢弃。视频抠像目前仍处于 Beta。它不是把每一帧当作互不相关的图片而是保留时序状态处理镜头切换、背景替换、视频编码和音频封装。实际速度和效果会受设备性能、浏览器、视频长度及素材复杂度影响因此产品建议用户先用短片段验证再处理完整视频。PDF 处理不把整页简单变成图片PDF 既包含图片也可能包含文字、字体、链接和矢量图形。将每一页重新渲染成图片虽然容易实现却会让文字无法选择、链接失效图表放大后也可能变得模糊。图映的 PDF 压缩在浏览器本地解析文档结构计算图片在每个页面上的实际显示尺寸再决定是否需要降低分辨率以及采用何种编码。处理完成后系统会重新读取产物核对页数、页面尺寸、可选择文字和链接等信息若不能证明结果可靠或新文件没有更小则保留原 PDF。除压缩外PDF 工具还包括转图片单页、全部或整份长图可选 DPI、直接提取内嵌原图而非整页截图以及内容提取——把原生文字、混排图片与图片 OCR 按阅读顺序输出为 HTML、TXT 或 Markdown。在 PDF 转 HTML 中图映生成的是可以离线打开的固定版式单文件网页而不是在网页里嵌入一个 PDF 阅读器。文字、图片、路径和符合许可条件的字体会按页面坐标重新组织无法等价重建的复杂效果则在质量报告中标明。HTML 转 PDF 支持先在本地导入和预览用户明确启动转换后再由同源 Chromium 服务生成实际 PDF并进行结构优化和结果校验。把服务端边界写在操作之前图映没有把“本地”包装成覆盖所有格式的承诺。JPG、PNG、WebP、常用动图、图片 OCR、本地 AI 抠图以及已有 PDF 压缩等任务可以在浏览器中完成。HEIC 写入、TIFF、JPEG 2000、图片导出为 PDF 等受编码器、专利或运行环境限制的能力需要使用服务端界面会在用户操作前标明处理位置。这套设计把隐私说明从一段笼统的承诺变成用户可以在任务中看到和核对的路径。用户也可以通过浏览器的网络面板自行验证首次使用时可能看到模型或编解码器下载但本地任务不应出现原图文件上传请求。从中文工具走向全球用户图映目前提供中文、英文、日文、韩文、德文、西班牙文、葡萄牙文和法文界面不同语言共用同一套功能与资源缓存并根据用户选择和浏览器语言提供对应入口。DataDance 希望把浏览器变成本地视觉工作台用户不必安装大型软件也不用在多个网站之间反复上传文件。随着浏览器编解码、WebAssembly、WebGPU 和文件系统能力不断完善一些过去依赖桌面软件或远程服务器的任务正在获得新的实现方式。对图映而言隐私安全不是一句覆盖所有情况的口号而是明确告诉用户哪些任务留在设备上哪些资源只是下载到本地哪些专业格式确实需要服务器。处理位置清楚用户才有选择。ImgIng 图映现已开放使用。国内用户可访问 imging.cn海外用户可访问 imging.ai按自己的素材和浏览器环境验证实际处理效果。