Muapi OCR 文本识别: AI 工具

使用 Muapi OCR 文本识别从图像中提取文本。快速本地 OCR 返回每个片段的位置和置信度。免费试用,按次生成付费。

📝

概览

关于此模型

Muapi OCR 文本识别会检测并提取图像中的每个可读文本片段,返回每个片段的字符串内容、以图像尺寸比例表示的边界框,以及置信度评级(high、medium 或 low)。它运行在专用的本地 OCR 流程上,而不是调用通用视觉 LLM,因此在高吞吐工作负载中能够保持识别快速且成本低廉。

这使它成为图像编辑流程前的自然第一步:先检测存在什么文本以及其位置,让用户或下游工具决定要修改什么,然后将编辑后的片段传回类似 GPT Image 2Nano Banana Pro 的图像编辑模型,仅替换目标文本并重新生成图像。

1设计工具:在可编辑文本工作流之前,定位扁平化海报、广告或缩略图中的所有文本层。
2本地化:在翻译和重新渲染前,从营销图像中提取源语言文本片段。
3内容审核:提取用户上传图像中的嵌入文本,供下游基于文本的策略检查使用。
4文档数字化:从照片中提取标签、说明文字或标牌文本,以便建立索引或搜索。
5代理式图像编辑:搭配类似 [edit_image](/api) 的工具,仅修改检测到的文本,同时逐像素保留图像的其余部分。
💰

价格与价值

成本分析

muapiapp$0.02 每次生成

按图像固定费率计费,与检测到的文本片段数量无关。

Fal.ai暂不可用

目前没有列出专用的本地 OCR 文本检测端点。

Replicate因模型而异

虽然存在独立的 OCR 模型,但没有像此服务一样将其整合为带边界框和置信度的文本检测 API。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

图像 URLstring

用于识别文本的图像 URL。

默认值https://d3adwkbyhxyrtq.cloudfront.net/ai-images/example-poster.jpg
📖

实施指南

开发者文档

如何使用 OCR 文本识别

  1. 准备图像:准备一个可公开访问的图像 URL——可以是海报、屏幕截图、产品照片或任何包含可见文本的图像。

  2. 调用端点:发送包含 image_url 字段的 POST 请求。不需要其他参数。

  3. 读取结果:响应的 items 数组会列出每个检测到的文本片段,其中包含其 text 字符串、bbox(以图像宽度/高度的 [x, y, w, h] 比例表示)以及 confidence 标签(highmediumlow)。

  4. 串接编辑(可选):使用片段列表构建编辑提示词——例如 "replace the fragment at this bbox with new text, keep everything else unchanged"——然后将其传给图像编辑模型。

curl -X POST https://api.muapi.ai/api/v1/ocr-recognize-text \
  -H "Content-Type: application/json" \
  -H "x-api-key: YOUR_API_KEY" \
  -d '{
    "image_url": "https://example.com/poster.jpg"
  }'

常见问题

常见问答

OCR Recognize Text 可以做什么?

它会扫描输入图像,返回检测到的每个文本片段及其边界框(以图像尺寸比例表示)和置信度分数,不会重新生成或修改图像。

可以配置哪些参数?

唯一必需的输入是 `image_url`,即要扫描图像的公开 URL。还可以提供可选的 `webhook_url`,以异步接收结果。

为什么 `bbox` 返回的是比例而不是像素?

比例坐标(0–1 范围)可以让同一个边界框无论检测和后续编辑之间发生何种缩放,都能正确应用,无需额外的单位换算。

`confidence` 字段是什么意思?

每个片段都会根据 OCR 引擎的内部识别分数标记为 `high`、`medium` 或 `low`,因此下游逻辑可以选择忽略低置信度噪声。

它能否用于编辑图像中的文本,而不只是检测文本?

OCR Recognize Text 只能检测并返回文本片段。若要修改文本,请将检测到的片段和期望的替换内容作为后续请求传给图像编辑模型。

支持哪些图像格式?

支持从公开可访问 URL 提供的标准 Web 图像格式(JPG、PNG、WebP)。