关于此模型
Muapi OCR 文本识别会检测并提取图像中的每个可读文本片段,返回每个片段的字符串内容、以图像尺寸比例表示的边界框,以及置信度评级(high、medium 或 low)。它运行在专用的本地 OCR 流程上,而不是调用通用视觉 LLM,因此在高吞吐工作负载中能够保持识别快速且成本低廉。
这使它成为图像编辑流程前的自然第一步:先检测存在什么文本以及其位置,让用户或下游工具决定要修改什么,然后将编辑后的片段传回类似 GPT Image 2 或 Nano Banana Pro 的图像编辑模型,仅替换目标文本并重新生成图像。
成本分析
| 提供商 | 费用 | 备注 |
|---|---|---|
| muapiapp | $0.02 每次生成 | 按图像固定费率计费,与检测到的文本片段数量无关。 |
| Fal.ai | 暂不可用 | 目前没有列出专用的本地 OCR 文本检测端点。 |
| Replicate | 因模型而异 | 虽然存在独立的 OCR 模型,但没有像此服务一样将其整合为带边界框和置信度的文本检测 API。 |
按图像固定费率计费,与检测到的文本片段数量无关。
目前没有列出专用的本地 OCR 文本检测端点。
虽然存在独立的 OCR 模型,但没有像此服务一样将其整合为带边界框和置信度的文本检测 API。
** 竞品价格根据相似模型架构和使用层级估算。
配置参数
| 参数 | 类型 | 描述 | 默认值 |
|---|---|---|---|
| 图像 URL | string | 用于识别文本的图像 URL。 | https://d3adwkbyhxyrtq.cloudfront.net/ai-images/example-poster.jpg |
用于识别文本的图像 URL。
https://d3adwkbyhxyrtq.cloudfront.net/ai-images/example-poster.jpg开发者文档
准备图像:准备一个可公开访问的图像 URL——可以是海报、屏幕截图、产品照片或任何包含可见文本的图像。
调用端点:发送包含 image_url 字段的 POST 请求。不需要其他参数。
读取结果:响应的 items 数组会列出每个检测到的文本片段,其中包含其 text 字符串、bbox(以图像宽度/高度的 [x, y, w, h] 比例表示)以及 confidence 标签(high、medium 或 low)。
串接编辑(可选):使用片段列表构建编辑提示词——例如 "replace the fragment at this bbox with new text, keep everything else unchanged"——然后将其传给图像编辑模型。
curl -X POST https://api.muapi.ai/api/v1/ocr-recognize-text \
-H "Content-Type: application/json" \
-H "x-api-key: YOUR_API_KEY" \
-d '{
"image_url": "https://example.com/poster.jpg"
}'
常见问答
它会扫描输入图像,返回检测到的每个文本片段及其边界框(以图像尺寸比例表示)和置信度分数,不会重新生成或修改图像。
唯一必需的输入是 `image_url`,即要扫描图像的公开 URL。还可以提供可选的 `webhook_url`,以异步接收结果。
比例坐标(0–1 范围)可以让同一个边界框无论检测和后续编辑之间发生何种缩放,都能正确应用,无需额外的单位换算。
每个片段都会根据 OCR 引擎的内部识别分数标记为 `high`、`medium` 或 `low`,因此下游逻辑可以选择忽略低置信度噪声。
OCR Recognize Text 只能检测并返回文本片段。若要修改文本,请将检测到的片段和期望的替换内容作为后续请求传给图像编辑模型。
支持从公开可访问 URL 提供的标准 Web 图像格式(JPG、PNG、WebP)。