文本内容审核器: AI 大语言模型

根据 OpenAI 的标准审核类别(色情、仇恨、骚扰、自残、暴力等)对任意文本片段进行分类。返回布尔标志、各类别布尔值和置信度分数,可作为聊天输入、生成文本和自由格式提示的即用型安全闸门。

📝

概览

关于此模型

根据标准政策类别对任意文本片段进行分类,包括色情、仇恨、骚扰、自残、暴力等,并为每个类别提供置信度分数。它可以作为聊天输入、生成文本和自由格式提示的即用型安全闸门。

1聊天应用:在将用户消息转发给 LLM 之前进行过滤。
2提示词安全:在产生生成请求费用之前预检查提示词。
3内容审核:为下游审核队列评估开放文本提交。
💰

价格与价值

成本分析

muapiapp$0.001 每次调用

每次文本审核调用按固定费用计费,不设用量阶梯。

Fal.ai暂不可用

没有等效的第一方文本审核模型。

Replicate暂不可用

没有等效的第一方文本审核模型。

** 竞品价格根据相似模型架构和使用层级估算。

⚙️

技术详情

配置参数

文本string

要审核的文本。评估前会截断为 8000 个字符。

默认值A beautiful sunset over the mountains.
📖

实施指南

开发者文档

如何使用文本内容审核

  1. 提交文本:POST text(评估前会截断至 8000 个字符)。无需其他字段。

  2. 读取判定:文本审核会同步完成——立即轮询 /api/v1/predictions/{request_id}/result,通常会在一秒内获得结果。

  3. 检查类别和分数output.flagged 是二元闸门。output.categories 是一个 {category: boolean} 字典,显示触发了哪些政策;output.category_scores 则提供每个类别的置信度分数(0–1)。

常见问题

常见问答

文本最长可以有多长?

最多 8000 个字符;超过此长度的内容会在评估前被截断。

支持哪些语言?

审核器支持多种语言,但英语能提供最可靠的类别分数。

有哪些类别?

sexual、sexual/minors、hate、hate/threatening、harassment、harassment/threatening、self-harm 及其子类型、violence,以及 violence/graphic。