切片对象信息
被如下接口引用:ChunkDocument。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| Index | Integer | 否 | chunk索引。切片顺序 id。 |
| Content | String | 否 | chunk内容。 |
文档分片配置
被如下接口引用:ChunkDocument。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| MaxChunkSize | Integer | 否 | 按照分隔符切片后,对分片长度会进行校验,当超过最大分片长度时,则用下一级分隔符分割,如无下一级分隔符,则保留原长度;默认值:1000 |
| Delimiters | Array of String | 否 | 分隔符列表,优先靠前的分隔符;文件类型为TXT时,默认值:["\n\n", "\n", "。", "!", "?", ",", ""] |
| ChunkOverlap | Integer | 否 | 相邻切片重合字符数,需要小于分片长度,若形成完全冗余的切片,则会自动过滤;默认值:0.2*MaxChunkSize |
文档切片异步任务
被如下接口引用:ChunkDocumentAsync。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| MaxChunkSize | Integer | 否 | 最大分片长度 |
切片文档信息
被如下接口引用:ChunkDocument。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| FileType | String | 否 | 文件类型,支持 MD,TXT 格式。 |
| FileContent | String | 否 | 文本原文,使用字符串格式输入。 |
文档信息
被如下接口引用:ChunkDocumentAsync, ParseDocumentAsync。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| FileType | String | 是 | 支持的文件类型:PDF、DOC、DOCX、PPT、PPTX、MD、TXT、XLS、 XLSX、CSV、PNG、JPG、JPEG、BMP、GIF、WEBP、HEIC、EPS、ICNS、 IM、PCX、PPM、TIFF、XBM、HEIF、JP2 文档解析支持的文件大小: -PDF、DOC、DOCX、PPT、PPTX支持100M -MD、TXT、XLS、XLSX、CSV支特10M -其他支持20M 文本切片支持的文件大小: -PDF最大300M -D0CX、D0C、PPT、PPTX最大200M -TXT、MD最大10M -其他最大20M |
| FileUrl | String | 否 | 文件存储于腾讯云的 URL 可保障更高的下载速度和稳定性,使用腾讯云COS 文件地址。 |
| FileContent | String | 否 | 文件的 base64 值,携带 MineType前缀信息。编码后的后的文件不超过 10M。 支持的文件大小:所下载文件经Base64编码后不超过 8M。文件下载时间不超过3秒。 支持的图片像素:单边介于20-10000px之间。 |
| FileName | String | 否 | 文件名称,当使用 base64上传的时候使用。 |
| FileStartPageNumber | Integer | 否 | 文档的起始页码 |
| FileEndPageNumber | Integer | 否 | 文档的结束页码 |
文档切片用量
被如下接口引用:GetDocumentChunkResult。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| PageNumber | Integer | 否 | 解析页面数量 |
| TotalTokens | Integer | 否 | 消耗 token数量 |
文档解析配置
被如下接口引用:ParseDocument。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| ImageResponseType | Integer | 否 | 0:图片以链接形式返回 1:返回图片中提取的文本内容 |
向量内容
被如下接口引用:GetTextEmbedding。
| 名称 | 类型 | 描述 |
|---|---|---|
| Embedding | Array of Float | embedding 内容 注意:此字段可能返回 null,表示取不到有效值。 |
| Index | Integer | 索引序号 注意:此字段可能返回 null,表示取不到有效值。 |
消耗页数
被如下接口引用:GetDocumentParseResult, ParseDocument。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| TotalPages | Integer | 否 | 消耗总页数 |
文档信息
被如下接口引用:ParseDocument。
| 名称 | 类型 | 必选 | 描述 |
|---|---|---|---|
| FileType | String | 是 | 支持的文件类型:PDF、DOC、DOCX、PPT、PPTX、MD、TXT、XLS、 XLSX、CSV、PNG、JPG、JPEG、BMP、GIF、WEBP、HEIC、EPS、ICNS、 IM、PCX、PPM、TIFF、XBM、HEIF、JP2 文档解析支持的文件大小: -PDF、DOC、DOCX、PPT、PPTX支持100M -MD、TXT、XLS、XLSX、CSV支特10M -其他支持20M 文本切片支持的文件大小: -PDF最大300M -D0CX、D0C、PPT、PPTX最大200M -TXT、MD最大10M -其他最大20M |
| FileUrl | String | 否 | 文件存储于腾讯云的 URL 可保障更高的下载速度和稳定性,使用腾讯云COS 文件地址。 |
| FileContent | String | 否 | 文件的 base64 值,携带 MineType前缀信息。编码后的后的文件不超过 10M。 支持的文件大小:所下载文件经Base64编码后不超过 8M。文件下载时间不超过3秒。 支持的图片像素:单边介于20-10000px之间。 文件的 FileUrl、FileContent必须提供一个,如果都提供只使用 FileUrl。 |
| DocumentParseConfig | DocumentParseConfig | 否 | 文档解析配置 |
| FileStartPageNumber | Integer | 否 | 文档的起始页码 |
| FileEndPageNumber | Integer | 否 | 文档的结束页码 |
输出结果
被如下接口引用:RunRerank。
| 名称 | 类型 | 描述 |
|---|---|---|
| Index | Integer | 对应的doc在输入候选doc数组中的位置索引值 注意:此字段可能返回 null,表示取不到有效值。 |
| RelevanceScore | Float | 相似度分数 注意:此字段可能返回 null,表示取不到有效值。 |
| Document | String | doc原文内容 注意:此字段可能返回 null,表示取不到有效值。 |
token消耗总数
被如下接口引用:ChunkDocument, GetTextEmbedding, RunRerank。
| 名称 | 类型 | 描述 |
|---|---|---|
| TotalTokens | Integer | tokens总数 注意:此字段可能返回 null,表示取不到有效值。 |
文档反馈