千帆-OCR是由百度千帆团队开发的一款拥有40亿参数的端到端文档智能模型。它在单一的视觉语言架构内,统一了文档解析、版面分析和文档理解功能。 与传统的将独立的版面检测、文字识别和语言理解模块级联起来的多阶段OCR流水线不同,千帆-OCR能够直接将图像转换为Markdown,并在单一模型内支持广泛的提示驱动任务——从结构化文档解析和表格提取,到图表理解、文档问答以及关键信息提取。
项目介绍
千帆-OCR是由百度千帆团队开发的一款拥有40亿参数的端到端文档智能模型。它在单一的视觉语言架构内,统一了文档解析、版面分析和文档理解功能。 与传统的将独立的版面检测、文字识别和语言理解模块级联起来的多阶段OCR流水线不同,千帆-OCR能够直接将图像转换为Markdown,并在单一模型内支持广泛的提示驱动任务——从结构化文档解析和表格提取,到图表理解、文档问答以及关键信息提取。
定制我的领域