DEV Community · Show DEV9/9 06:2348

构建基于视觉LLM的收据OCR API:原因与架构

I'm building a receipt/invoice OCR API on a vision-LLM. Here's the why and the schema.

阅读原文
开发者正在构建一个将收据和发票图像转换为结构化JSON的API,以解决成本高昂的文档OCR问题。传统方案如Azure Document Intelligence和Google Document AI,每页收费0.10至0.30美元,适合大规模企业,但对个人开发者或小型SaaS不友好。视觉语言模型的出现使得只需一个提示即可完成提取,成本仅为每页0.001至0.002美元,差距达50至100倍。该API提供单一端点,支持图像或PDF输入,返回结构化字段,无需SDK或模板。目前处于预发布阶段,尚无独立准确率基准,但计划定价为每月9美元(1000页)至79美元(20000页),并提供免费层。开发者希望获得关于生产环境中所需字段(如置信度、边界框、异步回调)的反馈。