DocBatch|文档批处理

开发中

第二个在做的东西:一次交一批贸易单据,换回一个可以直接用的表格 —— 汇总表一行一份单据,明细表一行一条明细,都是拆成列的。还在开发中,暂时不能自助使用。

它解决什么问题

一票货的单据是一整套:采购订单、发票、报关单、装箱单。数字都在上面,但没有一个是长在列里的 —— 要核对,就得先有人把它们逐条敲进表格。

这件事最费时间的不是判断,是搬运:同一批数字,给采购的清单敲一遍,给报关的清单再敲一遍。每多搬一遍,就多一次敲错的机会;而且第两百条明细通常拿不到第二条的注意力。

DocBatch 接过来的是搬运这一段:一批单据进去,一个工作簿出来,时间回到判断上。

    跑完一批,得到什么

    • · 一个单据类型一个工作簿 —— 发票那批和装箱那批不会混进同一张表。
    • · 每个工作簿两张表:汇总表一行一份单据,明细表一行一条明细,靠文件名回连。
    • · 明细是拆成列的,不是一整段文字:拿到就能筛选、透视、做公式。
    • · 另有一份解析日志,一行一份单据 —— 跳过了什么、告警在哪,都写在里面,而不是安静地少几行。
    • · 输出文件名带这一批的生成时刻,跑多少次都不会覆盖上一批。

    什么样的文件能处理

    • · 带文字层的 PDF 直接解析,走的是字符坐标定位,不是文字识别。
    • · Excel 形式的装箱单按列名的含义映射,不套固定版式 —— 这类单据的版式本来就不固定。
    • · 扫描件要先过一步文字识别,这一步目前只接在采购订单上;其余类型遇到扫描件会记一条告警并跳过,不会默默产出半张表。

    说清楚做不到的部分

    • · 不做跨单关联:发票、报关单、装箱单之间还没有自动匹配。相关字段都保留着,但比对仍然由人来做。
    • · 还在开发中。这一页没有可以上传的地方,也没有开放的试用入口 —— 它是什么样,这里就写什么样。

    文件和单据怎么处理

    • · 文件在本地处理,不经过这个网站 —— 这一页只是介绍,不是一张表单。
    • · 扫描件需要文字识别时,图片会发给第三方识别服务;电子版文件不离开本机。
    • · 单据原文和抽取结果都不用于训练模型。

    常见问题

    现在能试用吗?

    还不能。它还在开发中,这一页只是介绍;有东西可以试的时候,这里会出现入口,门户上的状态也会跟着改。

    支持哪几类单据?

    四类:采购订单、发票、报关单、装箱单。其它类型没有实现,我们不会把没实现的写成支持。

    扫描件能处理吗?

    采购订单可以 —— 扫描件先过一步文字识别。其余三类只处理电子件:带文字层的 PDF,或者 Excel。扫描件会被记一条告警并跳过,不会当成解析成功。

    联系我们

    用邮件即可,不需要预约通话。所有合作与支持都走邮箱,我们在 48 小时内回复。

    support@aisp.work