1.前期准备工作：

1.需要生成的字符集 .tif文件，位置文件 .box文件

现在有三个需要合并的字典

（1）.（zwp1.test.exp0.tif，zwp1.test.exp0.box）

（2）.（zwp82.test.exp0.tif，zwp83.test.exp0.box）

（3）. (zwp83.test.exp0.tif, zwp83.test.exp0.box)

box和tif文件

2.合并过程：

1、先生成相对应的 .tr 文件（如果你之前训练的.tr 有的话，可以忽略这步）

tesseract zwp1.test.exp0.tif zwp1.test.exp0 nobatch box.train

tesseract zwp82.test.exp0.tif zwp82.test.exp0 nobatch box.train

tesseract zwp83.test.exp0.tif zwp83.test.exp0 nobatch box.train

生成.tr文件

2、从所有文件中提取字符

unicharset_extractor zwp1.test.exp0.box zwp82.test.exp0.box zwp83.test.exp0.box

所有文件中提取字符

3、生成字体特征文件

新建的font.txt文件，在文件中把所有box文件对应的字体特征都加进去（如果不知道，可以去原来考出来的字库文件找font_properties文件查看）

test 0 0 0 0 0

test 0 0 0 0 0

然后执行如下命令：

mftraining -F font.txt -U unicharset zwp1.test.exp0.tr zwp82.test.exp0.tr zwp83.test.exp0.tr

生成字体特征文件

4 、聚集所有.tr 文件

cntraining zwp1.test.exp0.tr zwp82.test.exp0.tr zwp83.test.exp0.tr

聚集所有.tr 文件

5 、重命名文件，把unicharset, inttemp, normproto, pfftable，shapetable 这几个文件加了前缀zwpnew. (目的是为了后面的聚集合并)

rename normproto zwpnew.normproto

rename inttemp zwpnew.inttemp

rename pffmtable zwpnew.pffmtable

rename shapetable zwpnew.shapetable

rename unicharset zwpnew.unicharset

重命名文件

6、合并所有文件生成一个大的字库文件

combine_tessdata zwpnew.

合并文件

7、最后文件夹中就可以看到生成的.traineddata训练库

.traineddata训练库

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 Tesseract_ocr 字符识别基础及训练字库、合并字库 OCR2：tesseract字库训练 Tesseract5.0训练字库，提高OCR特殊场景识别率，合并字库（二） [转]在VS2010下编译和使用tesseract_ocr Tesseract-OCR4.0识别中文与训练字库实例 Tesseract-OCR识别中文与训练字库实例 Tesseract-OCR识别中文与训练字库实例 Tesseract_OCR技术在Java语言maven项目中使用Tess4j进行实现一、Tesseract4.0训练字库 OCR 提高识别率必备(超详情) Tesseract4.0训练字库 OCR 提高识别率必备