为什么用 PIL 和 pytesseract 无法获取字符串？

2024-02-01

这是一个简单的Python 3光学字符识别（OCR）程序来获取字符串，我已经在这里上传了目标gif文件，请下载并另存为/tmp/target.gif.

try:
    from PIL import Image
except ImportError:
    import Image
import pytesseract
print(pytesseract.image_to_string(Image.open('/tmp/target.gif')))

我将所有错误信息粘贴到此处，请修复它以从图像中获取字符。

/usr/lib/python3/dist-packages/PIL/Image.py:925: UserWarning: Couldn't allocate palette entry for transparency
  "for transparency")
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "/usr/local/lib/python3.5/dist-packages/pytesseract/pytesseract.py", line 309, in image_to_string
    }[output_type]()
  File "/usr/local/lib/python3.5/dist-packages/pytesseract/pytesseract.py", line 308, in <lambda>
    Output.STRING: lambda: run_and_get_output(*args),
  File "/usr/local/lib/python3.5/dist-packages/pytesseract/pytesseract.py", line 208, in run_and_get_output
    temp_name, input_filename = save_image(image)
  File "/usr/local/lib/python3.5/dist-packages/pytesseract/pytesseract.py", line 136, in save_image
    image.save(input_file_name, format=img_extension, **image.info)
  File "/usr/lib/python3/dist-packages/PIL/Image.py", line 1728, in save
    save_handler(self, fp, filename)
  File "/usr/lib/python3/dist-packages/PIL/GifImagePlugin.py", line 407, in _save
    _get_local_header(fp, im, (0, 0), flags)
  File "/usr/lib/python3/dist-packages/PIL/GifImagePlugin.py", line 441, in _get_local_header
    transparency = int(transparency)
TypeError: int() argument must be a string, a bytes-like object or a number, not 'tuple'

我将其转换为convertbash 中的命令。

convert  "/tmp/target.gif"   "/tmp/target.jpg"

I show /tmp/target.gif and /tmp/target.jpg here.

然后再次执行上面的python代码。

try:
    from PIL import Image
except ImportError:
    import Image
import pytesseract
print(pytesseract.image_to_string(Image.open('/tmp/target.jpg')))

我什么也得不到pytesseract.image_to_string(Image.open('/tmp/target.jpg'))，我得到空白字符。

For Trenton_M's code:

>>> img1 = remove_noise_and_smooth(r'/tmp/target.jpg')
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "<stdin>", line 3, in remove_noise_and_smooth
AttributeError: 'NoneType' object has no attribute 'astype'
Thalish Sajeed

对于 Thalish Sajeed 的代码：

省略导致的错误信息print(pytesseract.image_to_string(Image.open(filename))).

Type "help", "copyright", "credits" or "license" for more information.
>>> from PIL import Image
>>> import pytesseract
>>> import matplotlib.pyplot as plt
>>> import cv2
>>> import numpy as np
>>> 
>>> 
>>> def display_image(filename, length_box=60, width_box=30):
...     if type(filename) == np.ndarray:
...         image = filename
...     else:
...         image = cv2.imread(filename)
...     plt.figure(figsize=(length_box, width_box))
...     plt.imshow(image, cmap="gray")
... 
>>> 
>>> filename = r"/tmp/target.jpg"
>>> display_image(filename)
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "<stdin>", line 7, in display_image
  File "/usr/local/lib/python3.5/dist-packages/matplotlib/pyplot.py", line 2699, in imshow
    None else {}), **kwargs)
  File "/usr/local/lib/python3.5/dist-packages/matplotlib/__init__.py", line 1810, in inner
    return func(ax, *args, **kwargs)
  File "/usr/local/lib/python3.5/dist-packages/matplotlib/axes/_axes.py", line 5494, in imshow
    im.set_data(X)
  File "/usr/local/lib/python3.5/dist-packages/matplotlib/image.py", line 634, in set_data
    raise TypeError("Image data cannot be converted to float")
TypeError: Image data cannot be converted to float
>>>

@Thalish Sajeed，为什么我得到了9244K代替0244k用你的代码？这是我测试过的示例文件。

The extracted string.

@Trenton_M，纠正代码中的一点拼写错误和丢失，然后删除该行plt.show()作为你的建议。

>>> import cv2,pytesseract
>>> import numpy as np
>>> import matplotlib.pyplot as plt
>>> 
>>> 
>>> def image_smoothening(img):
...     ret1, th1 = cv2.threshold(img, 88, 255, cv2.THRESH_BINARY)
...     ret2, th2 = cv2.threshold(th1, 0, 255, cv2.THRESH_BINARY + cv2.THRESH_OTSU)
...     blur = cv2.GaussianBlur(th2, (5, 5), 0)
...     ret3, th3 = cv2.threshold(blur, 0, 255, cv2.THRESH_BINARY + cv2.THRESH_OTSU)
...     return th3
... 
>>> 
>>> def remove_noise_and_smooth(file_name):
...     img = cv2.imread(file_name, 0)
...     filtered = cv2.adaptiveThreshold(img, 255, cv2.ADAPTIVE_THRESH_MEAN_C, cv2.THRESH_BINARY, 9, 41)
...     kernel = np.ones((1, 1), np.uint8)
...     opening = cv2.morphologyEx(filtered, cv2.MORPH_OPEN, kernel)
...     closing = cv2.morphologyEx(opening, cv2.MORPH_CLOSE, kernel)
...     img = image_smoothening(img)
...     or_image = cv2.bitwise_or(img, closing)
...     return or_image
... 
>>> 
>>> cv2_thresh_list = [cv2.THRESH_BINARY, cv2.THRESH_TRUNC, cv2.THRESH_TOZERO]
>>> fn = r'/tmp/target.jpg'
>>> img1 = remove_noise_and_smooth(fn)
>>> img2 = cv2.imread(fn, 0)
>>> for i, img in enumerate([img1, img2]):
...     img_type = {0: 'Preprocessed Images\n',
...                 1: '\nUnprocessed Images\n'}
...     print(img_type[i])
...     for item in cv2_thresh_list:
...         print('Thresh: {}'.format(str(item)))
...         _, thresh = cv2.threshold(img, 127, 255, item)
...         plt.imshow(thresh, 'gray')
...         f_name = '{0}.jpg'.format(str(item))
...         plt.savefig(f_name)
...         print('OCR Result: {}\n'.format(pytesseract.image_to_string(f_name)))

... 预处理图像

在我的控制台中，所有输出信息如下：

Thresh: 0
<matplotlib.image.AxesImage object at 0x7fbc2519a6d8>
OCR Result: 10
15
20 

Edﬁﬁ
10
2 o 30 40 so
so

Thresh: 2
<matplotlib.image.AxesImage object at 0x7fbc255e7eb8>
OCR Result: 10
15
20
Edﬁﬁ
10
2 o 30 40 so
so
Thresh: 3
<matplotlib.image.AxesImage object at 0x7fbc25452fd0>
OCR Result: 10
15
20
Edﬁﬁ
10
2 o 30 40 so
so
Unprocessed Images
Thresh: 0
<matplotlib.image.AxesImage object at 0x7fbc25464c88>
OCR Result: 10
15
20
Thresh: 2
<matplotlib.image.AxesImage object at 0x7fbc254520f0>
OCR Result: 10
15
2o
2o
30 40 50
Thresh: 3
<matplotlib.image.AxesImage object at 0x7fbc1e1968d0>
OCR Result: 10
15
20

字符串在哪里0244R?

让我们从 JPG 图像开始，因为 pytesseract 在 GIF 图像格式上运行时存在问题。参考 https://github.com/madmaze/pytesseract/issues/135

filename = "/tmp/target.jpg"
image = cv2.imread(filename)
gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY)
ret, threshold = cv2.threshold(gray,55, 255, cv2.THRESH_BINARY)
print(pytesseract.image_to_string(threshold))

让我们尝试分解这里的问题。

您的图像噪音太大，超正方体引擎无法识别字母，我们使用一些简单的图像处理技术（例如灰度和阈值处理）来消除图像中的一些噪音。

然后，当我们将其发送到 OCR 引擎时，我们会发现字母的捕获更加准确。

如果您按照此操作，您可以找到我的笔记本，我在其中对此进行了测试github链接 https://github.com/thalishsajeed/stackoverflow_qa/blob/master/pytesseract.ipynb

编辑 - 我已经用一些额外的图像清理技术更新了笔记本。源图像的噪声太大，超正方体无法直接在图像上开箱即用。您需要使用图像清理技术。

您可以改变阈值参数或将高斯模糊替换为其他技术，直到获得所需的结果。

如果您希望在嘈杂的图像上运行 OCR - 请查看商业 OCR 提供商，例如谷歌云视觉 https://cloud.google.com/vision/。他们每月免费提供 1000 次 OCR 调用。

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系:hwhale#tublm.com(使用前将#替换为@)

python

python3x

OCR

pythontesseract

为什么用 PIL 和 pytesseract 无法获取字符串？的相关文章

分配列表的多个值

我很想知道是否有一种 Pythonic 方式将列表中的值分配给元素为了更清楚我要求这样的事情 myList 3 5 7 2 a b c d something myList So that a 3 b 5 c 7 d 2 我正在寻找比手
minAreaRect OpenCV 返回的裁剪矩形 [Python]

minAreaRectOpenCV 中返回一个旋转的矩形如何裁剪矩形内图像的这部分 boxPoints返回旋转矩形的角点的坐标以便可以通过循环框内的点来访问像素但是在 Python 中是否有更快的裁剪方法 EDIT See code在
如何使用 python、openCV 计算图像中的行数

我想数纸张所以我正在考虑使用线条检测我尝试过一些方法例如Canny HoughLines and FLD 但我只得到处理过的照片我不知道如何计算有一些小线段就是我们想要的线我用过len lines or len contours
检查子字符串是否在字符串列表中？

我之前已经找到了这个问题的一些答案但它们对于当前的Python版本来说似乎已经过时了或者至少它们对我不起作用我想检查字符串列表中是否包含子字符串我只需要布尔结果我找到了这个解决方案 word to check or wordlis
Python 中 time.sleep 和多线程的问题

我对 python 中的 time sleep 函数有疑问我正在运行一个脚本需要等待另一个程序生成 txt 文件虽然这是一台非常旧的机器所以当我休眠 python 脚本时我遇到了其他程序不生成文件的问题除了使用 time sl
如何在 numpy 数组中查找并保存重复的行？

我有一个数组例如 Array 1 1 1 2 2 2 3 3 3 4 4 4 5 5 5 1 1 1 2 2 2 我想要输出以下内容的东西 Repeated 1 1 1 2 2 2 保留重复行的数量也可以例如 Repeated 1 1
将多索引转换为行式多维 NumPy 数组。

假设我有一个类似于以下示例的 MultiIndex DataFrame多索引文档 http pandas pydata org pandas docs stable advanced html gt gt gt df 0 1 2 3 fir
烧瓶 - 404 未找到

我是烧瓶开发的新手这是我在烧瓶中的第一个程序但它向我显示了这个错误在服务器上找不到请求的 URL 如果您输入了网址请手动检查拼写并重试这是我的代码 from flask import Flask app Flask name ap
获取 int() 参数必须是字符串或数字，而不是“Column”- Apache Spark

如果我使用以下代码我会收到此异常 int argument must be a string or a number not Column df df withColumn FY F when df ID substr 5 2 isin
打印一份拥有多个家庭的人员名单，每个家庭都有多个电话号码

我有一类 Person 它可以有多个 Home 每个 Home 都有一个或多个电话号码我已经定义了类但现在我正在尝试创建一个视图其中列出每个人的所有家庭以及每个家庭地址的所有电话号码类似于 john smith 123 fake s
如何将 Pyspark Dataframe 标题设置到另一行？

我有一个如下所示的数据框 col1 col2 col3 id name val 1 a01 X 2 a02 Y 我需要从中创建一个新的数据框使用 row 1 作为新的列标题并忽略或删除 col1 col2 等行新表应如下所示 id na
同一台机器上有多个Python版本？

Python 网站上是否有关于如何在 Linux 上的同一台计算机上安装和运行多个版本的 Python 的官方文档我可以找到无数的博客文章和答案但我想知道是否有标准官方方法可以做到这一点或者这一切都取决于操作系统我认为它是完全独
错误：尝试使用 scrappy 登录时出现 raise ValueError("No element found in %s" % response)

问题描述我想从我大学的bbs上抓取一些信息这是地址 http bbs byr cn http bbs byr cn下面是我的蜘蛛的代码 from lxml import etree import scrapy try from scra
预测测试图像时出现错误 - 无法重塑大小数组

我正在尝试使用 TensorFlow 和 Keras 在 Python 中进行图像识别并且我已经关注了下面的博客 https stackabuse com image recognition in python with tensorfl
我可以在 if 语句中使用“as”机制吗

是否可以使用as in if类似的声明with我们使用的例如 with open tmp foo r as ofile do something with ofile 这是我的代码 def my list rtrn lst True if
异步异常处理程序：在事件循环线程停止之前不会被调用

我正在我的异步事件循环上设置异常处理程序但是在事件循环线程停止之前它似乎不会被调用例如考虑以下代码 def exception handler loop context print Exception handler called
RuntimeError(f"目录 '{directory}' 不存在") RuntimeError: 目录 'app/static' 不存在

当我运行 server py 文件时出现错误 File C Users nawin AppData Local Programs Python Python38 lib site packages starlette staticfiles
旧版本的 spaCy 在尝试安装模型时抛出“KeyError: 'package'”错误

我在 Ubuntu 14 04 4 LTS x64 上使用 spaCy 1 6 0 和 python3 5 为了安装 spaCy 的英文版本我尝试运行这给了我错误消息 ubun ner 3 NeuroNER master src pyt
使用 Numpy 进行多维批量图像卷积

在图像处理和分类网络中一个常见的任务是输入图像与一些固定滤波器的卷积或互相关例如在卷积神经网络 CNN 中这是一种极其常见的操作我已将通用版本任务减少为 Given 一批 N 个图像 N H W D 和一组 K 个滤镜 K H W
当训练和测试的特征数量不同时，如何处理生产环境中的One-Hot Encoding？

在做某些实验时我们通常在 70 上进行训练在 33 上进行测试但是当您的模型投入生产时会发生什么可能会发生以下情况训练集 Ser Type Of Car 1 Hatchback 2 Sedan 3 Coupe 4 SUV 经过

随机推荐

每个页面加载的计时器减量都会有所不同

我的项目有一个计时器每次减少 1 秒但是如果计数器第二次开始工作它会减少 2 秒第三次则减少 3 秒依此类推我应该怎么做才能始终减少 1 秒 void viewDidAppear BOOL animated count 15
计算大于另一个整数 x 的 k 位集合的最小整数？

我想精确地计算最小整数k位设置大于另一个整数x 例如如果x 1001010然后为了k 2 答案应该是1010000 for k 4 答案应该是1001011并为k 5答案是1001111 我认为需要设置至少与整数中最左边设置的位一样多的
JSHint 奇怪的行为

我认为我应该问关于 jSHint 的新问题讨论开始了here https stackoverflow com questions 35987052 js strange behavior 我现在可以看到来自 JSHint 的奇怪警告我只
从 KMS CipherTextBlob 获取 KMS 密钥

如何从密文 blob 中获取 KMS 密钥信息以aws网站为例 AWS KMS 文档 http docs aws amazon com cli latest reference kms encrypt html aws kms encry
Matlab 和 XTickLabel

我已经尝试让 Matlab 更改轮廓图上的标签大约一个小时了当我去更改 XTickLabel 或 XTick 时它只是完全删除我的 x 轴令人沮丧和愤怒的是我正在做的事情exactly什么所有的帮助页面 http www mathwo
使用 Git 版本控制查看文件的更改历史记录

如何查看单个文件的历史记录以及更改内容的完整详细信息 git log filename 显示文件的提交历史记录但如何查看已更改的文件内容这让 Git 为每个日志条目生成补丁 git log p filename See git help
如何使css/images/js文件等所有静态文件不被asp.net mvc处理？

静态文件有可能不被asp net mvc引擎处理吗我可以在 IIS 级别或其他级别执行此操作吗当然无需为静态文件创建单独的 IIS 网站您需要为不希望通过 ASP NET MVC 提供服务的特定类型的文件创建忽略路由针对您要忽略的文
切换 kivy 小部件

我正在使用 Kivy python 库我定义了两个小部件当程序运行时我运行第一个小部件当按下该小部件按钮时我希望它消失并被第二个小部件替换这是两个小部件的 kv uitest kv
确定 MouseListener 中单击的 JPanel 组件。事件处理

我有一个扩展 JPanel 的类 public class ButtonPanel extends JPanel private label public ButtonPanel label new JLabel waiting for c
Cypress 组件测试拦截 getServerSideProps 请求

使用 cypress 组件测试时无法弄清楚如何拦截 getServerSideProps 做了很多研究和最好的线索链接 https github com cypress io cypress discussions 9328 https g
注册表模式 vs 服务定位器模式 vs 依赖注入容器

它们之间有什么区别而不是通过键设置和获取数组中的对象吗 class Registry private container array public static function Set name object self container
除了 malloc/free 之外，程序还需要操作系统提供其他东西吗？

我正在为我正在开发的操作系统设计内核我实际上将其称为核心只是为了有所不同但它基本上是相同的如果我无法启动和运行多任务处理内存管理和其他基本功能那么操作系统本身的细节就无关紧要了所以我需要首先解决这个问题我有一些关于设计 m
如何使用 Java 获取 AWS Glue 客户端

我正在尝试从用 Java 编写的 Lambda 代码调用 AWS Glue 中的作业但我无法获得 Glue 客户端就像我们有这样的 DynamoClient AmazonDynamoDB client AmazonDynamoDBCli
如何在保留空格的同时分割（）字符串[重复]

这个问题在这里已经有答案了如何拆分一串单词并保留空格这是代码 String words s split 字符串 s 包含 hello world 代码运行后 words 包含 hello world 理想情况下它不应该是中间的空字符串
awk - 如果为 null，则打印最后一列值并使用默认值

我正在使用 awk 命令来打印值对于最后一列如果没有找到值我需要它来打印NA 例如在下面的代码中当 3 is NULL 我需要打印为NA 无论如何我可以包括一个if isnull条件什么的 awk F print 1 2 3 lo
Android 中的 TextView 可以显示数字文本吗？

嗨朋友们在我的应用程序中要求文本值应显示在数字文本格式可以吗TextView 数字时钟如何显示请提供任何帮助从this下载字体link http font downloadatoz com font 24267 digital 7
将 Intent 从 BroadcastReceiver 类发送到当前正在运行的活动

我有一个扩展的类BroadcastReceiver 收到短信后我想将信息传递到我的主要活动类以在框中显示文本如果文本已存在则追加 public class SmsReceiver extends BroadcastReceiver
Algolia 对数组属性的过滤器未按预期工作

我有一个关于 algolia 的索引有这样的用户 UserA createdAt 1675364400000 email email protected cdn cgi l email protection products produc
在Java中精确地将两个数字相乘[重复]

这个问题在这里已经有答案了我正在寻找一种在 Java 中将两个浮点数相乘的精确方法我读到我应该使用 BigDecimal 但它并没有按预期工作我究竟做错了什么我的代码 BigDecimal a new BigDecimal 3 53
为什么用 PIL 和 pytesseract 无法获取字符串？

这是一个简单的Python 3光学字符识别 OCR 程序来获取字符串我已经在这里上传了目标gif文件请下载并另存为 tmp target gif try from PIL import Image except ImportError

为什么用 PIL 和 pytesseract 无法获取字符串？

为什么用 PIL 和 pytesseract 无法获取字符串？ 的相关文章

随机推荐

热门标签

为什么用 PIL 和 pytesseract 无法获取字符串？的相关文章