熊猫似乎在读取制表符分隔的数据时忽略了第一列名称,从而导致KeyError

发布于 2021-01-29 16:07:13

我在Ubuntu 13.10的ipython3中使用pandas
0.12.0,以便将大型制表符分隔的数据集缠绕在txt文件中。使用read_table从txt创建DataFrame似乎可以工作,并且第一行被读取为标题,但是尝试使用其名称作为索引来访问第一列会引发KeyError。我不明白为什么会发生这种情况,因为所有列名似乎都已被正确读取,并且其他所有列都可以用这种方式建立索引。

数据如下所示:

RECORDING_SESSION_LABEL LEFT_GAZE_X LEFT_GAZE_Y RIGHT_GAZE_X    RIGHT_GAZE_Y    VIDEO_FRAME_INDEX   VIDEO_NAME
73_1    .   .   395.1   302 .   .
73_1    .   .   395 301.9   .   .
73_1    .   .   394.9   301.7   .   .
73_1    .   .   394.8   301.5   .   .
73_1    .   .   394.6   301.3   .   .
73_1    .   .   394.7   300.9   .   .
73_1    .   .   394.9   301.3   .   .
73_1    .   .   395.2   302 1   1_1_just_act.avi
73_1    .   .   395.3   302.3   1   1_1_just_act.avi
73_1    .   .   395.4   301.9   1   1_1_just_act.avi
73_1    .   .   395.7   301.5   1   1_1_just_act.avi
73_1    .   .   395.9   301.5   1   1_1_just_act.avi
73_1    .   .   396 301.5   1   1_1_just_act.avi
73_1    .   .   395.9   301.5   1   1_1_just_act.avi
15_1    395.4   301.7   .   .   .   .

分隔符肯定是制表符,并且没有尾随或前导空格。

此最小程序将发生错误:

import pandas as pd

samples = pd.read_table('~/datafile.txt')

print(samples['RECORDING_SESSION_LABEL'])

给出错误:

---------------------------------------------------------------------------
KeyError                                  Traceback (most recent call last)
<ipython-input-65-137d3c16b931> in <module>()
----> 1 print(samples['RECORDING_SESSION_LABEL'])

/usr/lib/python3/dist-packages/pandas/core/frame.py in __getitem__(self, key)
   2001             # get column
   2002             if self.columns.is_unique:
-> 2003                 return self._get_item_cache(key)
   2004 
   2005             # duplicate columns

/usr/lib/python3/dist-packages/pandas/core/generic.py in _get_item_cache(self, item)
    665             return cache[item]
    666         except Exception:
--> 667             values = self._data.get(item)
    668             res = self._box_item_values(item, values)
    669             cache[item] = res

/usr/lib/python3/dist-packages/pandas/core/internals.py in get(self, item)
   1654     def get(self, item):
   1655         if self.items.is_unique:
-> 1656             _, block = self._find_block(item)
   1657             return block.get(item)
   1658         else:

/usr/lib/python3/dist-packages/pandas/core/internals.py in _find_block(self, item)
   1934 
   1935     def _find_block(self, item):
-> 1936         self._check_have(item)
   1937         for i, block in enumerate(self.blocks):
   1938             if item in block:

/usr/lib/python3/dist-packages/pandas/core/internals.py in _check_have(self, item)
   1941     def _check_have(self, item):
   1942         if item not in self.items:
-> 1943             raise KeyError('no item named %s' % com.pprint_thing(item))
   1944 
   1945     def reindex_axis(self, new_axis, method=None, axis=0, copy=True):

KeyError: 'no item named RECORDING_SESSION_LABEL'

简单地做就可以print(samples)得到打印整个表的预期输出,并带有第一列及其标题。尝试打印任何其他列(即,完全相同的代码,但用“
REFTDING_SESSION_LABEL”替换为“ LEFT_GAZE_X”)可以正常工作。此外,标题似乎已被正确读取,并且pandas将“
RECORDING_SESSION_LABEL”识别为列名。在读取到以下内容后,可以通过使用.info()方法并查看示例的.columns属性来证明这一点:

>samples.info()

<class 'pandas.core.frame.DataFrame'>
Int64Index: 28 entries, 0 to 27
Data columns (total 7 columns):
RECORDING_SESSION_LABEL    28  non-null values
LEFT_GAZE_X                 28  non-null values
LEFT_GAZE_Y                 28  non-null values
RIGHT_GAZE_X                28  non-null values
RIGHT_GAZE_Y                28  non-null values
VIDEO_FRAME_INDEX           28  non-null values
VIDEO_NAME                  28  non-null values
dtypes: object(7)

>print(samples.columns)

Index(['RECORDING_SESSION_LABEL', 'LEFT_GAZE_X', 'LEFT_GAZE_Y', 'RIGHT_GAZE_X', 'RIGHT_GAZE_Y', 'VIDEO_FRAME_INDEX', 'VIDEO_NAME'], dtype=object)

使用ipython的制表符补全时,会发生另一种与我相关的错误行为,这使我可以将样本列视为属性来访问。它适用于除第一列以外的所有列。即
按下Tab键>samples.R仅显示提示samples.RIGHT_GAZE_X samples.RIGHT_GAZE_Y

那么,为什么在查看整个数据帧时它表现正常,但是即使试图以其名称正确读取第一列,但尝试访问其名称却失败了?

关注者
0
被浏览
139
1 个回答
  • 面试哥
    面试哥 2021-01-29
    为面试而生,有面试问题,就找面试哥。

    听起来您只需要从文件开头有条件地删除BOM。您可以使用围绕文件的包装器来执行此操作,如下所示:

    def remove_bom(filename):
        fp = open(filename, 'rbU')
        if fp.read(2) != b'\xfe\xff':
            fp.seek(0, 0)
        return fp
    
    # read_table also accepts a file pointer, so we can remove the bom first
    samples = pd.read_table(remove_bom('~/datafile.txt'))
    
    print(samples['RECORDING_SESSION_LABEL'])
    


知识点
面圈网VIP题库

面圈网VIP题库全新上线,海量真题题库资源。 90大类考试,超10万份考试真题开放下载啦

去下载看看