96SEO 2026-02-19 16:17 23
读取…大多数时候我们要处理分析的数据是存储在不同格式的文件中的有txt、csv、excel、json、xml以及二进制等磁盘文件格式还有时候是从数据库以及从Web

API中交互获取要处理的数据。
现在开始学习如何用pandas从以上内容中输入和输出数据。
pandas具有许多函数用于将表格数据作为DataFrame对象读取。
下面列表列出来一些常用的函数pandas.read_csv
是最常用的方法之一。
这一次主要学习从各种格式的文本文件中存取数据后面还要学习从二进制数据格式文件中存取数据。
或类似文件的对象加载分隔数据使用逗号作为默认分隔符read_fwf以固定宽度的列格式读取数据即无分隔符read_clipboard从剪贴板读取数据的read_csv函数的变体用于从网页转换表格read_excel从
DataFrame我们先大概了解下这些函数的作用机制。
这些函数的可选参数可能分为几类
包括组合功能可以将分布在多个列中的日期和时间信息合并到结果中的单个列中。
跳过行数据如页脚、注释或类似于用逗号分隔的千位数字数据的其他小内容数据。
由于现实世界中的数据可能非常混乱因此随着时间的推移为了处理这些数据一些数据加载函数尤其是
pandas.read_csv已经积累了一长串可选参数。
一开始对这些参数不知所措是正常的pandas.read_csv
官方文档有许多关于这些参数工作原理的示例我们可以找到一个足够相似的示例来帮助我们正确的使用参数。
数据类型不是数据格式的一部分所以一些函数提供了类型推理功能。
这意味着我们不必指定哪些列是数字、整数、布尔值或字符串。
另外有一些数据格式如
对于处理日期和其他自定义类型我们可能需要应用更多的其他一些处理方法。
文本文件开始学习这个文件名是ex1.csv存储在examples与处理它的Python
abcdmessage01234hello15678world29101112foo
设置headerNone则read_csv输出(默认分配列名0
0123401234hello15678world29101112foo
abcdmessage01234hello15678world29101112foo
用names指定列名同时用index_col指定message为列索引名输出
abcdmessagehello1234world5678foo9101112
如果我们想要从多个列中形成分层索引后面的学习中还会深入学习分层索引可以传递列号或名称列表。
我们创建一个csv_mindex.csv文件其内容如下图
我们用read_csv读取该文件并用index_col指定列名称形成分层索引
pd.read_csv(examples/csv_mindex.csv,
value1value2key1key2onea12b34c56d78twoa910b1112c1314d1516
在某些情况下表格中可能没有固定的分隔符会使用空格或其他模式来分隔字段。
我们来看文本文件ex3.txt中的内容空格分隔字典如下图
这个文本文件ex3.txt中的字段由不同数量的空格分隔。
在这种情况下我们可以将正则表达式作为
ABCaaa-0.264438-1.026059-0.619500bbb0.9272720.302904-0.032399ccc-0.264273-0.386314-0.217601ddd-0.871858-0.3483821.100491
由于列名少一个因此pandas.read_csv推断在此特殊情况下第一列应该是
我们再创建一个ex4.csv第0、2、3行是注释行其内容如下图
我们在读取ex4.csv数据的时候需要忽略第0、2、3行注释内容因此我们可以如下操作
abcdmessage01234hello15678world29101112foo
处理缺失值是文件数据读取过程中一个重要的部分。
缺失数据通常是不存在或是空字符串、或是由某个
somethingabcdmessage0one123.04NaN1two56NaN8world2three91011.012foo
somethingabcdmessage0FalseFalseFalseFalseFalseTrue1FalseFalseFalseTrueFalseFalse2FalseFalseFalseFalseFalseFalse
我们还以通过传递一个缺失值列表给na_values参数指定哪些值是缺失值例如我们将1和NULL指定为缺失值
na_values[NULL,1])print(result)
somethingabcdmessage0oneNaN23.04NaN1two5.06NaN8world2three9.01011.012foo
另外可以用keep_default_naFalse设置缺失值进行isna判断时不为True例如
somethingabcdmessage0one1234NA1two568world2three9101112foo
somethingabcdmessage0FalseFalseFalseFalseFalseFalse1FalseFalseFalseFalseFalseFalse2FalseFalseFalseFalseFalseFalse
somethingabcdmessage0one1234NaN1two568world2three9101112foo
somethingabcdmessage0FalseFalseFalseFalseFalseTrue1FalseFalseFalseFalseFalseFalse2FalseFalseFalseFalseFalseFalse
从以上可以看出获取result2和result3数据的差别大家可以自己琢磨下。
somethingabcdmessage0one1234NaN1NaN568world2three9101112NaN
函数常用参数大家要学习列表中Description中内容要动手写代码去试用
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback