96SEO 2026-08-10 03:58 21
痛点 1:刚接触 Python 数据分析时常常不知道该选哪个库、怎么快速上手,导致大量时间浪费在查文档上。
痛点 2:创建数组或 DataFrame 时经常出现维度不匹配、类型错误等报错,调试成本高。

痛点 3:缺失值、重复数据、列名不统一等脏数据处理不熟悉,导致后续模型训练质量受影响。
# =============================================
# NumPy 数组创建大全
# =============================================
import numpy as np
# 1️⃣ 从列表创建一维数组
arr1 = np.array
print # out:
# 2️⃣ 创建二维数组
data =。]
arr2 = np.array
print # out:
# 3️⃣ 用元组创建 array
arr3 = np.array)
print # out:
# 🎯 常用全零/全一矩阵
zeros = np.zeros) # 三行两列的全0矩阵
ones = np.ones) # 三行两列的全1矩阵
# 🎲 正态分布随机数 & 均匀分布随机数
rand_norm = np.random.randn # 标准正态分布
rand_uni = np.random.rand # 均匀分布
# 🆔 单位矩阵
eye = np.eye
print
痛点解决:通过上述示例,你可以快速定位「需要哪种形状」还有「对应函数」——避免维度不匹配的报错。
# =============================================
# NumPy 主要操作示例
# =============================================
import numpy as np
arr = np.arange.reshape #,]
print
# ✅ 属性:维度、形状、元素个数、数据类型
print # 输出维度个数
print #
print # 总元素数
print # int64
# 🔎 布尔索引
mask = arr % 2 == 0 # 筛选偶数
even_numbers = arr
print
# 🎯 高级花式索引:乱序取行/列
rows = arr。:] # 第三行 + 第一行
cols = arr] # 第四列 + 第一列
# 🔄 转置 & 矢量化运算
transposed = arr.T # 行列互换
scaled = arr * 2 # 所有元素乘以2
# 📊 常用数学函数
print)
print)
print)
print)
# 🧭 where:条件选择
x = np.arange
y = x * -1
cond = x> 2
result = np.where
print
# 📈 排序 & 堆叠
sorted_arr = np.sort # 按列升序排序
hstacked = np.hstack)
vstacked = np.vstack)
痛点解决:掌握布尔索引和 np.where 能让你“一行代码”完成复杂筛选,省去循环写法导致的慢速执行。
# =============================================
# Pandas Series 基础示例
# =============================================
import pandas as pd
ser = pd.Series
print
# 检查缺失值 & 获取底层 NumPy 数组
print)
print
# 自定义索引并演示标签访问
ser_named = pd.Series
print # 输出:200
# 常用方法:加法运算会自动对齐索引
added = ser + ser_named.reindex
print
痛点解决:Series 的自动对齐特性可以帮助你在合并不同来源的数据时避免手动对齐造成的错误。
# =============================================
# Pandas DataFrame 全面实战
# =============================================
import pandas as pd
import numpy as np
# 📥 从字典创建 DataFrame
data = {
再看"city","year":,"population": # 单位:万人
}
df = pd.DataFrame
print
# 👉 查看单列 / 多列
col_year = df
col_multi = df]
# 🔎 花式索引:loc 与 iloc
row_slice_loc = df.loc # 包含结束位置,因为是标签切片
row_slice_iloc = df.iloc] # 按位置切片,不含结束位置
# ✏️ 增删改:
df = # 新增列。长度需匹配
df.drop # 删除列
df = # 添加新列
def add_one: return x + 1 # 自定义函数示例
df = df.apply
# 📊 排序:
df_sorted_idx = df.sort_index # 按行索引升序排序
df_sorted_val = df.sort_values
# 🗂️ 去重 & 检查重复:
unique_cities = df.unique
df_no_dup = df.drop_duplicates
duplicates_mask= df.duplicated
# ⚠️ 缺失值填充:
df_missing = pd.DataFrame({
再看'A','B':
})
df_missing.fillna,inplace=True) # 均值填充 A 列
df_missing.fillna # 前向填充 B 列
# 🔄 映射转换:
grade_map ={90:'优秀',80:'良好',70:'及格',60:'不及格'}
scores_df =
gdf =pd.DataFrame
gdf=gdf.map)
print
痛点解决:通过 .fillna,.drop_duplicates,.map 等技巧,你可以一次性完成大多数“脏数据”处理任务,而不是在每一步都手动编写繁琐代码。
from functools import reduce
numbers =
plus_two = # list comprehension 同 map
even_numbers = # filter 的等价写法
total_sum =) # 累加求和
print
print
print
痛点解决:Pandas 已经内置了向量化方法,但当你只想对纯 Python 列表做快速转换时lambda+map/filter 能让代码更简洁且执行更快。
import pandas as pd
import numpy as np
pd.set_option # 禁止科学计数法显示大整数
#########################################
## 模糊匹配 & 正则搜索
#########################################
cities=pd.DataFrame({
'name'这方面,,'score':
})
contain_ang=cities.str.contains]
start_S=cities.str.contains]
print;说起来,print
#########################################
## groupby 聚合分析
#########################################
sales=pd.DataFrame({
再看'city'。'sales':,'year':
})
city_sum=sales.groupby.sum
city_stats=sales.groupby.agg
multi_group=sales.groupby.sum
print;print,print
#########################################
## merge 数据关联
#########################################
users=pd.DataFrame
scores=pd.DataFrame
inner=pd.merge # 内连接。只保留都有 id 的记录
left=pd.merge # 左连接,左表全部保留
print;print
痛点解决:以上技巧覆盖了「从字符串筛选到聚合再到表关联」的完整工作流,让你在实际项目中只需复制粘贴即可快速得到干净可用的数据集。
💡 小结:掌握了这篇文章提供的 Numpy 基础矩阵操作 + Pandas 数据清洗/聚合技巧就能轻松应对大多数「数据读取慢」「维度报错」「缺失值处理」等常见痛点。建议把本页收藏为「Python 数据分析速查表」。每次写脚本前先翻阅,一键定位所需函数!
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback