查看: 1539| 回复: 3
跳转到指定楼层
上一主题 下一主题
收起左侧

Pandas DataFrame + Autocomplete 爆内存

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
本帖最后由  gjia0214 于 2020-5-10 09:40 编辑

大家在支持autocomplete的IDE上或者jupyter notebook上用pandas的DataFrame的时候,有遇到过内存爆掉的情况吗?

我在pycharm和jupyter notebook上用pandas的DataFrame,每次代码提示功能被trigger的时候,内存就会暴涨(突然爆增3-4倍),稍微大点的dataset (load之后占3-4g内存) 内存就会爆掉。google上好像也有遇到类似状况的,但并没有找到解决方案。
难道是autocomplete会memory leak?



上一篇:无人车自动驾驶技术选择
下一篇:Android开源项目在线卑微求star
推荐
spilt-over 2020-5-10 11:22:12 | 只看该作者
全局:
我看VS Code的开发人员的说法是,靠静态分析非常难,要么分析不全要么爆内存,但是Jupyter这种用Python写出来的(真的假的)编辑器可以直接访问到ipython的context,所以会好一些。

评分

参与人数 1大米 +1 收起 理由
flounderpounder + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

全局:
嗯。。。 个人理解就是你很难用pandas 处理和分析比较大的数据。原理来说就是你个人电脑的ram和python的性能限制让你的内存占用极大并且无法完整处理数据。 我记得python 有一个package叫dask可以load大的文件。或者用chuncksize去限制每次处理的数据。
最暴力的方法就是用Spark。

评分

参与人数 1大米 +1 收起 理由
flounderpounder + 1 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
 楼主| flounderpounder 2020-5-11 06:04:58 | 只看该作者
全局:
chenwang9527 发表于 2020-5-11 03:54
嗯。。。 个人理解就是你很难用pandas 处理和分析比较大的数据。原理来说就是你个人电脑的ram和python的性 ...

说的有道理,感觉可以先用Spark做preprocessing和feature engineering,然后再上模型。
最近学了点spark,感觉他们家的api设置的很清晰,比pandas用户体验好。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表