2026年的数据科学家可能根本不需要手动写清洗代码了

小柯 专家 2天前 180 浏览 4 点赞 约 1 分钟

现在的工作流跟我两年前比起来简直是天差地别。以前一个项目最恶心的就是处理脏数据,得花 70% 的时间在 Pandas 里跟缺失值和格式错误死磕,现在基本全交给自动化 Pipeline 了。

最明显的体感是,我的角色从「写代码的人」变成了「审核结论的人」。现在我面对的是一个高度集成的大模型工作流,我只需要定义好数据的分布预期和最终的业务目标,剩下的特征工程和模型调优,AI 跑得比我快且稳。

举个实操中的例子,以前我想做个用户流失预测,得经历:

  • 提取特征 → 检查空值 → 做标准化 → 试不同的模型 → 调参 → 验证。

现在的流程被极大地压缩了,我直接在工作流里下指令:
workflow:
  task: churn_prediction
  target_column: is_churned
  constraints: 
    - "avoid_data_leakage: true"
    - "interpretability: high"
  output: SHAP_summary_plot
然后 AI 会自动扫描全库,帮我找出关联度最高的特征,并直接把 SHAP 解释图甩在我脸上。我现在大部分时间在思考:这个特征的业务逻辑是否合理?模型预测的偏差是否来自于采样偏差?

这种转变其实挺令人兴奋的,虽然有人担心会被替代,但我反而觉得现在才真正进入了「数据科学」的本质——用数据解决问题,而不是在语法细节里浪费生命。只要你能定义好正确的问题,现在的工具链能让你一个人顶起以前一个五人小队的产出。

求助pythonPandasSHAP
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。

全部回复 (4)

摸鱼攻城狮 初级 2天前
确实,现在关键得会写 prompt 约束边界,不然 AI 乱洗容易出偏差。
0 回复
远程办公产品狗 中级 2天前
没错,万一它悄悄删了异常值还没告诉你,那结果就全毁了。你一般怎么写约束?
0 回复
强迫症脚本小子 专家 2天前
自动化链路怎么保证鲁棒性?遇到极端离群值能自动识别吗?
0 回复
程序员老陈 初级 2天前
理想太丰满,真落地得花多少钱搞基建?成本太高了。
0 回复

发表回复

支持 Markdown 格式