为什么要试 Gemini CLI
我的日常工作有一类固定任务:每季度把从不同系统导出的招聘数据清洗合并,做成给管理层看的分析报告。
以前的流程:
- 手工在 Excel 里处理数据格式
- 用 Python(或者请同事帮忙写)做统计计算
- 手写分析报告
Gemini CLI 的潜力在于:它可以读取整个 CSV/Excel 文件(免费版 100 万 token 上下文),然后你直接用自然语言告诉它做什么。
安装和配置
前提:电脑上装了 Node.js(18 版本以上)。
npm install -g @google/gemini-cli
安装完后验证:
gemini --version
认证:
gemini auth login
会跳出浏览器让你用 Google 账号登录,完成后回到终端。
免费版使用 Gemini 1.5 Flash,够用了。如果要用 Pro 版本,需要配置 API Key:
export GEMINI_API_KEY=你的key
基本用法:处理 HR 数据文件
查看文件内容和基本统计:
gemini "这个 CSV 文件里有几列,每列的数据类型是什么,有没有空值?" --file recruitment_data.csv
数据清洗:
gemini "这个文件的'招聘渠道'列有很多不一致的写法,比如'BOSS直聘'和'boss直聘'是同一个,帮我统计各渠道的候选人数量,忽略大小写差异" --file recruitment_data.csv
生成分析摘要:
gemini "根据这份招聘数据,生成一份 Q4 招聘总结,包括:总投递量、各部门开放职位、平均在招周期、各渠道转化率。用中文写,格式适合粘贴到 PPT。" --file q4_recruitment.csv
实际测试:一份 2000 行的招聘数据
测试文件: 全年招聘数据,2147 行,15 列,包含候选人来源、投递日期、面试阶段、录用结果等字段。
任务 1:数据质量检查
gemini "检查这份数据的质量:有哪些列有空值,比例是多少?日期格式是否一致?有没有明显的错误值(比如面试日期早于投递日期)?" --file hr_data.csv
用时约 15 秒,找出了:
- 「录用结果」列有 23% 空值(正常,在招中的记录)
- 3 条日期逻辑错误的记录
- 「部门」列有 4 种不同的写法指向同一个部门
任务 2:各渠道转化率分析
gemini "计算各招聘渠道从投递到 offer 的转化率,按转化率降序排列,给出每个渠道的投递量和最终 offer 数" --file hr_data.csv
结果准确,和我手工 pivot 的结果一致。
任务 3:生成报告
gemini "根据这份数据,写一份 600 字左右的 Q4 招聘分析报告,包括亮点、问题和建议,用管理层能看懂的语言" --file hr_data.csv
生成的报告质量不错,作为初稿直接用,改了约 30%。
坑点
坑 1:不支持直接输出文件。
Gemini CLI 的输出都在终端,要手动复制粘贴。处理结果不能直接「保存为新 CSV」,这点比 Python 脚本麻烦。
解决方法:
gemini "分析结果" --file data.csv > output.txt
把输出重定向到文本文件,再手动处理。
坑 2:复杂计算偶尔出错。
让它做「同比增长率」这类跨时间段的计算,有时结果不对,要求它「展示计算过程」来核验。
坑 3:中文文件名路径有时报错。
文件名改成英文或拼音可以解决。
坑 4:大文件响应慢。
2000 行还好(15-20 秒),如果是 10000 行以上,等待时间明显变长。
和 Python 脚本的对比
| 场景 | Gemini CLI | Python 脚本 |
|---|---|---|
| 临时查数 | 快,直接问 | 要写代码,慢 |
| 批量自动化 | 不适合 | 适合 |
| 数据清洗 | 能用,但要核验 | 更可靠 |
| 生成文字报告 | 很适合 | 要单独写报告 |
| 数据安全 | 要注意(联网) | 本地,更安全 |
结论
Gemini CLI 适合「临时、一次性、需要解释性输出」的 HR 数据任务。如果你会用命令行但不会 Python,它能帮你完成以前只能靠求人的数据分析工作。
如果你的数据分析任务高度重复、需要自动化定期跑,还是老老实实写 Python。两者不是替代关系,是互补的。