学习,是在这个世界唯一可以通过自我努力拥有的力量
知乎精选

用 Agent 自动扒了一遍知乎推荐系统领域的大V——然后我发现了一些反常识的事

2026年8月23日 · 拾叁 · 阅读(3)

导语

做技术调研的时候,我经常遇到一个问题:一篇论文、一个数据点,到底该信谁?

同样一个 OneReason 的解读,有人写得像新闻稿,有人写得像自家工程复盘,有人纯粹把 arXiv abstract 翻译了一遍。这三种内容质量天差地别,但它们都挂在知乎上,都叫”专栏文章”。

所以我做了个实验:让 agent 把知乎推荐系统领域的大V全部扒一遍,不光看他们写了什么,还要交叉验证他们到底是谁、在哪上班、有没有真东西。 跑了 5 轮迭代之后,我得到了一个 1285 人的用户图谱、13 人的深度 profile,还有几个跟直觉完全相反的结论。

这篇文章把整个方法论拆给你看。


一、为什么要用 agent 做,而不是手动翻

手动找人这件事,效率低且容易漏。你从一个高质量专栏作者出发,点进他的关注列表,看到 30 个人名,再点进去看他们的文章……这是一个典型的图遍历问题,天然适合 agent。

但单纯让 agent 去爬,会爬出一堆噪声。真正的难点不在”抓数据”,而在三件事:

1. 怎么从噪声里筛出”强相关用户”(这个领域真做的人 vs 顺路关注的吃瓜群众)

2. 怎么判断一个人的”工业实战含金量”(真在职推荐算法工程师 vs 纯论文翻译博主)

3. 怎么在不碰隐私的前提下,把一个人的真实身份尽量还原(公司、真名、学历、公开联系方式)

这三个问题,对应的就是接下来三部分内容。


二、网络构建:从 1 个账号到 1285 人,用了 5 轮迭代

2.1 起点:只看一个人关注谁,是远远不够的

我从自己的知乎账号出发(关注了浅梦、九老师等 19 人)。第一轮 v1,只抓了 2 个数据源,得到 28 人。这时候能看到的,只有”我圈子里的我圈子”。

真正的网络是多跳的。所以我做了 5 轮 BFS 扩展,每一轮的核心策略都不一样:

Notice: 数据源编号背后是不同的”跳数”。v4 抓李沐、田渊栋这些顶级大 V 的关注列表,本质是 4-5 跳——从我的账号出发,要经过”我关注的人 → 他关注的人 → 那个人关注的人”好几层,才能触及。单靠手动翻根本翻不到。

2.2 一个反常识的结论:跨源越多,越是真核心

把 1285 人按”出现在多少个数据源里”统计,会得到一个非常长尾的分布:

这里有一个特别重要的发现:关注数最高的王喆(14 万关注),并不是网络中心;只有 2 万关注的九老师,才是跨 7 源的绝对中心。

为什么?因为”被多少人关注”反映的是知名度,”被多少个独立的信息源覆盖”反映的是在这个专业圈子里被多少个同行认可。九老师虽然关注数只有王喆的 1/7,但他被GuoXun、程引、0xC001、傅聪、萧瑟等 5个推荐圈核心人物同时关注——这些人彼此并不互相关注,但他们都关注了九老师。这种”多源汇聚”才是判断专业影响力的硬指标。

> 这对算法人来说应该不陌生:PageRank 的核心思想就是”被重要节点指向的节点更重要”,而不是”被越多节点指向越重要”。 关注数是 in-degree,跨源数才是某种近似的影响力传播值。
>
>

2.3 正向网络 vs 反向网络:一个 ROI 的血泪教训

v5 我抓了 4 个核心节点的”关注者”(followers,反向网络),原本以为能挖出隐藏的算法专家。结果被现实打脸了:

反向网络 80% 是匿名、低活跃、非技术的用户。它的唯一价值是偶尔能挖到”不写专栏、不答题,只是默默关注了大 V 的一线工程师”——比如我从一个反向网络里挖到了一个 B 站算法工程师和一个字节 MLSys 员工,他们都不产出内容。

结论:做这种网络分析,优先正向 BFS,反向 followers 只在有明确目标时用。这个教训我花了整整一轮迭代才想明白。


三、Profile 深度提取:怎么在不碰隐私的前提下,还原一个人的真实身份

抓到名单只是第一步。更有意思的是——这些”知乎大 V”到底是谁?

3.1 知乎 profile API 是个金矿(但都是用户自己填的)

知乎的 `/api/v4/members/{id}` 接口,只要带上登录态,能拿到结构化的字段:

– `employments`:工作经历(公司 + 职位)

– `educations`:教育背景(学校 + 专业)

– `badge`:认证徽章(如”阿里巴巴 大模型算法专家”)

– `description`:个人简介(很多人在这里留邮箱/微信/GitHub)

这些信息全部是用户主动填的,所以读取它们没有任何伦理问题。一轮抓下来,我就纠正了好几个之前的认知错误:

3.2 真名怎么确认:从”论文解读”到”开源署名”的交叉验证

这是整个流程里最有意思的部分。知乎 ID 是匿名的,但一个人如果有自己的开源项目、PyPI 包、学术论文,他就一定会在某处用真名署名。这些都是他自己公开的行为,不是隐私挖掘。

我用四种方式交叉验证,成功率差别很大:

最有成就感的两次:

一次是浅梦。他的知乎没写真名,但我顺着他 profile 里的 GitHub 链接找到 `shenweichen`,再查他开源的 DeepCTR 在 PyPI 上的包信息——Author 字段白纸黑字写着 `Weichen Shen`。三重互证(GitHub profile name=weichen + PyPI Author=Weichen Shen + AlgoNotes 仓库自述”浅梦学习笔记”),姓氏确定是沈。

另一次是 GuoXun。他的知乎文章里提到自己开了个开源框架 AgenticRec,贴了 GitHub 链接 `github“.com/guoxun/AgenticRec`。点进去,profile name 是 `Guo Xun`,README 第一句就是 `Hi there, I’m Guo Xun.`,而且 profile 里还挂了知乎 `guo-xun-16` 的链接互证。全链路闭合。

3.3 哪些人确认不了:刻意匿名的,要尊重

Notice: 不是所有大 V 都应该被”挖”出来。

九老师就是典型。他的 GitHub(qqhard)profile 完全空白,没名字、没 bio、没 location,只挂了一个 zero-claw 项目。这显然是主动选择匿名。对这种刻意匿名的人,正确做法是停下——他不想让人知道他是谁,那就别再往下挖了。

同样确认不了的还有 DOTA(公司从没公开过)、州懂(某大厂,具体哪家不公开)、0xC001(http://MLPOD.COM 匿名运营)。这些人的共同点是:只做内容输出,不挂自己的学术身份或开源项目。没有可交叉的公开署名,就证不了,这很正常。

我给自己定的红线是:只用作者主动公开的信息,从 ID 推测的真名一律标”未证实”,电话、住址、身份证、中文汉字名推测这些一律不碰。 这条线不守,agent 很容易就变成 doxxing 工具。


四、工业经验真实性分级:哪些大 V 是”真做的人”,哪些是”论文搬运工”

这是整个分析里最有实用价值的部分——同样是”知乎推荐领域大 V”,含金量可以差出一个数量级。

4.1 五条硬证据

我列了 5 条判断标准,满足越多越偏工业实战:

1. profile employments 明确大厂在职 + 推荐岗(badge 认证 > 自填)

2. 有自研产出(开源项目/论文/发明,非翻译)

3. 文章是原创系统设计/工程实践,不是”分享一篇论文”格式

4. 团队负责人/ED/专家 title

5. 发过内推/招聘(在职硬证据)

4.2 三个梯队的结论

按这套标准,13 个推荐领域大 V 被分成了三类:

第一梯队 · 真·工业实战派(6 人):王喆、傅聪、浅梦、九老师、GuoXun、程引。这 6 个人共同的特点是“都有自己的东西”——王喆有书,傅聪发明了 OnePiece,浅梦写了 DeepCTR,九老师是 TikTok 团队负责人,GuoXun 开源了 AgenticRec,程引在做架构层的原创抽象。从他们文章里能学到”怎么干”。

第二梯队 · 在职但偏内容输出(4 人):0xC001、几野、疯刀、Keep Learning。他们确实在公司上班(0xC001 有阿里 badge,几野在字节),但文章主要是论文跟踪。0xC001 写了 262 篇文章,基本全是”论文标题:XX,论文链接:XX”——他的内容角色是”论文雷达”,不是”实战者”。

第三梯队 · 纯论文解读/竞赛派(3 人):DOTA、州懂、mqfcu7。这三位公司从没公开过,也没有自己的论文或开源项目,文章是纯粹的 arXiv 翻译。州懂 104 篇文章全是”大家好,我是州懂,分享一篇 XX 论文”的固定格式。

4.3 一个实用的识别口诀

判断一个推荐领域博主是真工业还是纯搬运,看两件事就够了:

– 文章标题里有没有”分享一篇论文”(有 → 多半是翻译)

– 有没有自己的开源仓库或论文署名(没有 → 多半是搬运)

Notice: 这里有个反常识的点——“在职”不等于”真工业”。0xC001 是阿里在职专家,但他的 262 篇内容全是论文跟踪;而程引虽然粉丝不多,但他写的”推荐系统效率与流量解耦”系列是真架构思考。判断含金量,看产出,不看头衔。


五、几个值得展开的反常识发现

5.1 关注数第一的人,不是网络中心

前面讲过,王喆 14 万关注,九老师 2 万关注。但九老师跨 7 源,王喆只跨 4 源。在一个专业圈子里,”被同行认可”比”被大众关注”更能说明这个人的技术地位。 这是网络分析比单纯看粉丝数高明的地方。

5.2 反向网络(followers)是个陷阱

我以为抓”谁关注了大 V”能挖到隐藏的高手,结果 80% 是噪声。正向网络(大 V 关注了谁)的强相关率是反向的 4-10 倍。做网络扩展,优先 BFS 正向,反向只在有明确目标时用。

5.3 最有价值的联系方式,都是作者主动留的

我一共找到 6 个公开联系方式(2 个邮箱、1 个微信、3 个网站/博客)。全部来自作者自己在 profile 简介或文章里留的,没有一个需要去挖。这说明——真正想被联系的人,早就把联系方式公开了;没公开的,就是不想被打扰。 没必要硬挖。

5.4 “论文解读型博主”和”工业实战派”是两个不同的赛道

州懂 104 篇文章、0xC001 262 篇,论产出量他们是顶级。但他们的内容角色是”信息分发节点”,不是”知识生产者”。而傅聪、GuoXun 这种有自研产出的人,文章数量少得多,但每一篇都是自己的工程思考。两个赛道没有高下,但读者需要分清楚自己想看哪种。


六、Agent 工作流的完整拆解

最后把整个流程固化成一套可复用的方法论,给想复现的人参考:

“`Plain Text
[1] 种子选取
└─ 从一个高质量账号的关注列表 + 一份高可信技术文档的作者列表出发

[2] 正向 BFS 扩展(核心环节)
├─ v1-v2: 抓核心节点的 followees(关注列表)
├─ v3: 象限覆盖——选不同背景的节点(阿里/字节/学术/海外)
└─ v4: 抓顶级大 V 的 followees(4-5 跳深度)

[3] 强相关过滤
└─ 按 headline/badge 关键词(推荐/算法/搜广推/大厂名)过滤噪声

[4] 跨源统计
└─ 按”出现在多少个独立数据源”排序,找网络中心节点

[5] Profile 深度提取
├─ 知乎 /api/v4/members/{id} 拿 employments/educations/badge
└─ 文章 API 拿最近 8 篇标题+摘要,分析内容风格

[6] 真名交叉验证
├─ GitHub profile name + README 自述
├─ PyPI 包 Author 字段
├─ 书籍 ISBN 作者页
└─ 刻意匿名的 → 停下,尊重

[7] 工业经验分级
└─ 5 条硬证据打分,分出工业实战派 / 内容输出 / 纯解读

[8] 反向网络(可选,ROI 低)
└─ 只在有明确目标(找某公司某人)时用
“`

这套流程的本质是:把”判断一个人靠不靠谱”这件主观的事,拆成了一堆可量化、可溯源的信号。每一个结论都挂在具体的证据上(API 字段、开源仓库、文章口吻),而不是凭感觉。


结语

说实话,做完这一整套分析,我最大的感受不是”发现了多少大牛”,而是——在一个信息过载的时代,能快速分辨”信号”和”噪声”,本身就是一种稀缺能力。

推荐系统领域每天都有新论文、新专栏、新解读。但真正值得长期关注的人,可能就那么十几个。这十几个人共同的标签是:有自研产出、有工业落地、敢公开署名、内容是原创思考。 至于那些一天发 3 篇”论文解读”的博主,留着当论文雷达用就好,别指望从他们那里学到”怎么干”。

agent 帮我把这件事从”凭感觉关注”变成了”用证据筛选”。这个方法论,套到任何一个技术领域(CV、NLP、大模型、infra)都成立。

接下来我可能会把同样的流程跑一遍大模型推理/Agent 领域,看看那边的核心节点是不是又是一批”反常识”的面孔。有兴趣的读者可以等着看。

📎 原文链接:https://zhuanlan.zhihu.com/p/2052179994911171124

← 返回首页