blog-checklisted
Install: claude install-skill shaokeyibb/anti-asu-skills
# /blog-check:技术输出原创性核验
候选人在简历里放博客链接,是在主动提供一份"技术深度的样本"。核验它的价值在于:**博客比简历更难包装**——简历可以逐字打磨,而一篇技术文章要在几千字里持续伪装出不存在的理解,成本高得多。
反过来说,博客也是交叉印证简历的好材料:文章里提到的踩坑、时间、技术栈,可以和简历上的经历互相验证。
## 边界
- 只读候选人主动提供的链接。**不搜索候选人在其他平台的账号**,不追踪其网络身份。
- 只核验**技术内容**。博客里的生活记录、观点表达、个人心情、政治或宗教内容——一律跳过,不读、不记、不写入报告。看到时主动忽略。
- 抄袭判定门槛要高。技术写作中大量内容天然相似(同一个 API 的用法、同一份官方文档的翻译、同一个经典算法的讲解),**相似不等于抄袭**。
- 博客更新少、写得浅、停更多年——**都不是负面信号**。写博客是额外付出,不写是常态。这一维度只在候选人主动展示时才核验。
## 核验流程
### 第零步:先核验形容词,不是数量
**这是最容易跳过、也最致命的一步。**
当 claim 形如「**原创** 200+ 博客」「**独立完成** N 个项目」「**主导** X 次重构」时——**修饰语才是承载分量的部分,数量只是陪衬**。
> 核验"384 > 200"**不等于**核验了这条 claim。
> 如果 384 篇里大量是转述而被标为原创,那么「原创 200+」这条 claim 就是**不成立的**,哪怕数字远超。
**纪律**:拆开每条复合 claim,**先判修饰语,再看数量**。修饰语不成立时,数量成立不能挽救该 claim。
### 第一步:抽样(样本量必须随语料规模缩放)
**绝不能对任何规模的博客都只抽 3—5 篇。**
#### 样本量下限
| 文章总数 | 首轮最小样本 |
| --- | --- |
| < 30 | 5 |
| 30–100 | 10 |
| 100–300 | 15 |
| > 300 | **20,且必须覆盖每个内容板块** |
#### 分层抽样(关键:必须抽到"大宗")
抽样最容易犯的错,是只抽**亮点**而漏掉**主体**。以下四层**缺一不可**:
| 层 | 抽法 | 为什么必须抽 |
| --- | --- | --- |
| **A. 大宗连载**(占比最高的系列) | 从最大的 1—2 个系列中**随机**抽 5—8 篇 | **这是判断整体性质的唯一依据。**大宗决定博客的真实构成 |
| **B. 高流量篇** | 阅读量最高的 3—5 篇 | 高流量常来自热门八股题,也是搬运高发区 |
| **C. 项目复盘篇** | 与其自有项目对应的 2—3 篇 | 最可能原创,用于确认"确有原创部分" |
| **D. 随机对照** | 全量列表中**纯随机**抽 3—5 篇 | 对冲前三层的选择偏差 |
> ⚠️ **原先的抽样标准(最相关 / 最长最硬 / 最新)系统性偏向 C 层**——也就是最可能原创的那批。只按那三条抽,等于把视线从大宗上移开。**C 层现在只占四层之一。**
#### 升级规则(强制)
> **首轮样本中若有 ≥2 篇命中搬运特征,必须扩大样本至 2 倍并重抽,不得直接下结论。**
>
> 扩样后若命中率仍 ≥30%,结论应指向**系统性**而非"偶发",并在报告中给出**命中率**("扩样 N 篇,M 篇命中,命中率 X%"),而不是笼统的定性词。