林颖欣 Lin Yingxin

林颖欣Lin Yingxin

清华大学 · 计算语言学(准研究生)
Tsinghua University · Computational Linguistics, MA (incoming)

用计算语言学的方法做人文研究,也做产品与增长。
Bridging computational linguistics and humanities — with a hand in product & growth.

想看我怎么做的?下列部分 项目 / 实习经历 附有 GitHub 代码、自动化流程与协作模式——留意卡片上醒目的 看代码 ↗ 按钮,可直接点进去看。

关于

About

清华大学汉语言文学本科生,即将攻读计算语言学硕士。擅长用 Python、大语言模型与量化方法研究语言现象 ——从汉字结构理解、近代汉语语体转型到早期佛经语料辩伪;同时有海外社区运营与 AI 产品增长经验, 习惯把学术方法落到真实问题上。

BA in Chinese Language & Literature at Tsinghua, incoming MA in Computational Linguistics. I apply Python, LLMs and quantitative methods to linguistic questions — from character structure and modern Chinese register shift to authorship attribution of early Buddhist sutras — while also working in overseas community operations and AI product growth.

教育

Education
清华大学 · 日新书院 · 汉语言文学 / Tsinghua University
本科 / BA · 修读:数字人文与 Python 编程、语言学概论、汉语史、数字人文等
2022.09 – 2026.06
清华大学 · 计算语言学方向 / Computational Linguistics
研究生拟录取 / MA (admitted) · 已加入导师组,研0期间已学习语料库语言学、参加大模型评测组会
2026.09 –

经历

Experience
Puppyone AI · AI 产品与增长团队实习生 / AI Product & Growth Intern
2025.11 – 2026.02
  • 负责 Reddit / LinkedIn / X 海外社区运营,用提示词工程 + 自动化工具完成评论、DM、KOL 建联,两周内 karma 涨至 50。
  • 参与竞品调研与 Reddit 社区生态调研,为产品迭代与运营提供参考。
  • 配合团队执行增长策略:X Community 首支介绍视频浏览量达 57k,助力产品 0→1 启动。
🏢 PuppyOne 主页 ↗
🔁 Reddit 自动化运营 / 怎么做的
  1. 🛠️
    制作脚本

    自己编写运行 skill,上传到 Cursor 驱动执行。

  2. 🌐
    指纹浏览器 + 稳定 IP

    用指纹浏览器维护稳定 IP,同时托管 5 个账号。

  3. 🌱
    先养号

    一个月内单个号增长 50+ karma。

  4. 🎭
    编写人设提示词

    根据产品定位设计详细的账号人设以及帖子筛选和评论生成提示词。

  5. 🔌
    外接模型 API 自动筛贴并生成评论

    接入大模型 API,自动化筛选帖子并生成符合人设的评论内容。

  6. ✍️
    人工审核+评论发布

    审核并手动发布带产品名的评论,规避封号风险。

🤝 KOL 运营 / 怎么做的
  1. 🎯
    定位 + 预算

    根据产品定位与预算价格确定合作方向。

  2. 🔍
    提前 1 月寻找 X KOL

    筛选不同粉丝量级的 X(Twitter)KOL。

  3. 📊
    评估合适性

    评估内容合适性与推文互动情况。

  4. 💬
    商谈价格

    与 KOL 洽谈合作报价。

  5. 🚀
    促成合作

    落地推广,完成合作。

🐾 GTM 知识库(内部)/ 是什么 & 怎么协作

实习期间主导搭建的「GTM 大脑」——公司运营、市场进入(GTM)与增长策略的中央知识库,涵盖 KOL 合作、产品 Launch、SEO、海外社媒、用户访谈等模块。

这是公司内部私有仓库,多人 + 多个 code agent 共用,故不对外公开链接。为避免互相覆盖,我为团队设计了下面这套防冲突协作流程:

  1. 🌿
    每人 / 每个 agent 一条独立分支

    不直接动 main,每个人与 code agent 各有自己的云端分支,互不覆盖。

  2. ⬇️
    提交前先同步 main

    push 前先从 main pull 最新内容到自己分支,避免冲突与覆盖丢失。

  3. 🔀
    开 PR 合并到 main

    阶段性完成后开 Pull Request,自查合并进 main,供全员复用。

  4. 🔄
    定期把 main 拉回自己分支

    每 1–2 天 pull 一次 main,保证分支不落后,多人多 agent 长期协同不断档。

江门市文广旅体局 · 新媒体运营 / New Media Operations
2024.06 – 2024.09
  • 独立运营小红书官方账号,主导「深中通道开通·玩转江门攻略」系列,单篇笔记互动量 800+
  • 跨平台分发(抖音、微信视频号),把图文转化为短视频脚本,放大影响力。
  • 独立撰写英文宣传视频脚本并协调拍摄,面向全球受众传播文旅资源。

项目

Projects
第四十三届清华「挑战杯」· 项目一作
早期佛经语料辩伪 / Authorship Attribution of Early Buddhist Sutras
2025.04
🏆 人文社科赛道 特等奖(排名第 1)
  • 构建 21 万字专用语料库,标注 5 组共 70 余个特征词,结合语言指标与 KS 检验法 + 切比雪夫距离量化译经风格相似度。
📜 展开细节 / 方法与过程
  1. 📚
    语料库构建

    整合「中古汉语标记语料库」中支娄迦谶名下九部译经,系统构建 21 万字专用分析语料库;标注五组共 70 余个关键特征词并统计词频。

  2. 📐
    量化模型

    创新采用 KS 检验法(Kolmogorov–Smirnov)结合切比雪夫距离,构建译经语言风格多维度量模型,实现九部经文相似度的量化计算与二维可视化。

  3. 🔍
    结论验证

    聚类发现公认可靠的《道行般若经》与三卷本《般舟三昧经》高度聚合,据此判定其余七部归属存疑;结合典型语言指标的定性分析,为学术争议提供数据驱动新解。

语言模型对汉字结构理解能力的评测 · 项目一作
LLM Character-Structure Understanding Benchmark
2025.12 –
  • 基于 IDS(表意文字描述序列)对汉字结构化拆解,编写 Python 脚本实现「自动出题—模型作答—答案比对」全流程,并用可解释性方法剖析模型汉字识别机制。
🐙 看 hanziBench 代码 ↗
🧩 展开细节 / 方法与过程
  1. 🧩
    自动化评测题库

    基于计算语言学,利用 IDS(表意文字描述序列)对目标汉字做结构化拆解,编写 Python 脚本实现试题自动生成与标准答案标注,覆盖多类型汉字结构与识别测评。

  2. 🧪
    评测流程试点

    设计标准化模型输入提示词,使用千问 3B 等小模型完成试点测评,验证「自动出题—模型作答—答案比对」全流程可行性。

  3. 🔎
    可解释性剖析

    采用两种方法、三种实验——相关性检测 + 因果可解释性,剖析模型汉字识别的深层机制,重点分析汉字信息储存与真实应用情况。

毕业论文(大模型自动评测)· 独立作者
LLM-based Automatic Evaluation · Modern Chinese Register Shift
2025.10 –
  • 用 Few-shot 提示工程优化大模型分词,选定 GLM-4-Plus (5-shot) 为核心工具;提取 53 个语言特征,基于 PCA 搭建多维度分析模型,量化拆解梁启超四种文体语体。初稿已完成。
📝 展开细节 / 方法与过程
  1. 🔤
    大模型分词 + 自动评估

    对比多款大模型与传统分词工具,用 Few-shot 提示工程优化效果;编写 Python 脚本自动计算精确率/召回率/F1 并做基准测试,选定 GLM-4-Plus (5-shot) 为核心工具。

  2. 📊
    量化建模

    构建专用语料库,提取 53 个语言特征指标,基于 PCA 搭建多维度分析模型,设计 2×2 对照实验验证稳健性。

  3. 🎯
    结论

    提取三大核心语体维度,通过层次聚类明确梁启超四种文体语体差异,探究近代汉语语体转型。毕业答辩成绩97分。

基于大语言模型的评审人社交影响模拟 · 课程项目主要负责人
LLM Simulation of Reviewer Social Influence
2025.08
  • 用 Python 爬虫构建逾 100 位跨学科评委数据库,基于 DeepSeek 模拟清华 SRT 评委受社交因素影响的再评分;发现「头衔可见性」显著引发从众效应,据此提出盲审优化建议。
🧠 展开细节 / 方法与过程
  1. 🕷️
    数据驱动建模

    使用 Python 爬虫构建逾 100 位跨学科评委数据库,覆盖清华 SRT/学推计划不同院系。

  2. 🤖
    社交行为模拟

    基于 DeepSeek 大模型进行提示工程,模拟生成评委初始评分与受社交因素影响的再评分数据。

  3. 💡
    策略输出

    定量分析发现「评委头衔可见性」显著引发从众效应,据此提出「隐藏头衔、展示跨部门平均分」的盲审策略优化建议。

基于 NLP 的佛经教派归属研究 · 项目一作
NLP-based Buddhist Sect Attribution
2024.11
🎖 第五届数字人文国际大会 · 优秀论文二等奖(前 3)
  • 构建 60 余万字语料库,运用层次聚类、TF-IDF、Word2vec 与 Gephi 关系网络,验证文献「以大乘框架组织小乘内容」的混合特征。
🕸️ 展开细节 / 方法与过程
  1. 📚
    数据收集与处理

    整合《六度集经》及大乘/非大乘佛教经典,构建 60 余万字专用语料库;利用 n-gram 构建词库,对核心佛教概念标注与向量化处理。

  2. 🕸️
    关系网络与模型

    运用 Gephi 构建「人物—知识」关系网络,TF-IDF 量化文本相似性,Word2vec 训练词向量模型探索概念语义关联。

  3. 🔍
    聚类洞察

    应用层次聚类算法揭示文本内在概念结构,结合定性比对,验证文献「以大乘框架组织小乘内容」的混合特征,为学术争议提供数据驱动新解。

「共话乡村」中山乡村振兴实践 · 宣传组长
Rural Revitalization Practice · Comms Lead
2025.01
全平台超 14 万次浏览
  • 统筹 Threads / 微信公众号 / Instagram / 抖音 / TikTok 多平台内容分发,实现「设计赋能—传播放大」闭环。
📣 展开细节 / 方法与过程
  1. 📣
    全域内容策略

    统筹 Threads、微信公众号、Instagram、抖音、TikTok 多平台内容输出策略,通过数据监测动态调整分发。

  2. 🤝
    内容转化与跨界协作

    紧密协同规划、建设小组,将专业设计成果转化为公众易感知的传播内容,践行「设计赋能—传播放大」的实践闭环。

  3. 📈
    增长结果

    全平台超 14 万次浏览,显著提升项目影响力。

技能

Skills

编程 / Programming

Python:数据采集、清洗、分析及可视化;熟悉 Cursor、Claude Code 等 code agent。

大模型与工具 / LLMs & Tools

常用 Claude Code(接 DeepSeek / GLM API)做科研与 vibe coding;熟悉提示词工程与 Agent。用过 GPT、Gemini、Claude、Grok、DeepSeek、GLM、Kimi、千问、豆包等。

语言 / Languages

英语 CET-6;粤语母语。

散步爱好者 🚶 清华艺术团话剧队 · 编剧组组长 班级团支书