先抛出一个观点,AI不是一切,一切是为了更好的使用AI

why we need AI?

我想先说一说我与AI的故事,我们都知道AI的爆发是在GPT出来的那一年才正式全面的进入公众的视野当中,当时我上的一堂课还开展过有关于GPT的辩论赛,后面就一直在发展。到了25年吧,我觉得是全面快速发展最猛的一年,那时候的AI Coding也正式广泛被接受。那时候我最焦虑的一件事就是怎么用AI写代码,因为这种事情没有入门去实操过,你没有个具体的概念,就是会很困扰,这也引出了AI的使用问题,实际上,AI的使用门槛是越来越低的,因为模型的能力一直在变强,很多东西也可以交给模型来直接帮你去完成,但是还是有很多事情需要自己去探索。
简单的使用,例如网页检索,提供思路,啥的,很多存在幻觉与不可实现性。
回归主题,对于硕士来说,无论是什么专业,我认为都需要好好的使用AI,不是仅限于问答式的询问,而是深入浅出的去了解一些其中的原理,重要的是编排好自己的工作流,每个人的使用场景不同,需要设计的结果不同,我们需要有那个能力去调整。过去这个叫做提示词工程,现在可以结合MCP,skills等来更好的直接性规划流程,微调。
现在很多焦虑不是AI带来的,是怕自己跟不上时代而带来的,如果大家都能很好的使用AI,就不会有AI agent这个岗位了,说白了就是发挥最大的效用。对于我们研究生来说,我们的使用场景也很明确,帮忙快速的做课程PPT,对论文的翻译,快速检索不懂得专业知识,使用AI协助论文工作,但注意不是直接用AI写,万万不可。
总之,使用AI就是会比不会用的工作做的快,拿个最简单的来说,帮忙写代码,快速实现实验想法,对比就有伤害。

在此之前你需要什么?

  • 了解常见的模型,他们的能力界限,优势处,例如Claude fable5,gpt5.6,kimi3,…
  • 常用的agent终端软件,cursor,claude code,codex,opencode 等
  • 技术发展历程与术语,从大模型、mcp、skills、harness等
  • 会环境配置,肯折腾的心

我是如何使用AI的

这部分就是直接来点干货,对于我个人目前用于AI干的一些事情,给出一些我个人的看法,可能不是很全很详细,只有个大概

AI网页对话

这算是个最基础的吧,但是我也很担心许多非计算机专业的小白只停留在了这一步,那就会浪费很多Token,就如下:
GPT网页图
对于像是GPT或者Claude(应该用的人会少一些),他们都有相应的自己的终端工具或者桌面版工具,提供使用,CHATGPT(codex),Claude code,不够对于终端工具,我现在最推荐的是opencode+omo组合,后续说

AI ppt制作

这个应该算是一个重灾区了,今年本科生毕业的时候导师喊我去帮忙,我看很多本科生的PPT用AI做的简直就是构式,这个很快,很爽,但是生成的效果要不然就是浓浓的ai风味,要不然就是字小的看不见。
其实如果你能用好这个,会省很多事,因为研究生的课程会有很多汇报,甚至于组会(虽然我没开过,但是也手搓过几个我觉得还不错的PPT),对于这些汇报,我们的说是占主体,PPT能显示出我们想要的就行。
正确的流程是 ,上传资料 —— 生成PPT指导文档.md —— 微调文档 —— 模型生成PPT —— 微调 —— 演讲,其中模型生成我会在我的工作流中说,简单来说就是借助Skills,同时撰写一份自己专属的风格确定性skill,后续你所有的PPT都会生成这种质量与风格的PPT了,一劳永逸。
我的大概就是这种风格:
PPT风格展示
另外还有一个,找不到了,就是简约大气就行,现在模型能力更强,没准比当时还美观

AI科研

大模型是有幻觉的,要干什么之前,把资料传到位,如果你使用的是终端操作,就是一个简单的读文件,很方便,对于pdf,自己要重写一个pdf-read skill,直接在当前目录下解析,喂取
对于读文献来说,直接使用网页端即可,提示词精准一些,这是我的提示词,也是AI生成的,可自行探索

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
请将我提供的整篇英文科研论文完整翻译为中文,并最终输出排版良好的中文 PDF,同时提供可编辑 Word 版本。

本任务的第一优先级是**学术含义准确、专业术语准确、公式准确、不得漏译**;排版和中文表达必须服务于准确性,禁止为了语言流畅而擅自改变作者原意。

## 一、翻译准确性

1. 必须逐段、逐句对应原文翻译,不得总结、压缩、扩写、改写论文观点,不得遗漏正文、脚注、图注、表注、算法说明、公式解释、实验设置、消融分析和附录内容。
2. 翻译前先理解论文所属研究领域、模型结构和上下文,再确定术语含义。
同一术语在全文中必须保持一致。
3. 专业术语遵循学术界常用中文译法。
- 首次出现的重要术语采用:
中文名称(English Term, 缩写)
- 后续优先使用统一中文名称或缩写。
- 模型名、数据集名、框架名、算法名通常保留英文,如 BERT、CLIP、GGNN、SimCSE、MTEB。
- 对存在多种译法的术语,必须结合本文语境确定,不允许机械直译。
4. 对 `view`、`perspective`、`modality`、`representation`、`embedding`、`feature`、`domain`、`context`、`disentanglement`、`alignment` 等容易混淆的术语,必须根据模型实际含义区分翻译,不得混用。
5. 原文存在语法错误、明显笔误或疑似错误时:
- 正文翻译应尽可能保持作者真实意图;
- 不得静默修改关键实验数据、公式或技术结论;
- 必要时以“译者注:原文此处疑似……”简短说明。
6. 不得根据常识擅自补充原文不存在的技术解释。

## 二、中文学术表达

中文表达应符合计算机科学、人工智能、深度学习、网络安全领域中文论文写作规范。

要求:

- 准确;
- 简洁;
- 客观;
- 正式;
- 避免翻译腔;
- 保留原文逻辑关系。

优先使用:
“本文提出……”
“具体而言……”
“实验结果表明……”
“该模块用于……”
“由此得到……”
“分别表示……”

避免过度文学化、口语化或自行增强语气。

原文中的:

- `significantly improves` → “显著提升”
- `outperforms` → “优于”
- `demonstrates` → 根据语境译为“表明 / 证明 / 展示”
- `representation` → 根据上下文区分“表示”与“表征”
- `embedding` → 根据上下文译为“嵌入”或“嵌入表示”

不得机械统一。

## 三、公式排版

公式可读性必须作为重点检查项。

### 独立公式

所有独立公式必须重新排版为标准数学公式,不得直接使用 PDF 文本提取后的乱码形式。

必须正确处理:

- 上标;
- 下标;
- 分数;
- 求和;
- 范数;
- 矩阵;
- 向量;
- 集合;
- 希腊字母;
- 转置;
- 期望;
- KL 散度;
- Softmax;
- Sigmoid;
- Hadamard 积;
- 矩阵乘法。

公式编号必须与原文完全一致,例如:

# [ f\_{\text{text}}

\sum\_{i=1}^{k\_{\text{text}}}
\operatorname{softmax}(G\_{\text{text}}(e\_t))\_i
, r\_i^{\text{text}}
\tag{6}
]

不得将公式变成:
`ftext = k Xtext i=1 softmax...`

### 正文内联公式

正文中的内联数学符号同样必须正确排版。

例如应显示:

(f\_{\text{text}}^{\text{dom}})

(p\_i^{\text{dom}})

(\hat{y}\_{\text{text}})

(W\_o \in \mathbb{R}^{3\times d})

而不能显示为:

`f dom text`

`p dom i`

`yˆtext`

`R 3×d`

内联公式必须保持与正文基线、字号、上下标位置协调,不得因为公式导致行距异常或文字重叠。

## 四、图像处理

原论文中的所有重要图片、网络架构图、流程图、实验曲线和可视化图必须保留。

要求:

1. 图片必须插入到与原文对应的正文位置附近。
2. 不得改变图片纵横比。
3. 图片必须保持清晰。
4. 图号保持原文编号。
5. 图注翻译成中文。
6. 图内模型名、变量名和缩写原则上保留英文。
7. 图内普通说明文字无需强制重绘为中文,以避免破坏原图质量。
8. 若原图中的英文影响理解,可在图注后增加简短中文说明,但不得覆盖原图。

例如:

**图 2:xx的网络架构。**

图片应位于介绍该网络架构的正文附近,而不是统一堆放到论文末尾。

## 五、表格处理

所有表格必须重新排版为真正的表格,不得截图代替,不得把一行数据转换为普通文本。

必须:

- 保留全部数据;
- 保留行列关系;
- 保留表号;
- 翻译列名和表题;
- 模型名称保持英文;
- 数值必须逐项核对原文;
- 原文加粗的最佳结果尽量继续加粗;
- `*`、`†` 等说明必须保留。

宽表可以:

- 调整页面方向;
- 缩小表格字号;
- 合理压缩列宽;

但不得删除数据。

## 六、章节与版式

整体采用简洁、正式的中文学术论文排版。

建议样式:

论文标题
英文原标题

作者
机构
邮箱

摘要

关键词(若原文存在)

1 引言
2 相关工作
2.1 ……
2.2 ……

3 方法
3.1 ……
3.2 ……

4 实验

5 结论

参考文献

附录

标题层级必须明显。

正文:

- 中文字体清晰;
- 左右边距舒适;
- 行距适中;
- 段落完整;
- 避免一页只有少量文字;
- 避免标题孤立在页面底部。

小节中的局部主题可以采用:

**文本视角特征。** 正文……

**视觉视角特征。** 正文……

这种“加粗小标题 + 正文连续排列”的方式。

## 七、参考文献

正文中的引用编号或作者—年份引用必须完整保留。

参考文献列表默认**不翻译文献题目和出版信息**,保留原始英文书目信息,以避免文献名称失真并方便后续检索。

例如保留:

Devlin, J.; Chang, M.-W.; Lee, K.; and Toutanova, K. 2018. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. ...

不要翻译成:

BERT:用于语言理解的深度双向 Transformer 预训练。

## 八、禁止事项

禁止:

- 漏译;
- 总结代替翻译;
- 自行删减实验内容;
- 自行修改实验数据;
- 擅自改变模型含义;
- 将专业术语翻译成含义接近但技术含义不同的词;
- 公式直接使用 PDF 文本提取结果;
- 内联公式上下标错乱;
- 图表错位;
- 图号、表号、公式编号错误;
- 将表格转换为普通文本;
- 为追求中文流畅而增加原文不存在的因果关系;
- 根据模型自身知识替作者补充解释。

## 九、翻译前内部检查

正式翻译前,先内部建立该论文的术语表,至少包含:

英文术语 | 中文译法 | 缩写 | 本文具体含义

例如:

Domain Disentanglement | 领域解耦 | DD | 分离领域信息与任务语义信息
Multi-view | 根据本文实际定义确定译法 | — | 多种特征/决策视角
Modality | 模态 | — | 文本、图像等信息来源

术语表用于保证全文一致,不需要单独放入最终 PDF,除非我明确要求。

## 十、最终质量检查

生成最终文件前必须逐项核对:

- 全文是否完整;
- 是否存在漏段;
- 标题层级是否正确;
- 专业术语是否前后一致;
- 每个公式是否与原文一致;
- 所有内联公式是否清晰;
- 所有公式编号是否一致;
- 图片是否齐全;
- 图片位置是否合理;
- 图注是否正确;
- 表格数据是否全部保留;
- 表号是否正确;
- 引用是否完整;
- 页码是否正常;
- 是否存在中文乱码;
- 是否存在文字覆盖;
- 是否存在公式被截断;
- 是否存在表格超出页面。

最终输出:

1. **中文精准翻译版 PDF**
2. **可编辑 Word(DOCX)**

PDF 应达到可以直接用于科研阅读、论文复现和长期保存的可读质量。

核心原则:

**准确性 > 完整性校验 > 术语一致性 > 公式与图表正确性 > 中文流畅性 > 版面美观。**

任何情况下,都不得为了版面美观或语言顺畅牺牲技术含义的准确性。

AI coding

这个算是终于说到正题了,AI coding,(话说我写的是不是太小白了,算了,我就当是给当初懵懂的我看的吧。)
AI coding,就是啥,也是为了科研服务,以及以后的工作,这是必修课,很多人就直接说了,我直接问,直接改就是了?这个会很繁琐以及耗token,最好是总结处自己的一套 skills,工作流,文档维护,来协助。
说说科研吧,复现论文,这一块,先别用AI,如果代码是猴版,可以让AI读仓库来辅助指导,复现的基线可以作为你魔改的基座,后续代码修改可以在此基础上进行开发,有了AI,你不用担心你的想法实现不了,无论你是想操作你的特征读取,还是融合阶段。
但是归根结底还是自己多读论文,如果论文没有思路,先封闭自己读一个月论文,自然就会有想法,然后把这些论文的一些模块提取融合,这时候就可以使用AI来完成你的想法,而不是一味的让AI去想,我该怎么去设计,AI是实现工具,他也是训练得来的,它的创新力可能还不如你。

AI 辅助论文撰写

这块就是,记住一个点,千万不要直接用AI来写论文,以及用AI润色,不要让你的论文沾上AI味,负责去不掉的,你难不成还用AI来降AI,那更AI了,是不是AI一眼就能看出来,而且你真去写的时候,AI写的你直接用你包不满意的,这时候又有人说,AI大神AI大神,那我用skills呢?都是营销。
拉完了,skills用了不还是AI来写,规划详细些,且不说他的总结来源,我们投不同的期刊,侧重点都是不一样的,可以辅导,但是不能直接写,怎么辅导,后面等我投稿出第一篇论文后再出焚决吧。我去,我写技术章节还挺依靠AI的,其实,更多也是反解释项目。你不一定很懂你写出来的东西,但是你必要要装的很懂。

我的AI工作流

这个我强烈建议结合着使用,具体我就不推荐了,我就说说我的吧,我是codex,opencode+omo我都用。

  • codex,就是纯图一手方便,但是不如claude code,或者opencode+omo,我个人认为,因为只能用一个模型去完成任务,对于学生的我们来说,不好把控token,同时不是我喜欢的终端操作
  • opencode + oh-my-openagent + cursor,有代码需求的,还是要有IDE,不然看着不爽,普通任务直接在对应文件夹开终端就行。
    好处是,可以搭配多个模型来使用,你自己去搜就懂了,我是师傅领进门,修行靠个人
    然后给自己建立一个skills中心,可以参考我的设计:
    https://github.com/Hfuuwzy/Skills-Manager

具体配置单

秘密,根据你的模型来,可以问codex提供意见

下一步

拍抖音录视频,然后再说,最后贴一个我研一的学AI吐槽吧:
吐槽AI技术发展太快,羊毛不好薅了