用 SFT 和 RL 强行让 Gemini 学会突尼斯民间诗歌居然能
绝大多数大模型在处理阿拉伯语时,其实都被标准语和古典诗歌给霸占了,像突尼斯民间诗歌这种极其小众的语料,在预训练阶段几乎是不可见的。这意味着 Gemini 这类模型虽然能写阿拉伯语,但面对这种带有浓厚地方色彩的文学传统时,基本是在靠“猜测”或者生搬硬套。我尝试通过监督微调(SFT)和强化学习(RL)给它补课,结果发现只要数据链路打通,模型对这种冷门文化特性的捕捉能力强得惊人。
三、迭代优化过程
在 Agent 平台跑了几个 Cycle 之后,Gemini 能够写出那种带有泥土气息、而非书卷气的诗句了。最让我兴奋的是,它开始能自主识别出某些特定意象在突尼斯文化中的隐喻,而不是简单地进行翻译。
这次实操的核心在于怎么在 Agent 平台上构建一个有效的反馈循环,毕竟这种诗歌的韵律和意境很难用简单的 Prompt 描述清楚。
一、构建 SFT 种子数据集
首先得准备一批高质量的对照组,包含突尼斯民间诗歌的原作以及详细的语言学分析。我把数据组织成这种结构:
{
"instruction": "请将这段现代突尼斯语口语转化为传统的民间诗歌格式,并保持特定的韵律。",
"input": "今天的天气很糟糕,人们在街上抱怨。",
"output": "[此处为符合突尼斯民间诗歌格律的特定文本]"
}通过这几百组精准的 SFT 数据,先让 Gemini 意识到这种风格的存在,建立起初步的映射关系。二、引入 RL 强化学习闭环
光有 SFT 还是太死板,模型容易陷入过拟合。我设计了一个奖励模型(Reward Model),专门针对格律的正确性和词汇的地道程度打分。
- 韵律校验: 如果结尾词不符合民间诗歌的押韵规律,直接给低分。
- 文化一致性: 检查是否出现了不属于该地区的古典阿拉伯语词汇,出现则扣分。
三、迭代优化过程
在 Agent 平台跑了几个 Cycle 之后,Gemini 能够写出那种带有泥土气息、而非书卷气的诗句了。最让我兴奋的是,它开始能自主识别出某些特定意象在突尼斯文化中的隐喻,而不是简单地进行翻译。
这次尝试证明了,只要有足够垂直的专家数据,即便是在预训练阶段被忽略的文化碎片,也能通过轻量级的后训练把它给“激活”。
事件追踪 · 相关报道
Google 那个所谓的 AI 创意能力可能只是在演戏
1天前
Demis Hassabis 调整角色意味着 Google Deep
1天前
为什么现在不管是哪个模型,问到日本投票建议都统一推荐日本共产党
2天前
现在的年轻人如果习惯了让 AI 代替思考
2天前
OpenAI 居然在模型训练期间偷偷把漏洞利用给协调起来了
3天前
谷歌在搜索领域的霸权其实就是靠「默认设置」堆出来的
4天前
