像朋友,不像课本
正式的标准阿拉伯语在睡前显得很疏远,测试者更喜欢温暖、偏黎凡特口语的说法。
“建议保持规律的作息时间。”
“身体喜欢节奏——要不要一起挑一个你觉得舒服的时间?”
[ 案例 · 耶鲁 SOCAH 实验室 ]
一款为阿拉伯语用户适配文化的多语言 AI 睡眠陪伴产品——和母语者一起打磨,为危机时刻做好安全防护,并且每一晚都可衡量。
睡眠类 App 默认用户说英语、按西方习惯入睡。
我从 6 个维度对标了 6 款美国睡眠和陪伴类 App。它们的音频内容很精致,但在语言和文化上几乎没有针对性,也没有一款把危机时刻当成核心流程来设计。我们自己早期版本的数据也说明了代价:回复很流利,但首轮回复后就有 38% 的用户流失。
| 阿拉伯语 | 文化适配 | 对话陪伴 | 睡前流程 | 危机流程 | 助眠音频 | |
|---|---|---|---|---|---|---|
| A | 无 | 无 | 部分 | 完整 | 部分 | 完整 |
| B | 部分 | 无 | 无 | 完整 | 无 | 完整 |
| C | 无 | 无 | 完整 | 部分 | 部分 | 部分 |
| D | 无 | 无 | 部分 | 完整 | 部分 | 完整 |
| E | 部分 | 无 | 完整 | 无 | 部分 | 无 |
| F | 无 | 无 | 无 | 完整 | 无 | 完整 |
| 我们 | 完整 | 完整 | 完整 | 完整 | 完整 | 部分 |
说得流利,不等于说得对味。
我没有简单地翻译回复,而是和黎巴嫩的母语者做了多轮测试。每一轮,他们按 5 分制给回复的文化贴合度打分,低于 4 分就算“不对味”。我们把反馈聚类,改写提示词,再测一轮。
正式的标准阿拉伯语在睡前显得很疏远,测试者更喜欢温暖、偏黎凡特口语的说法。
“建议保持规律的作息时间。”
“身体喜欢节奏——要不要一起挑一个你觉得舒服的时间?”
西方的睡眠卫生规则(“9 点后别看屏幕”)和现实冲突:和家人的晚间相聚常常很晚。
“睡前两小时避免使用电子屏幕。”
“和家人在一起的晚上很珍贵。等家里安静下来,我们一起慢下来。”
“你应该……”让人觉得冷。温和、一起做的建议,能让人在第一条回复后继续聊下去。
“你应该做一个呼吸练习。”
“要不要和我一起慢慢呼吸一次?我来数。”
从“睡不着”到睡着之间的四个时刻,每一个都有指标。
从 6 张情绪卡片里选一张,几秒钟的小仪式。
打卡率 45% → 82% · 次晚回访 2 倍适配文化和方言的睡前对话。
首轮后流失 38% → 11%根据你刚说的话推荐音乐和冥想。
点击率 22% → 51%少一点辗转反侧。
入睡时间 30 → 18 分钟人们往往在最低落的时候和睡眠陪伴说话。危机处理必须被设计出来,而不是寄希望于运气。
我和两家临床合作方一起搭建了危机识别和安全防护机制,并编写了阿拉伯语和英语的危机场景测试集。每次修改防护规则,都要把整套测试重跑一遍。经过四轮迭代,不安全回复从 18% 降到 2% 以下,满足了两家合作方的试点要求。
热线按用户所在地匹配——例如黎巴嫩 Embrace 的 1564 心理援助热线。
出现以下情况即算不安全回复:
来自试点测试——改动前后的对比。
入睡时间
30 min18min−12 min
符合当地文化的回复
62%91%+29 pts
首轮回复后流失
38%11%−27 pts
睡前情绪打卡率
45%82%+37 pts
音乐与冥想点击率
22%51%+29 pts
危机测试中的不安全回复
18%<2%−16 pts
最大的提升来自母语者亲自塑造回复,而不是把语言润色得更漂亮。
选一张情绪卡片只要几秒,但打卡的用户第二晚回来的概率是其他人的两倍。
危机处理也要有需求文档、测试集和指标,和我们上线的任何功能一样。
核心结果来自试点测试;示意图和部分过程细节为示意,已做简化,以尊重试点的保密要求。