说话,看似毫不费力,但其实是人类最复杂的认知活动之一。在过去几十年里,研究人员试图澄清言语表达(又称为“语言产生”)背后的认知架构和动态加工过程。近日,中国科学院心理研究所助理研究员冯臣、研究员屈青青与合作者在Nature旗下的《科学数据》(Scientific Data)发表汉语语言产生数据库。
已有的研究显示,世界上大约有7000种语言,不同语言的词汇、语音、字形系统大相径庭。现有的实证研究与理论框架主要基于印欧语系。与印欧语言不同,汉语有独特之处。
首先,汉语属于汉藏语系,是一种声调语言,同一个音节的不同音调表示不同的词汇与意义,大多数印欧语言则不使用声调来区分词义。其次,印欧语言采用字母拼写系统,而汉语采用非字母书写系统。另外,汉语的语音与字形的对应关系较为复杂,例如,声音“shu”可以对应“书”“梳”“树”或“薯”等多个不同的字形。因此,汉语研究对回答跨语言普遍性和特异性具有独特价值和贡献。
虽然一些研究已经表明,音位是印欧语言语音编码的主要加工单元,而音节是汉语语音编码的主要加工单元,但目前大部分关于语言产生的研究侧重于印欧语言,而对于汉语这一非印欧语言的研究则相对有限。
冯臣和屈青青等人发现,这些研究主要关注于口语产生过程,对于书写等字形产生的关注则明显不足。同时,许多研究依赖于较小的样本量和有限的实验刺激,这可能导致统计效力不足和研究结果的可重复性问题。构建汉语语言产生数据库的需求与日俱增。
此次发表的汉语语言产生数据库记录了667名被试在7种不同语言产生任务中的约20万个试次的反应时间,以及实验材料的多个语言学变量,如词频、字频、音节频率、习得年龄等。
据介绍,该数据库为研究汉语口语和书写产生的语言加工提供了丰富数据资源,为探索汉语产生的普遍性与特异性提供了数据基础。此外,该数据库对于开发汉语语言产生的人工智能模型具有独特价值与贡献,有望推动语言认知科学与人工智能领域的交叉与共同进步。
相关论文信息:https://doi.org/10.1038/s41597-024-03022-8
人类蛋白质KRAS(蓝色)与其伴侣之一RAF1(黄色)相互作用的三维图。图片来源:西班牙巴塞罗那基因组调控中心 科技日报北京12 科技日报北京12月18日电 (记者刘霞)据美国趣味科学网站17日报道,美国科学家近日利用水下扬声器与一头名叫吐温的座头鲸 习近平总书记强调,要加大应用基础研究力度,以推动重大科技项目为抓手,打通“最后一公里”,拆除阻碍产业化的“篱笆墙”,疏通 “忙”,已经成为很多科研人员的常态,他们忙着很多事,唯独很难静下心来忙学问。 中国科学院院士刘忠范将很多被迫忙碌 省教育厅关于下达2024年普通高校“专转本”计划的通知 苏教学函〔2023〕22号 各有关高校: 根据《省教育厅关于做好2024年 关于发布“2023年度华夏建设科学技术奖”授奖项目的公示 华夏奖字〔2023〕第4号 各有关单位: 2023年度华夏建设科学技术 。本文链接:汉语语言产生数据库发表http://www.sushuapos.com/show-11-3286-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 科学家发现肠道菌群衍生的新型促血栓物质