华体会科技有限公司_华体会体育官方网站_华体会HTH数据服务

您当前所在的位置: 首页 > 资讯动态 > 行业资讯

资讯动态

News

分类>>

mathor大佬聊赛事:处理「微博立场检测」赛事数据比模型重要

2026-09-07 20:28:43
浏览次数:
返回列表

  我现在就读于武汉一所普通高校,大四,今年 6 月份毕业,然后参加了 20 年的研究生入学华体会体育考试。我的本科是软件工程专业。

  mathor:这已经是我第二次参赛。第一次参赛是在 19 年暑假,那是一场高校大数据挑战赛,赛题是广告点击预测。那一场赛题比较简单,尤其数据字段较少,不需要运用很复杂的特征工程,非常适合当时的我。

  AI 研习社:比起其他 NLP 赛事,你认为“微博立场检测”有何不同之处?它是怎么影响你的答题思路的?

  mathor:首先,“微博立场检测”赛事的字段较少,意味着我们不需要做复杂的特征工程,对新手较友好。

  最后,正因为数据量较少,所以许多大佬惯用的深度学习方法,如 bert、lstm 等,使用后效果可能不是很好。反而是对模型了解较少,但是非常擅长处理数据的同学,会有更好的成绩。

  AI 研习社:所以说你在上周五的 PPT 里着重强调了“数据清洗”的作用,这一块方便细谈一下吗?

  mathor:这次比赛的数据都是中文的,相比英文而言,中文数据的清洗过程更复杂。

  首先你得分词,这里就会面临很多问题,比如不同分词工具的效果不一致,而且不存在分词 100% 正确的工具。

  其次,分完词后,你还将面临各种乱七八糟的字符,如网址、验证码、表情和中文标点符号,这些实际上没什么意义,如果可以过滤掉这些,肯定会对结果产生很大的影响。

  假设现在有一个非常干净的数据样本,随便带入一个机器学习的模型,得出的结果不一定比非常乱的样本带入深度学习模型的效果差。

  mathor:采取 fasttext 的原因是它非常简单,随便调一下就能用,这样我可以把更多精力集中在数据处理上。(mathor 大佬参赛baseline:)

  AI 研习社:你的 PPT 里还提到一点,就是要善用分词工具的语料库,这一块又是基于什么考量呢?

  mathor:像我前面说过的,不存在 100% 分词正确的分词工具,所以应该要想尽办法提高分词的准确度。

  假设分词不正确,后面的过滤可能就会出现问题——比方说很多同学会过滤掉长度等于 1 的字符,但是如果一开始分词的时候就不准确,结果过滤的时候把一些重要的信息过滤掉了,对结果肯定有影响。

  mathor:我基本上很少保存资料,都是需要用到的时候才 Google ,查不到了再来问人。

mathor大佬聊赛事:处理「微博立场检测」赛事数据比模型重要(图1)

  AI 研习社:你的AI 基础知识也是自学的吧?有没有什么较好的网站或课程推荐?

  mathor:我的个人博客网址是,里头主要更新自然语言处理、算法等技术方面的内容,少量写一些个人感悟之类的。

  AI 研习社:还有哪些关于“微博立场检测”的关键信息,是我的问题没问出来,你认为有必要跟大家强调的?

  mathor:现在比较流行集成模型,有时间的大佬可以尝试建立多个模型,然后做个简单的投票,或者stacking之类的,或许有奇效。毕竟那么多比赛,那么多人都在用。

  这是模型方面,数据处理方面我就不多说了,已经快要接触到我的方法的核心了(笑)。

  同时不要过分相信验证集的分数,很可能不准,所以一定要有自己预判分数的方法,什么方法都行;

href=""

搜索