NLP (Natural Language Processing) 是人工智能(AI)的一个子领域。自然语言是人类智慧的结晶,自然语言处理是人工智能中最为困难的问题之一(来自百度百科)。

其中中文更是不好处理。下面将分析中文语句中的时间的识别:time NLP 输入一句话,能识别出话里的时间。下面2种简单的实现方法。

 

1.单词的识别

这种比较简单,比如,今天,明天,下周,下月,明年,昨天,上周,上月,去年等。原理:匹配到明天就根据今天的时间天数加1。
  

/**
* 常用时间枚举
*
* @author xkzhangsan
*/
public enum CommonTimeEnum { TODAY("today", "今天"), TOMORROW("tomorrow", "明天"),
NEXTWEEK("nextWeek", "下周"),
NEXTMONTH("nextMonth", "下月"),
NEXTYEAR("nextYear", "明年"), YESTERDAY("yesterday", "昨天"),
LASTWEEK("lastWeek", "上周"),
LASTMONTH("lastMonth", "上月"),
LASTYEAR("lastYear", "去年"),
; private String code; private String name; public String getCode() {
return code;
} public String getName() {
return name;
} CommonTimeEnum(String code, String name) {
this.code = code;
this.name = name;
} public static Map<String, String> convertToMap(){
Map<String, String> commonTimeMap = new HashMap<String, String>();
for (CommonTimeEnum commonTimeEnum : CommonTimeEnum.values()) {
commonTimeMap.put(commonTimeEnum.getCode(), commonTimeEnum.getCode());
commonTimeMap.put(commonTimeEnum.getName(), commonTimeEnum.getCode());
}
return commonTimeMap;
} public static CommonTimeEnum getCommonTimeEnumByCode(String code){
for (CommonTimeEnum commonTimeEnum : CommonTimeEnum.values()) {
if(commonTimeEnum.getCode().equals(code)){
return commonTimeEnum;
}
}
return null;
}
} /**
* 解析自然语言时间,今天,明天,下周,下月,明年,昨天,上周,上月,去年等。
* @param text 自然语言时间,待解析字符串
* @param naturalLanguageMap 自定义自然语言时间map,其中key自定义,value需为 com.xkzhangsan.time.enums.CommonTimeEnum中的code;
* 可以为空,默认使用com.xkzhangsan.time.enums.CommonTimeEnum解析。
* @return Date
*/
public static Date parseNaturalLanguageToDate(String text, Map<String, String> naturalLanguageMap){
if(StringUtil.isEmpty(text)){
return null;
}
text = text.trim(); boolean isCommonTimeMap = false;
if(CollectionUtil.isEmpty(naturalLanguageMap)){
naturalLanguageMap = CommonTimeEnum.convertToMap();
isCommonTimeMap = true;
}
if(! naturalLanguageMap.containsKey(text) || StringUtil.isEmpty(naturalLanguageMap.get(text))){
return null;
} String targetMethod = null;
if(isCommonTimeMap){
targetMethod = naturalLanguageMap.get(text);
}else{
String code = naturalLanguageMap.get(text);
Map<String, String> commonTimeMap = CommonTimeEnum.convertToMap();
if(commonTimeMap.containsKey(code)){
targetMethod = commonTimeMap.get(code);
}
}
if(targetMethod == null){
return null;
} //执行结果
CommonTimeEnum targetCommonTime = CommonTimeEnum.getCommonTimeEnumByCode(targetMethod);
if(targetCommonTime == null){
return null;
} switch (targetCommonTime){
case TODAY :
return DateTimeCalculatorUtil.today();
case TOMORROW:
return DateTimeCalculatorUtil.tomorrow();
case NEXTWEEK:
return DateTimeCalculatorUtil.nextWeek();
case NEXTMONTH:
return DateTimeCalculatorUtil.nextMonth();
case NEXTYEAR:
return DateTimeCalculatorUtil.nextYear();
case YESTERDAY:
return DateTimeCalculatorUtil.yesterday();
case LASTWEEK:
return DateTimeCalculatorUtil.lastWeek();
case LASTMONTH:
return DateTimeCalculatorUtil.lastMonth();
case LASTYEAR:
return DateTimeCalculatorUtil.lastYear();
default:
return null;
}
} /**
* 明天
* @return Date
*/
public static Date tomorrow(){
return plusDays(today(), 1);
} /**
* 今天
* @return Date
*/
public static Date today(){
return new Date();
}

2.中文语句中的时间的识别

这个是真实语境下的时间识别,比如 Hi,all.下周一下午三点开会,如果今天是2021-06-10 那么 返回结果为:2021-06-14 15:00:00 。

2.1 原理和图解

原理和第一种类似,也是识别时间词语,根据基准时间推断结果,但更强大一些。

基本分为三步:

(1)加载正则文件

(2)解析中文语句中的所有时间词语

(3)根据基准时间,循环解析(2)中的时间词语

详细步骤如图:

                                                              

2.2 相关源码及说明

2.2.1 Time-NLP

github: https://github.com/shinyke/Time-NLP

author:shinyke

由复旦NLP中的时间分析功能修改而来,做了很多细节和功能的优化。

  1. 泛指时间的支持,如:早上、晚上、中午、傍晚等。
  2. 时间未来倾向。 如:在周五输入“周一早上开会”,则识别到下周一早上的时间;在下午17点输入:“9点送牛奶给隔壁的汉子”则识别到第二天上午9点。
  3. 多个时间的识别,及多个时间之间上下文关系处理。如:"下月1号下午3点至5点到图书馆还书",识别到开始时间为下月1号下午三点。同时,结束时间也继承上文时间,识别到下月1号下午5点。
  4. 可自定义基准时间:指定基准时间为“2016-05-20-09-00-00-00”,则一切分析以此时间为基准。
  5. 修复了各种各样的BUG。

简而言之,这是一个输入一句话,能识别出话里的时间的工具。

2.2.2 xk-time TimeNLPUtil

https://github.com/xkzhangsan/xk-time TimeNLPUtil

在Time-NLP基础上做了很多优化:

(1)封装属性,重命名使符合驼峰命名标准。
(2)将加载正则资源文件改为单例加载。
(3)将类按照功能重新划分为单独的多个类。
(4)使用Java8日期API重写。
(5)增加注释说明,优化代码。
(6)修复原项目中的issue:标准时间yyyy-MM-dd、yyyy-MM-dd HH:mm:ss和yyyy-MM-dd HH:mm解析问题。
(7)修复原项目中的issue:1小时后,1个半小时后,1小时50分钟等解析问题;并且支持到秒,比如50秒后,10分钟30秒后等。
(8)修复原项目中的issue:修复当前时间是上午10点,那么下午三点 会识别为明天下午三点问题。
(9)修复原项目中的issue:修复小数解析异常问题。
(10)性能优化,将使用到的正则预编译后放到缓存中,下次直接使用,提高性能。

3 实现方法的局限性

第一种只能识别单词;

第二种也只能识别正则文件中的词语,比第一种识别能力更强,但如果有新的或不常用的时间词语无法处理,比如星期一的同义词礼拜一等,如果要不断支持新的词语,需要不断的修改,不如机器学习好;

对于常用的时间词语识别,第二种已经达到很高的识别率。

4.开发这个功能的原因

第一种实现,因为有网友需要识别中文时间词语,我写了第一种的实现;

第二种实现,另一个网友有需要识别语句中的中文时间词语,他向往推荐了Time-NLP这个项目,说这个项目很好,不维护了,有一些小问题,希望我能参考实现,我研究了原项目代码,在我的项目中重写,优化,并修复了一些问题。

感谢shinyke,这个项目很好,学习到很多正则解析的知识。

源码地址: https://github.com/xkzhangsan/xk-time

Java日期时间API系列39-----中文语句中的时间语义识别(time NLP 输入一句话,能识别出话里的时间)原理分析的更多相关文章

  1. Java日期时间API系列19-----Jdk8中java.time包中的新的日期时间API类,ZonedDateTime与ZoneId和LocalDateTime的关系,ZonedDateTime格式化和时区转换等。

    通过Java日期时间API系列6-----Jdk8中java.time包中的新的日期时间API类中时间范围示意图:可以很清晰的看出ZonedDateTime相当于LocalDateTime+ZoneI ...

  2. Java日期时间API系列11-----Jdk8中java.time包中的新的日期时间API类,使用java8日期时间API重写农历LunarDate

    通过Java日期时间API系列7-----Jdk8中java.time包中的新的日期时间API类的优点,java8具有很多优点,现在网上查到的农历转换工具类都是基于jdk7及以前的类写的,下面使用ja ...

  3. Java日期时间API系列8-----Jdk8中java.time包中的新的日期时间API类的LocalDate源码分析

    目录 0.前言 1.TemporalAccessor源码 2.Temporal源码 3.TemporalAdjuster源码 4.ChronoLocalDate源码 5.LocalDate源码 6.总 ...

  4. Java日期时间API系列12-----Jdk8中java.time包中的新的日期时间API类,日期格式化,常用日期格式大全

    通过Java日期时间API系列10-----Jdk8中java.time包中的新的日期时间API类的DateTimeFormatter, 可以看出java8的DateTimeFormatter完美解决 ...

  5. Java日期时间API系列13-----Jdk8中java.time包中的新的日期时间API类,时间类转换,Date转LocalDateTime,LocalDateTime转Date等

    从前面的系列博客中可以看出Jdk8中java.time包中的新的日期时间API类设计的很好,但Date由于使用仍非常广泛,这就涉及到Date转LocalDateTime,LocalDateTime转D ...

  6. Java日期时间API系列6-----Jdk8中java.time包中的新的日期时间API类

    因为Jdk7及以前的日期时间类的不方便使用问题和线程安全问题等问题,2005年,Stephen Colebourne创建了Joda-Time库,作为替代的日期和时间API.Stephen向JCP提交了 ...

  7. Java日期时间API系列2-----Jdk7及以前的日期时间类在mysql数据库中的应用

    1.java中与数据库相关的时间类 java提供与mysql方便交互的三种数据类型: java.sql.Date java.sql.Time java.sql.Timestamp 它们都是继承java ...

  8. Java日期时间API系列1-----Jdk7及以前的日期时间类

    先看一个简单的图: 主要的类有: Date类负责时间的表示,在计算机中,时间的表示是一个较大的概念,现有的系统基本都是利用从1970.1.1 00:00:00 到当前时间的毫秒数进行计时,这个时间称为 ...

  9. Java日期时间API系列3-----Jdk7及以前的日期时间类的不方便使用问题

    使用Java日期时间类,每个人都很熟悉每个项目中必不可少的工具类就是dateutil,包含各种日期计算,格式化等处理,而且常常会遇到找不到可用的处理方法,需要自己新增方法,处理过程很复杂. 1.Dat ...

  10. Java日期时间API系列7-----Jdk8中java.time包中的新的日期时间API类的特点

    1.不变性 新的日期/时间API中,所有的类都是不可变的,这对多线程环境有好处. 比如:LocalDateTime 2.关注点分离 新的API将人可读的日期时间和机器时间(unix timestamp ...

随机推荐

  1. 如何实现一个php框架系列文章【2】实现类的自动加载

    根据前一篇文章的设计原则,我们暂时把php文件分为3类,类名和文件名都遵守如下约定.   类名 文件名 路径 模型类m {$app}Mod  {$app}.mod.php {$app}/model   ...

  2. iOS-Xcode上传后iTunes Connect构建版本不显示

    在升级到Xcode8版本以后大多数人会碰到这个问题-开开心心开发好一款app以后上传到iTunes后台提交审核,然而iTunes Connect后台活动栏里没有出现我们上传的app,确切的说是显示一会 ...

  3. MATLAB信号与系统分析(三)&mdash;&mdash;连续信号与系统的复频域分析及MATLAB实现

    一.系统的拉普拉斯变换和反变换 1.MATLAB函数 F=laplace(f) %求拉氏变换 f=ilaplace(F) %求拉氏反变换 2.例子 clear all;clc;close all f= ...

  4. hdu 3061 Battle 最大权闭合图

    题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=3061 由于小白同学近期习武十分刻苦,很快被晋升为天策军的统帅.而他上任的第一天,就面对了一场极其困难的 ...

  5. 【Java基础】Jar包结构结构分析和操作具体解释

    作者:郭嘉 邮箱:allenwells@163.com 博客:http://blog.csdn.net/allenwells github:https://github.com/AllenWell 一 ...

  6. 【HDOJ】1501 Zipper

    DFS.注意剪枝,0ms. #include <stdio.h> #include <string.h> #define False 0 #define True 1 #def ...

  7. Unity Layout碰撞检测

    第一次看到LayerMask根本不知道是什么东东,后来问问度娘,看了几篇文章,终于看明白一点点,在网上看到各路大神的解释,终于明白了,LayerMask实际上是一个位码操作,在Unity3d中Laye ...

  8. python 如何在一个for循环中遍历两个列表

    是我在看<笨方法学python>过程中发现有一行代码看不懂--" for sentence in snippet, phrase:",所以研究了半天,感觉挺有收获的.所 ...

  9. Hibernate 连接访问多个数据库(含访问不同数据库的相同表)(转)

    利用hibernate访问不同数据库中的不同表或不同数据库中的相同表. 本人在开发过程中的解决方案,希望大家交流.一般用myEclipse工具会自动生成Hibernate的相关文件,大致有下面几类: ...

  10. 基于pandas python的美团某商家的评论销售(数据分析)

    数据初步的分析 本文是该系列的第一篇 数据清洗 数据初步的统计 第二篇 数据可视化 第三篇 数据中的评论数据用于自然语言处理 from pyecharts import Bar,Pie import ...