我国正在建设创新型国家,软件创新创业的“互联网+”模式已成为新兴战略产业的重要形态。互联网软件开发呈现边界开放、群体分散、交付频繁、知识复杂等特征,同时具有全生命周期数据,形成了规模巨大、碎片分散、快速膨胀的软件数据。如何建立多源异质、广泛关联、语义丰富、覆盖全面的软件大数据环境,分析提炼软件知识,以提升软件开发智能化程度已成为重要科学问题。
本项目重点研究软件大数据汇聚组织、知识表示提炼、软件工具智能化和智能开发服务环境等关键技术,目标在于建立基于大数据的软件智能化开发技术体系,研发关键性的软件智能化开发工具,形成“人-工具-数据”融合的软件智能化开发环境,构建软件智能化开发云平台,面向万众创新的社会需求,运行服务大众的公共服务平台,面向企业创新能力提升,提供智能化的企业软件开发环境。

项目的研究内容归结为2 项共性基础技术、4 项关键技术和1 项总体技术:(1)共性基础技术包括软件大数据汇聚方法与技术和软件知识提炼方法与技术;(2)围绕软件开发的主要活动,从软件构造、测试验证、智能协作和运维演化4 个方面分别研究软件智能化开发技术,研发相应的软件工具;(3)总体技术方面,以云服务集成和软件大数据融合为目标,研究集成框架和机制,形成软件智能化开发云平台,面向大众服务和大型企业需求,分别构建公共服务平台和企业开发环境。
项目研究方案为“问题导向、数据汇聚、知识提炼、智能释放”,综合运用大数据和智能化技术实现软件开发方法和工具的智能化变革;融合国际主流工具和技术框架,关注于研究和实现“智能化机制”:
(1)以“主动感知、定向采集、多源关联、增量检测”机制构建自生长的软件大数据环境,拟采用基于云架构的混合型软件大数据存储与管理框架,通过数据分布式存储和并发查询提高访问效率;
(2)为实现领域分析、模型分析、程序理解、编码、测试、部署等不同软件开发任务中的智能化支持,拟采用知识图谱、经验案例、分类器、规则、模板与模式等多种知识表示方式,综合应用程序分析、自然语言处理、数据挖掘、信息检索等技术实现知识抽取;
(3)选择4 类开发活动中重要的关键支撑点,有针对性地确定数据、知识抽取、智能推荐和问答所需的技术、方法,研发相应的智能化工具;
(4)采取轻量级虚拟容器技术构建可扩展的工具运行支撑框架,并利用容器编排技术构建工具池运行管理机制;
(5)基于以分布式软件仓库为核心的工具集成框架构建智能开发工具环境,并采取多承租架构实现软件智能化开发工具的个性化数据管理。
项目研究团队由国内主要的软件工程学术研究单位和大型软件企业组成,形成“产学研”合作联合体,团队各成员单位持续在软件开发技术和支撑环境方面开展深入的技术研究和密切的产业实践合作,形成了良好的社会和经济效益。前期合作的成果获得了1 项国家技术发明二等奖和2项省部级一等奖,研发并运行提供服务的互联网软件开发服务平台(www.trustie.net)积累了大量的数据。
如题,当收到博客回复的消息通知时,点击进入查看
消息机制刷新后,仍然是未读状态,小铃铛的数字也没有更新
1、南京大学
2、湘潭大学
请通过网络找到这两个大学官方网站的链接
静态页面如附件所示导入的在线测验,在列表页点击“发布”,提示没有设置日期,不能发布
然后进入该测验的编辑状态,什么信息都没有进行修改,点击提交,却提示“发布成功”
然后这个测验相关的用户登录就报500的错误。
只有管理员自己才可以看到更换管理员按钮
注意:更换成功后,应该给新的管理员推送一条微信消息(已有,直接使用即可):
1.上午教辅
2.Openhub重新抽取后,汇总出现问题,主要是因为存储url_md5的表格没有和gather_projects表同步,导致删除gather_projects中来自openhub的数据重新汇总后,插入失败。下午已修补好(暂时性的),之后程序结构还要优化一下。
3.目前进入去重阶段的取项目别名,估计凌晨可以取完。
今天检查了一下各站点的各字段抽取规则,发现sourceforge的主页抽取规则也有些小问题,已做修复,并进行了测试,暂未发现新的问题。
对于抽取openhub中多homepage项目时,爬取页面可能出现的网络连接相关错误,初步的应对思路是对失败情况进行存库,以便后续重复尝试。(但是这部分的完成还面临很多问题,需要再深入研究下)
另外,晚上获悉爬虫服务器上的爬虫程序莫名停了。。。重新把爬虫运行了起来,不过爬虫运行有点复杂笨重,后续需要持续关注其运行状态才行。
1.部署情况:
openhub的更新抽取完成,现在在跑汇总程序,明早应该可以完成。
2.梳理去重、筛选、匹配的open_source_projects的数据处理流程,已更新代码至版本库见附件。