dnet-hadoop/dhp-workflows/dhp-aggregation/src/main/java/eu/dnetlib/dhp/actionmanager/project/SparkAtomicActionJob.java


package eu.dnetlib.dhp.actionmanager.project;

import static eu.dnetlib.dhp.common.SparkSessionSupport.runWithSparkSession;

import java.util.Arrays;
import java.util.HashMap;
import java.util.Objects;
import java.util.Optional;

import org.apache.commons.io.IOUtils;
import org.apache.commons.lang3.StringUtils;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapred.SequenceFileOutputFormat;
import org.apache.spark.SparkConf;
import org.apache.spark.api.java.function.MapFunction;
import org.apache.spark.api.java.function.MapGroupsFunction;
import org.apache.spark.sql.Dataset;
import org.apache.spark.sql.Encoders;
import org.apache.spark.sql.SparkSession;
import org.slf4j.Logger;
import org.slf4j.LoggerFactory;

import com.fasterxml.jackson.databind.ObjectMapper;

import eu.dnetlib.dhp.actionmanager.project.utils.CSVProgramme;
import eu.dnetlib.dhp.actionmanager.project.utils.CSVProject;
import eu.dnetlib.dhp.actionmanager.project.utils.EXCELTopic;
import eu.dnetlib.dhp.application.ArgumentApplicationParser;
import eu.dnetlib.dhp.common.HdfsSupport;
import eu.dnetlib.dhp.schema.action.AtomicAction;
import eu.dnetlib.dhp.schema.common.ModelSupport;
import eu.dnetlib.dhp.schema.oaf.H2020Classification;
import eu.dnetlib.dhp.schema.oaf.H2020Programme;
import eu.dnetlib.dhp.schema.oaf.Project;
import eu.dnetlib.dhp.utils.DHPUtils;
import scala.Tuple2;

public class SparkAtomicActionJob {
	private static final Logger log = LoggerFactory.getLogger(SparkAtomicActionJob.class);
	private static final ObjectMapper OBJECT_MAPPER = new ObjectMapper();
	private static final HashMap<String, String> programmeMap = new HashMap<>();

	public static void main(String[] args) throws Exception {

		String jsonConfiguration = IOUtils
			.toString(
				SparkAtomicActionJob.class
					.getResourceAsStream(
						"/eu/dnetlib/dhp/actionmanager/project/action_set_parameters.json"));

		final ArgumentApplicationParser parser = new ArgumentApplicationParser(jsonConfiguration);

		parser.parseArgument(args);

		Boolean isSparkSessionManaged = Optional
			.ofNullable(parser.get("isSparkSessionManaged"))
			.map(Boolean::valueOf)
			.orElse(Boolean.TRUE);

		log.info("isSparkSessionManaged: {}", isSparkSessionManaged);

		String projectPath = parser.get("projectPath");
		log.info("projectPath: {}", projectPath);

		final String outputPath = parser.get("outputPath");
		log.info("outputPath {}: ", outputPath);

		final String programmePath = parser.get("programmePath");
		log.info("programmePath {}: ", programmePath);

		final String topicPath = parser.get("topicPath");
		log.info("topic path {}: ", topicPath);

		SparkConf conf = new SparkConf();

		runWithSparkSession(
			conf,
			isSparkSessionManaged,
			spark -> {
				removeOutputDir(spark, outputPath);
				getAtomicActions(
					spark,
					projectPath,
					programmePath,
					topicPath,
					outputPath);
			});
	}

	private static void removeOutputDir(SparkSession spark, String path) {
		HdfsSupport.remove(path, spark.sparkContext().hadoopConfiguration());
	}

	private static void getAtomicActions(SparkSession spark, String projectPatH,
		String programmePath,
		String topicPath,
		String outputPath) {

		Dataset<CSVProject> project = readPath(spark, projectPatH, CSVProject.class);
		Dataset<CSVProgramme> programme = readPath(spark, programmePath, CSVProgramme.class);
		Dataset<EXCELTopic> topic = readPath(spark, topicPath, EXCELTopic.class);

		project
			.joinWith(programme, project.col("programme").equalTo(programme.col("code")), "left")
			.joinWith(topic, project.col("topics").equalTo(topic.col("code")), "left")
			.map((MapFunction<Tuple2<Tuple2<CSVProject, CSVProgramme>, EXCELTopic>, Project>) c -> {
				Tuple2<CSVProject, CSVProgramme> projectprogramme = c._1();
				CSVProject csvProject = projectprogramme._1();
				Optional<CSVProgramme> ocsvProgramme = Optional.ofNullable(projectprogramme._2());

				String topicdescription = Optional
					.ofNullable(c._2())
					.map(t -> t.getTitle())
					.orElse(null);

				Project p = Optional
					.ofNullable(projectprogramme._2())
					.map(csvProgramme -> {
						Project pp = new Project();
						pp
							.setId(
								createOpenaireId(
									ModelSupport.entityIdPrefix.get("project"),
									"corda__h2020", csvProject.getId()));
						pp.setH2020topiccode(csvProject.getTopics());
						H2020Programme pm = new H2020Programme();
						H2020Classification h2020classification = new H2020Classification();
						pm.setCode(csvProject.getProgramme());
						if (StringUtils.isNotEmpty(csvProgramme.getShortTitle())) {
							pm.setDescription(csvProgramme.getShortTitle());
						} else {
							pm.setDescription(csvProgramme.getTitle());
						}
						h2020classification.setClassification(ocsvProgramme.get().getClassification());
						setLevels(h2020classification, ocsvProgramme.get().getClassification());
						h2020classification.setH2020Programme(pm);
						pp.setH2020classification(Arrays.asList(h2020classification));
						if (topicdescription != null) {
							pp.setH2020topicdescription(topicdescription);
						}
						return pp;
					})
					.orElse(null);

				return p;
			}, Encoders.bean(Project.class))
			.filter(Objects::nonNull)
			.groupByKey(
				(MapFunction<Project, String>) p -> p.getId(),
				Encoders.STRING())
			.mapGroups((MapGroupsFunction<String, Project, Project>) (s, it) -> {
				Project first = it.next();
				it.forEachRemaining(p -> {
					first.mergeFrom(p);
				});
				return first;
			}, Encoders.bean(Project.class))
			.toJavaRDD()
			.map(p -> new AtomicAction(Project.class, p))
			.mapToPair(
				aa -> new Tuple2<>(new Text(aa.getClazz().getCanonicalName()),
					new Text(OBJECT_MAPPER.writeValueAsString(aa))))
			.saveAsHadoopFile(outputPath, Text.class, Text.class, SequenceFileOutputFormat.class);

	}

	private static void setLevels(H2020Classification h2020Classification, String classification) {
		String[] tmp = classification.split(" \\| ");
		h2020Classification.setLevel1(tmp[0]);
		if (tmp.length > 1) {
			h2020Classification.setLevel2(tmp[1]);
		}
		if (tmp.length > 2) {
			h2020Classification.setLevel3(tmp[2]);
		}
	}

	public static <R> Dataset<R> readPath(
		SparkSession spark, String inputPath, Class<R> clazz) {
		return spark
			.read()
			.textFile(inputPath)
			.map((MapFunction<String, R>) value -> OBJECT_MAPPER.readValue(value, clazz), Encoders.bean(clazz));
	}

	public static String createOpenaireId(
		final String prefix, final String nsPrefix, final String id) {

		return String.format("%s|%s::%s", prefix, nsPrefix, DHPUtils.md5(id));

	}
}
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00
			`package eu.dnetlib.dhp.actionmanager.project;`

			`import static eu.dnetlib.dhp.common.SparkSessionSupport.runWithSparkSession;`

added preparation classes 2020-05-19 18:42:50 +02:00			`import java.util.Arrays;`
			`import java.util.HashMap;`
added groupBy before creating Actions 2020-05-28 10:00:45 +02:00			`import java.util.Objects;`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`import java.util.Optional;`

			`import org.apache.commons.io.IOUtils;`
modification to the classes building the actionset to consider the h2020classification 2020-09-23 17:31:15 +02:00			`import org.apache.commons.lang3.StringUtils;`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`import org.apache.hadoop.io.Text;`
			`import org.apache.hadoop.mapred.SequenceFileOutputFormat;`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`import org.apache.spark.SparkConf;`
added preparation classes 2020-05-19 18:42:50 +02:00			`import org.apache.spark.api.java.function.MapFunction;`
added groupBy before creating Actions 2020-05-28 10:00:45 +02:00			`import org.apache.spark.api.java.function.MapGroupsFunction;`
added preparation classes 2020-05-19 18:42:50 +02:00			`import org.apache.spark.sql.Dataset;`
			`import org.apache.spark.sql.Encoders;`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`import org.apache.spark.sql.SparkSession;`
			`import org.slf4j.Logger;`
			`import org.slf4j.LoggerFactory;`

			`import com.fasterxml.jackson.databind.ObjectMapper;`

changed the implementation of Atomic Actions creation by exploiting the topic information get from the cordis excel file 2020-09-28 12:16:34 +02:00			`import eu.dnetlib.dhp.actionmanager.project.utils.CSVProgramme;`
			`import eu.dnetlib.dhp.actionmanager.project.utils.CSVProject;`
			`import eu.dnetlib.dhp.actionmanager.project.utils.EXCELTopic;`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`import eu.dnetlib.dhp.application.ArgumentApplicationParser;`
			`import eu.dnetlib.dhp.common.HdfsSupport;`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`import eu.dnetlib.dhp.schema.action.AtomicAction;`
added preparation classes 2020-05-19 18:42:50 +02:00			`import eu.dnetlib.dhp.schema.common.ModelSupport;`
modification to the classes building the actionset to consider the h2020classification 2020-09-23 17:31:15 +02:00			`import eu.dnetlib.dhp.schema.oaf.H2020Classification;`
			`import eu.dnetlib.dhp.schema.oaf.H2020Programme;`
added preparation classes 2020-05-19 18:42:50 +02:00			`import eu.dnetlib.dhp.schema.oaf.Project;`
			`import eu.dnetlib.dhp.utils.DHPUtils;`
generate action sets and saves them in the hdfs path for the actions sets 2020-05-21 16:30:39 +02:00			`import scala.Tuple2;`

added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`public class SparkAtomicActionJob {`
			`private static final Logger log = LoggerFactory.getLogger(SparkAtomicActionJob.class);`
			`private static final ObjectMapper OBJECT_MAPPER = new ObjectMapper();`
added preparation classes 2020-05-19 18:42:50 +02:00			`private static final HashMap<String, String> programmeMap = new HashMap<>();`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00
			`public static void main(String[] args) throws Exception {`

			`String jsonConfiguration = IOUtils`
			`.toString(`
			`SparkAtomicActionJob.class`
			`.getResourceAsStream(`
			`"/eu/dnetlib/dhp/actionmanager/project/action_set_parameters.json"));`

			`final ArgumentApplicationParser parser = new ArgumentApplicationParser(jsonConfiguration);`

			`parser.parseArgument(args);`

			`Boolean isSparkSessionManaged = Optional`
			`.ofNullable(parser.get("isSparkSessionManaged"))`
			`.map(Boolean::valueOf)`
			`.orElse(Boolean.TRUE);`

			`log.info("isSparkSessionManaged: {}", isSparkSessionManaged);`

			`String projectPath = parser.get("projectPath");`
			`log.info("projectPath: {}", projectPath);`

			`final String outputPath = parser.get("outputPath");`
			`log.info("outputPath {}: ", outputPath);`

			`final String programmePath = parser.get("programmePath");`
			`log.info("programmePath {}: ", programmePath);`

changed the implementation of Atomic Actions creation by exploiting the topic information get from the cordis excel file 2020-09-28 12:16:34 +02:00			`final String topicPath = parser.get("topicPath");`
			`log.info("topic path {}: ", topicPath);`

added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`SparkConf conf = new SparkConf();`

			`runWithSparkSession(`
			`conf,`
			`isSparkSessionManaged,`
			`spark -> {`
			`removeOutputDir(spark, outputPath);`
			`getAtomicActions(`
			`spark,`
			`projectPath,`
			`programmePath,`
changed the implementation of Atomic Actions creation by exploiting the topic information get from the cordis excel file 2020-09-28 12:16:34 +02:00			`topicPath,`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`outputPath);`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`});`
			`}`

			`private static void removeOutputDir(SparkSession spark, String path) {`
			`HdfsSupport.remove(path, spark.sparkContext().hadoopConfiguration());`
			`}`

added preparation classes 2020-05-19 18:42:50 +02:00			`private static void getAtomicActions(SparkSession spark, String projectPatH,`
			`String programmePath,`
changed the implementation of Atomic Actions creation by exploiting the topic information get from the cordis excel file 2020-09-28 12:16:34 +02:00			`String topicPath,`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`String outputPath) {`
added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00
added preparation classes 2020-05-19 18:42:50 +02:00			`Dataset<CSVProject> project = readPath(spark, projectPatH, CSVProject.class);`
			`Dataset<CSVProgramme> programme = readPath(spark, programmePath, CSVProgramme.class);`
changed the implementation of Atomic Actions creation by exploiting the topic information get from the cordis excel file 2020-09-28 12:16:34 +02:00			`Dataset<EXCELTopic> topic = readPath(spark, topicPath, EXCELTopic.class);`
added preparation classes 2020-05-19 18:42:50 +02:00
			`project`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`.joinWith(programme, project.col("programme").equalTo(programme.col("code")), "left")`
changed the implementation of Atomic Actions creation by exploiting the topic information get from the cordis excel file 2020-09-28 12:16:34 +02:00			`.joinWith(topic, project.col("topics").equalTo(topic.col("code")), "left")`
			`.map((MapFunction<Tuple2<Tuple2<CSVProject, CSVProgramme>, EXCELTopic>, Project>) c -> {`
			`Tuple2<CSVProject, CSVProgramme> projectprogramme = c._1();`
			`CSVProject csvProject = projectprogramme._1();`
			`Optional<CSVProgramme> ocsvProgramme = Optional.ofNullable(projectprogramme._2());`

			`String topicdescription = Optional`
			`.ofNullable(c._2())`
			`.map(t -> t.getTitle())`
			`.orElse(null);`

			`Project p = Optional`
			`.ofNullable(projectprogramme._2())`
			`.map(csvProgramme -> {`
			`Project pp = new Project();`
			`pp`
			`.setId(`
			`createOpenaireId(`
			`ModelSupport.entityIdPrefix.get("project"),`
			`"corda__h2020", csvProject.getId()));`
			`pp.setH2020topiccode(csvProject.getTopics());`
			`H2020Programme pm = new H2020Programme();`
			`H2020Classification h2020classification = new H2020Classification();`
			`pm.setCode(csvProject.getProgramme());`
			`if (StringUtils.isNotEmpty(csvProgramme.getShortTitle())) {`
			`pm.setDescription(csvProgramme.getShortTitle());`
			`} else {`
			`pm.setDescription(csvProgramme.getTitle());`
			`}`
			`h2020classification.setClassification(ocsvProgramme.get().getClassification());`
			`setLevels(h2020classification, ocsvProgramme.get().getClassification());`
			`h2020classification.setH2020Programme(pm);`
			`pp.setH2020classification(Arrays.asList(h2020classification));`
			`if (topicdescription != null) {`
			`pp.setH2020topicdescription(topicdescription);`
			`}`
			`return pp;`
			`})`
			`.orElse(null);`

			`return p;`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`}, Encoders.bean(Project.class))`
added groupBy before creating Actions 2020-05-28 10:00:45 +02:00			`.filter(Objects::nonNull)`
			`.groupByKey(`
			`(MapFunction<Project, String>) p -> p.getId(),`
			`Encoders.STRING())`
			`.mapGroups((MapGroupsFunction<String, Project, Project>) (s, it) -> {`
			`Project first = it.next();`
			`it.forEachRemaining(p -> {`
			`first.mergeFrom(p);`
			`});`
			`return first;`
			`}, Encoders.bean(Project.class))`
produces AtomicActions instead of Projects 2020-05-22 15:26:57 +02:00			`.toJavaRDD()`
			`.map(p -> new AtomicAction(Project.class, p))`
			`.mapToPair(`
			`aa -> new Tuple2<>(new Text(aa.getClazz().getCanonicalName()),`
			`new Text(OBJECT_MAPPER.writeValueAsString(aa))))`
			`.saveAsHadoopFile(outputPath, Text.class, Text.class, SequenceFileOutputFormat.class);`
generate action sets and saves them in the hdfs path for the actions sets 2020-05-21 16:30:39 +02:00
added preparation classes 2020-05-19 18:42:50 +02:00			`}`

modification to the classes building the actionset to consider the h2020classification 2020-09-23 17:31:15 +02:00			`private static void setLevels(H2020Classification h2020Classification, String classification) {`
fixed issue and changed the transformation of the programme file to consider the new model 2020-09-25 13:32:34 +02:00			`String[] tmp = classification.split(" \\\| ");`
modification to the classes building the actionset to consider the h2020classification 2020-09-23 17:31:15 +02:00			`h2020Classification.setLevel1(tmp[0]);`
			`if (tmp.length > 1) {`
			`h2020Classification.setLevel2(tmp[1]);`
			`}`
			`if (tmp.length > 2) {`
			`h2020Classification.setLevel3(tmp[2]);`
			`}`
			`}`

added preparation classes 2020-05-19 18:42:50 +02:00			`public static <R> Dataset<R> readPath(`
			`SparkSession spark, String inputPath, Class<R> clazz) {`
			`return spark`
			`.read()`
			`.textFile(inputPath)`
			`.map((MapFunction<String, R>) value -> OBJECT_MAPPER.readValue(value, clazz), Encoders.bean(clazz));`
			`}`

			`public static String createOpenaireId(`
			`final String prefix, final String nsPrefix, final String id) {`

			`return String.format("%s\|%s::%s", prefix, nsPrefix, DHPUtils.md5(id));`

added dnet-45 HttpConnector and related Classes, produced the POJO for projects and programme 2020-05-18 13:04:06 +02:00			`}`
			`}`