Tutoriels rdd

8 tutoriels en accès libre sur rdd : guides techniques, sans compte.

foldByKey, aggregateByKey et combineByKey en Spark

reduceByKey impose le même type en entrée et en sortie, ce qui rend une moyenne impossible. Les trois agrégateurs qui lèvent cette contrainte.

6 minsparkscalarddaggregatebykeycombinebykeybig-data

coalesce vs repartition en Spark, démontré avec glom()

Deux méthodes au même argument, deux travaux différents. Démonstration avec glom(), le piège du coalesce(7) qui reste à 5, et la règle pour choisir.

7 minsparkscalarddpartitionscoalescerepartitionbig-data

RDD, List Scala ou table SQL : ce que « distribué » change

Un RDD n’est pas une table, ni une List plus grosse. Ce que le distribué retire (index, évaluation immédiate), et en quoi Spark SQL diffère du SQL.

7 minsparkscalarddspark-sqlbig-data

defaultParallelism : combien de cœurs Spark utilise-t-il ?

Spark déduit le nombre de partitions des cœurs qu’il croit avoir. Le code pour afficher ce chiffre, d’où il vient, et le piège des deux réglages.

6 minsparkscalarddpartitionsdefaultparallelismbig-data

groupBy, groupByKey, reduceByKey et sortByKey en Spark

Quatre opérations qui se ressemblent et un choix qui change la facture cloud. Pourquoi reduceByKey bat groupByKey, et les pièges du tri de clés.

7 minsparkscalarddgroupbyreducebykeybig-data

Pourquoi 100 partitions ne font pas 100 processeurs

Une partition est une tâche potentielle, pas un cœur. L’exécution par vagues, et comment inspecter les partitions avec mapPartitionsWithIndex.

8 minsparkscalarddpartitionstachesbig-data

RDD, DataFrame ou Dataset : lequel choisir en Spark

Trois API pour le même moteur, mais un seul optimiseur les comprend. Pourquoi le DataFrame gagne presque toujours, et les trois cas où le RDD reste indispensable.

7 minsparkscalardddataframebig-data

Spark RDD par l’exemple : le word count en Scala

Le word count de Spark décortiqué ligne par ligne en Scala : flatMap, map, reduceByKey, saveAsTextFile sur un cas concret, avec les pièges classiques.

5 minsparkscalarddbig-data